Contents — find the section you need

Una telecamera monoculare cattura la strada antistante con una singola lente e un singolo sensore di immagine, quindi utilizza l'elaborazione delle immagini per riconoscere le linee di corsia, la segnaletica, i semafori, i pedoni e i veicoli. A differenza del LiDAR o del radar, non emette attivamente onde radio o luce, ma riceve semplicemente la luce visibile riflessa; pertanto, la sua struttura è semplice e tende ad avere un vantaggio sia in termini di costi che di spazio di installazione. Nei sistemi ADAS (Advanced Driver Assistance Systems) per veicoli a guida autonoma, è uno dei sensori più diffusi, utilizzato per l'avviso di superamento della corsia, il sistema di mantenimento della corsia (LKA) e il cruise control adattivo (ACC) basato esclusivamente sulla visione.

Una telecamera del sistema Mobileye montata su un parabrezzaTelecamera Mobileye montata sul finestrino (fotografata nel 2017)

Immagine: Car telecamera per finestrino del sistema Mobileye (Ranbar, CC BY-SA 4.0), Wikimedia Commons. Questa non è l'ultima telecamera basata su EyeQ6L di cui si parla nel testo, ma un esempio di un modello precedente.

Principio: una singola immagine non ha una "scala assoluta"

Il più grande punto debole di una telecamera monoculare è che una singola immagine da sola non può, in linea di principio, determinare la distanza assoluta (scala reale) di un oggetto. Una fotocamera può essere approssimata con il modello della fotocamera a foro stenopeico: un punto (X, Y, Z) nello spazio 3D viene proiettato su un punto (x, y) sul piano immagine, tramite la lunghezza focale f, come

x = f \frac{X}{Z}, \qquad y = f \frac{Y}{Z}

Come mostra questa equazione, tutto ciò che si può ricavare dalle coordinate dell'immagine (x, y) è il rapporto tra le coordinate reali (X, Y, Z) normalizzate per la profondità Z — la profondità Z stessa non può essere calcolata a ritroso da una singola immagine. Due oggetti che appaiono della stessa dimensione nell'immagine potrebbero essere un oggetto piccolo vicino o uno grande lontano, e questa equazione da sola non è in grado di distinguerli. Questo è in netto contrasto con una fotocamera stereoscopica, che può calcolare Z direttamente tramite triangolazione a partire dalla disparità tra due lenti.

Immagine: Pinhole geometria del modello di fotocamera (KYN, CC0 1.0 dominio pubblico), Wikimedia Commons.

Per ovviare a questa limitazione, i sistemi basati su fotocamere monoculari stimano la distanza utilizzando una sorta di "riferimento noto". Una tecnica rappresentativa, utilizzata da Mobileye, è la geometria a vista singola tramite mappatura prospettica inversa (IPM): presuppone che la superficie stradale sia piana e utilizza un oggetto di dimensioni reali note, ad esempio la larghezza di una corsia, come riferimento, calcolando a ritroso la distanza effettiva dalla posizione nell'immagine (brevetto correlato: US8164628B2). Altre tecniche includono la stima della distanza a partire dalle dimensioni apparenti di un oggetto (le tipiche dimensioni reali di un veicolo o di un pedone) e la stima della distanza e della velocità a partire dal movimento tra fotogrammi consecutivi (flusso ottico). Poiché tutte queste tecniche si basano su ipotesi, l'errore tende ad aumentare quando la superficie stradale è inclinata o quando le dimensioni di un oggetto si discostano da quelle ipotizzate.

Negli ultimi anni, la ricerca sulla "stima della profondità monoculare" (MDE), che utilizza il deep learning per colmare direttamente questo divario, ha compiuto rapidi progressi. Mentre i metodi precedenti potevano fornire solo una stima della profondità relativa (ordinamento vicino-lontano), un articolo di ricerca del 2025, incentrato specificamente sulla stima della profondità monoculare "metrica", che fornisce una stima della distanza assoluta in metri reali (arXiv:2501.11841), è stato pubblicato nel 2025: un segno che superare la debolezza fondamentale della visione monoculare con una rete neurale è ora un campo di battaglia primario per la ricerca.

Confronto delle specifiche chiave dei prodotti

Prodotto Risoluzione Campo visivo (FOV) Note
Mobileye EyeQ6L (EyeQ6 Lite) 8 megapixel 120 gradi 20 gradi più ampio rispetto alla fotocamera di EyeQ4M. Prestazioni di elaborazione circa 4,5 volte superiori a quelle di EyeQ4M, con circa metà della superficie del chip
Fotocamera Tesla HW4 5 megapixel Notevolmente più ampio di HW3 (1,2 MP) - cifra esatta non divulgata Un importante aggiornamento da 1,2 MP a 5 MP rispetto all'HW3. La fotocamera posteriore offre un effetto fisheye più pronunciato e un angolo di visione più ampio

Continental MFC500 (MFC525/MFC526) | Fino a 8 megapixel | Fino a 125 gradi | Una piattaforma modulare e scalabile per la fotocamera, dove l'elaborazione del riconoscimento può essere eseguita all'interno della fotocamera stessa o in un'unità di controllo integrata (ADCU) esterna |

comma.ai openpilot (comma 4) | (dispositivo aggiuntivo aftermarket, fotocamera monoculare + SoC dedicato) | — | Un kit aftermarket da 999 dollari che aggiunge il livello 2 di assistenza alla guida ai veicoli di serie. Una singola rete neurale end-to-end, "Supercombo", prevede la traiettoria futura del veicolo direttamente dall'immagine monoculare |

Sensore di immagine Sony IMX490 | Circa 8,8 megapixel | (solo sensore, indipendente dall'obiettivo) | Un sensore CMOS di livello automotive con un'ampia gamma dinamica di 150 dB e mitigazione dello sfarfallio dei LED, utilizzato come componente comune nei moduli telecamera di Mobileye, Continental e altri.

L'EyeQ6L di Mobileye è un SoC (System on Chip) ADAS annunciato nel 2024, fornito più come un kit "telecamera + chip di elaborazione" che come telecamera monoculare autonoma. La sua risoluzione di 8 MP e l'ampio campo visivo di 120 gradi consentono funzioni di mantenimento della corsia e cambio di corsia automatico che rilevano non solo la corsia corrente, ma anche le due corsie centrali adiacenti. Tesla HW4 è la generazione hardware lanciata nel 2023, un notevole salto di risoluzione da 1,2 MP a 5 MP dell'HW3 che migliora la precisione del riconoscimento di segnali stradali e targhe. Continental MFC500 si distingue per la sua flessibilità: il motore di elaborazione del riconoscimento può essere integrato nel corpo della telecamera o in un'unità esterna, e la famiglia si estende fino al modello MFC526, orientato ai camion. OpenPilot di comma.ai è l'eccezione, l'unico prodotto qui presentato che è un accessorio aftermarket piuttosto che un sistema di serie di una casa automobilistica, e utilizza una rete neurale end-to-end, "Supercombo", che prevede la traiettoria futura del veicolo direttamente dall'immagine monoculare.

Da un laboratorio dell'Università Ebraica a Mobileye, e la "cancellazione" del radar da parte di Tesla

Da un laboratorio dell'Università Ebraica a un'acquisizione da oltre 15 miliardi di dollari da parte di Intel — Mobileye è stata fondata nel 1999 da Amnon Shashua, ricercatore di visione artificiale presso l'Università Ebraica di Gerusalemme, insieme al dirigente Ziv Aviram. Prima di Mobileye, Shashua aveva partecipato alla fondazione di CogniTens (sistemi di misurazione ottica per il settore automobilistico e aerospaziale) e CogniTech (tecnologia di analisi video), e Mobileye è nata come estensione di quel lavoro, con l'obiettivo di portare un sistema di visione accessibile ai veicoli di massa. Il suo primo chip, l'EyeQ1, è stato commercializzato nel 2004, un decennio dopo la roadmap iniziale dell'azienda. Mobileye si è quotata al Nasdaq nel 2014 con una valutazione di circa 5,3 miliardi di dollari e nel 2017 Intel l'ha acquisita per 15,3 miliardi di dollari, all'epoca la più grande acquisizione tecnologica nella storia di Israele. È tornata al Nasdaq come società pubblica indipendente (sempre sotto il controllo di Intel) alla fine del 2022 e da allora si è espansa dai sistemi ADAS alla guida autonoma e all'"intelligenza artificiale fisica".

Il momento del 2021 in cui Tesla Vision ha "eliminato" il radar — A partire da maggio 2021, i veicoli Model 3 e Model Y nordamericani sono passati a una configurazione senza sensore radar, dando inizio alla transizione verso "Tesla Vision", che si basa esclusivamente su telecamere e sull'elaborazione tramite reti neurali. Andrej Karpathy, all'epoca responsabile dell'IA di Tesla, tenne un discorso di apertura al workshop sulla guida autonoma del CVPR 2021 (una delle principali conferenze sulla visione artificiale) nel giugno di quell'anno, affermando senza mezzi termini: "Abbiamo eliminato il radar e in queste auto la guida è affidata esclusivamente alla visione", spiegando che il sistema di visione basato sul deep learning di Tesla aveva raggiunto un livello di efficacia circa cento volte superiore a quello del radar che aveva sostituito. Aggiunse inoltre che "tutto ciò che accade, accade per la prima volta nell'auto, sulla base dei video provenienti dalle otto telecamere che la circondano", riconoscendo la difficoltà tecnica di un approccio basato esclusivamente sulla visione, ma sostenendo che, una volta collaudato, sarebbe diventato un sistema di visione generale utilizzabile ovunque sulla Terra. Anche i modelli Model 3/Y europei e mediorientali adottarono in seguito il sistema Tesla Vision senza radar: un caso emblematico di una casa automobilistica che sceglie deliberatamente un approccio basato su un singolo occhio (e su più telecamere) anziché sulla fusione di sensori.

Sistemi di assistenza alla guida monoculari aftermarket: comma.ai — Indipendentemente dai sistemi ADAS di serie di qualsiasi casa automobilistica, comma.ai, fondata da George Hotz (noto per aver sbloccato l'iPhone), vende OpenPilot, che aggiunge il mantenimento della corsia di livello 2 e il cruise control adattivo ai veicoli compatibili tramite un singolo dispositivo aftermarket da 999 dollari (il comma 3X/4) da montare sul parabrezza. Invece di una tradizionale pipeline di percezione modulare, utilizza una rete neurale end-to-end chiamata "Supercombo" che prevede la traiettoria futura del veicolo e la struttura stradale direttamente dal flusso video della telecamera monoculare. Essendo open source, è ampiamente utilizzato nelle comunità del fai-da-te e di ricerca.

Parametri che determinano le prestazioni

  • Risoluzione (numero di pixel): Determina direttamente la precisione del riconoscimento di segnali stradali distanti, semafori e piccoli ostacoli. Il salto di risoluzione di circa 4 volte dell'HW4 di Tesla rispetto all'HW3 era principalmente finalizzato a migliorare la visibilità di piccoli bersagli distanti. La risoluzione delle telecamere monoculari per autoveicoli continua a crescere di anno in anno, come dimostrano la Continental MFC500 e la Sony IMX490, entrambe arrivate a 8 megapixel.
  • Campo visivo (FOV): un FOV più ampio consente a una singola telecamera di coprire un contesto circostante più vasto, ad esempio pedoni che attraversano la strada e veicoli che si immettono agli incroci. La Mobileye EyeQ6L, con i suoi 120 gradi, 20 in più rispetto alla EyeQ4M, punta proprio a questo. La Continental MFC500 si spinge oltre, a 125 gradi, con l'obiettivo di rilevare veicoli provenienti da altre direzioni lateralmente agli incroci.
  • Gamma dinamica: determina se il riconoscimento funziona in scene con contrasto estremo, come ingressi/uscite di gallerie, abbagliamento dei fari e controluce di notte, senza bruciare le alte luci o schiacciare le ombre. La gamma dinamica di 150 dB del Sony IMX490 e la mitigazione dello sfarfallio dei LED (che sopprime lo sfarfallio dei semafori a LED) affrontano direttamente questa sfida.
  • Prerequisiti per la stima della distanza: Poiché le telecamere monoculari stimano la distanza basandosi su presupposti (superficie stradale piana, larghezza della corsia nota, dimensioni standard degli oggetti), l'errore tende ad aumentare su strade dissestate, pendii o ostacoli di dimensioni insolite. Le applicazioni che necessitano di una stima della distanza ad alta precisione in genere prevedono l'abbinamento con una telecamera stereo, un LiDAR o un radar, sebbene approcci come Tesla Vision cerchino di superare questo limite esclusivamente attraverso l'addestramento su larga scala delle reti neurali.
  • Costo e spazio di montaggio: La necessità di un solo obiettivo e sensore rende una telecamera monoculare più piccola ed economica da costruire rispetto a una telecamera stereo o di profondità, un vantaggio nella configurazione ristretta del parabrezza di un veicolo, dove più sensori competono per lo spazio. Il prezzo di 999 dollari di comma.ai è emblematico di questo vantaggio in termini di costi contenuti.
  • Prestazioni di elaborazione (lato SoC): l'utilità reale di una fotocamera monoculare dipende in larga misura dalla sofisticatezza dell'elaborazione dell'immagine acquisita. Le prestazioni di calcolo 4,5 volte superiori di EyeQ6L rispetto a EyeQ4M sono state pensate appositamente per migliorare la precisione del riconoscimento e il numero di caratteristiche supportate.

Verifica della distanza monoculare con un esempio numerico

Se la strada viene approssimata come un piano, con altezza della telecamera H, lunghezza focale f e offset in pixel y dall'orizzonte al punto di contatto di un oggetto, la relazione semplificata di prospettiva inversa è:

Z=\frac{fH}{y}

Per H=1.4\,\mathrm{m}, f=1200\,\mathrm{px} e y=84\,\mathrm{px}, si ottiene Z\simeq20\,\mathrm{m}. Con le stesse ipotesi, un errore di 2 pixel nel punto di contatto produce un errore di distanza di circa 0.48\,\mathrm{m} utilizzando l'approssimazione differenziale \sigma_Z\simeq fH\sigma_y/y^2. La pendenza della strada, l'orientamento della telecamera, l'altezza della corsia e un punto di contatto ambiguo aggiungono ulteriore errore.

Questo calcolo non esclude la stima della profondità monoculare neurale. Fornisce un riferimento per verificare un output appreso rispetto alla geometria stradale, alle dimensioni note dell'oggetto, alla stereoscopia o al radar. È consigliabile riportare i risultati dei test per banda di distanza, controluce, pendenza, pioggia, notte e altezza dell'oggetto, anziché un solo errore medio.

Diagram 1 · Use the button to switch views
Diagramma di misurazione della distanza monoculare su strada pianeggiante che mostra come un errore di due pixel nel punto di contatto aumenta a 10, 20 e 30 metri
Diagram 2 · Use the button to switch views
Z=fH/y: pixel offset shrinks with rangerange Zpixel offset from horizon ythe same 2px causes more range error
Diagramma: Duskcoil. Concettuale piuttosto che misurato; mostra la relazione inversa tra offset in pixel e distanza.
Verifica la tua comprensione
Un'immagine determina la distanza di un oggetto?

La scala è ambigua senza ulteriori ipotesi. Identifica se la stima utilizza dimensioni note, viste multiple o informazioni a priori apprese.

Riferimenti

What to read next

Review the backgroundCome funziona il LiDAR e i prodotti principali: Livox, Velodyne, HesaiContinue the seriesCome funzionano le telecamere stereo e i prodotti principali: ZED 2i, Subaru EyeSightExplore another aspect of this fieldAnalisi del log di un'IMU stazionaria: bias, dispersione e deviazione di Allan.