Contents — find the section you need

Une caméra monoculaire capture la route à l'aide d'un seul objectif et d'un seul capteur d'image, puis utilise le traitement d'image pour reconnaître les lignes de la voie, la signalisation, les feux de circulation, les piétons et les véhicules. Contrairement au LiDAR ou au radar, elle n'émet ni ondes radio ni lumière ; elle se contente de recevoir la lumière visible réfléchie. De ce fait, sa structure est simple et elle présente généralement l'avantage d'être moins coûteuse et moins encombrante. Dans les systèmes avancés d'aide à la conduite (ADAS) pour véhicules autonomes, c'est l'un des capteurs les plus répandus, utilisé notamment pour l'alerte de franchissement de ligne, l'assistance au maintien de voie (LKA) et le régulateur de vitesse adaptatif (ACC) basé sur la vision.

Caméra du système Mobileye montée sur un pare-briseCaméra Mobileye montée sur vitre (photo prise en 2017)

Image : Car caméra de vitre du système Mobileye" (Ranbar, CC BY-SA 4.0), Wikimedia Commons. Il ne s'agit pas de la dernière caméra basée sur EyeQ6L mentionnée dans le texte, mais d'un modèle antérieur.

Principe : une image unique n'a pas d'« échelle absolue »

Le principal défaut d'une caméra monoculaire est qu'une seule image ne peut pas, par principe, déterminer la distance absolue (échelle réelle) d'un objet. On peut approximer une caméra par le modèle de la caméra sténopé : un point (X, Y, Z) dans l’espace 3D se projette sur un point (x, y) du plan image, via la distance focale f, comme suit :

x = f \frac{X}{Z}, \qquad y = f \frac{Y}{Z}

Comme le montre cette équation, tout ce que l’on peut déduire des coordonnées de l’image (x, y) est le rapport des coordonnées réelles (X, Y, Z) normalisées par la profondeur Z — la profondeur Z elle-même ne peut être calculée à partir d’une seule image. Deux objets projetés à la même taille sur l’image peuvent être un petit objet proche ou un grand objet éloigné, et cette équation seule ne permet pas de les distinguer. Ceci contraste fortement avec une caméra stéréoscopique, qui peut calculer Z directement par triangulation à partir de la disparité entre deux lentilles.

Image : Pinhole géométrie du modèle de caméra (KYN, domaine public CC0 1.0), Wikimedia Commons.

Pour contourner cette contrainte, les systèmes à caméra monoculaire estiment la distance à l'aide d'une « référence connue ». Une technique représentative, utilisée par Mobileye, est la géométrie monovue par cartographie perspective inverse (IPM) : elle suppose que la surface de la route est plane et utilise un objet de taille réelle connue (par exemple, la largeur de la voie) comme référence, en calculant la distance réelle à partir de la position dans l'image (brevet associé : US8164628B2). D'autres techniques consistent à estimer la distance à partir de la taille apparente d'un objet (les dimensions réelles typiques d'un véhicule ou d'un piéton) et à estimer la distance et la vitesse à partir du mouvement sur plusieurs images consécutives (flux optique). Comme toutes ces techniques reposent sur des hypothèses, l'erreur tend à augmenter lorsque la chaussée est en pente ou lorsque la taille de l'objet s'écarte de l'estimation.

Ces dernières années, la recherche sur l'estimation de profondeur monoculaire (EDM), qui utilise l'apprentissage profond pour combler directement cette lacune, a progressé rapidement. Alors que les méthodes précédentes ne pouvaient fournir qu'une profondeur relative (classement proche-lointain), un article de synthèse de 2025, portant spécifiquement sur l'estimation de profondeur monoculaire « métrique » et fournissant une distance absolue en mètres (arXiv:2501.11841), a été publié la même année. Ceci témoigne du fait que la résolution des limitations fondamentales de l'estimation monoculaire grâce aux réseaux de neurones est devenue un axe de recherche majeur.

Comparaison des principales spécifications du produit

Produit Résolution Champ de vision (FOV) Remarques
Mobileye EyeQ6L (EyeQ6 Lite) 8 mégapixels 120 degrés 20 degrés de plus que la caméra de l'EyeQ4M. Performances de traitement environ 4,5 fois supérieures à celles de l'EyeQ4M, pour une surface de puce deux fois plus petite.
Caméra Tesla HW4 5 mégapixels Nettement plus large que la HW3 (1,2 MP) — chiffre exact non communiqué Une amélioration majeure par rapport à la HW3 (1,2 MP) à 5 MP. La caméra arrière offre un effet fisheye plus prononcé et un angle de vision plus large.
Continental MFC500 (MFC525/MFC526) Jusqu'à 8 mégapixels Jusqu'à 125 degrés Une plateforme de caméra modulaire et évolutive où le traitement de la reconnaissance peut être exécuté soit directement dans la caméra, soit dans une unité de contrôle intégrée (ADCU) externe.
comma.ai openpilot (comma 4) (Dispositif additionnel après-vente, caméra monoculaire + SoC dédié) — Un kit après-vente à 999 $ qui ajoute une assistance à la conduite de niveau 2 aux véhicules de série. Un réseau neuronal unique de bout en bout, « Supercombo », prédit la trajectoire future du véhicule directement à partir de l'image monoculaire.
Capteur d'image Sony IMX490 Environ 8,8 mégapixels (capteur seul, sans objectif) Un capteur CMOS de qualité automobile avec une large plage dynamique de 150 dB et une réduction du scintillement des LED, utilisé comme composant courant dans les modules de caméra de Mobileye, Continental et autres.

L'EyeQ6L de Mobileye est un SoC (système sur puce) ADAS annoncé en 2024, fourni davantage comme un ensemble « caméra + puce de traitement » que comme une caméra monoculaire autonome. Sa résolution de 8 mégapixels et son champ de vision de 120 degrés permettent le maintien dans la voie et le changement de voie automatique, détectant non seulement la voie actuelle, mais aussi le centre des deux voies adjacentes. La Tesla HW4, déployée à partir de 2023, représente un bond en avant significatif en termes de résolution, passant de 1,2 mégapixels (HW3) à 5 mégapixels, ce qui améliore la précision de la reconnaissance des panneaux et des plaques d'immatriculation. La MFC500 de Continental se distingue par sa flexibilité : son moteur de traitement de reconnaissance peut être intégré au boîtier de la caméra ou installé dans une unité externe. La gamme s'étend jusqu'au modèle MFC526, conçu pour les camions. Openpilot de comma.ai fait figure d'exception : seul produit présenté ici proposé comme module complémentaire et non comme système d'origine constructeur, il utilise un réseau neuronal de bout en bout, « Supercombo », qui prédit la trajectoire future du véhicule directement à partir de l'image monoculaire.

D'un laboratoire de l'Université hébraïque à Mobileye, et la « suppression » du radar par Tesla

D'un laboratoire de l'Université hébraïque à une acquisition par Intel pour plus de 15 milliards de dollars — Mobileye a été fondée en 1999 par Amnon Shashua, chercheur en vision par ordinateur à l'Université hébraïque de Jérusalem, et Ziv Aviram, cadre dirigeant. Avant Mobileye, Shashua avait participé à la création de CogniTens (systèmes de mesure optique pour l'automobile et l'aérospatiale) et de CogniTech (technologie d'analyse vidéo). Mobileye a été lancée dans le prolongement de ces travaux, avec pour objectif de proposer un système de vision abordable aux véhicules grand public. Sa première puce, l'EyeQ1, a été commercialisée en 2004, dix ans après le calendrier initial de l'entreprise. Mobileye a fait son entrée en bourse au Nasdaq en 2014, avec une valorisation d'environ 5,3 milliards de dollars. En 2017, Intel l'a rachetée pour 15,3 milliards de dollars, ce qui représentait à l'époque la plus importante acquisition technologique de l'histoire israélienne. Elle a fait son retour au Nasdaq en tant que société cotée indépendante (toujours sous l'égide d'Intel) fin 2022 et a depuis étendu ses activités des systèmes avancés d'aide à la conduite (ADAS) à la conduite autonome et à l'intelligence artificielle physique.

Le moment de 2021 où Tesla Vision a « supprimé » le radar — À partir de mai 2021, les Model 3 et Model Y nord-américaines sont passées à une configuration sans capteur radar, amorçant la transition vers « Tesla Vision », un système reposant exclusivement sur des caméras et le traitement par réseaux neuronaux. Andrej Karpathy, alors responsable de l'IA chez Tesla, a prononcé un discours d'ouverture lors de l'atelier sur la conduite autonome de la CVPR 2021 (une conférence majeure sur la vision par ordinateur) en juin de la même année. Il a déclaré sans ambages : « Nous avons supprimé le radar et ces voitures roulent désormais uniquement grâce à la vision », expliquant que le système de vision par apprentissage profond de Tesla était devenu environ cent fois plus performant que le radar qu'il remplaçait. Il a également déclaré : « Tout ce qui se passe dans la voiture se produit pour la première fois, grâce aux vidéos des huit caméras qui l'entourent. » Il a reconnu la difficulté technique d'une approche basée uniquement sur la vision, tout en affirmant qu'une fois fonctionnelle, cette technologie deviendrait un système de vision universel, déployable partout dans le monde. Les Model 3/Y européennes et moyen-orientales ont par la suite adopté le système Tesla Vision, sans radar — un exemple marquant de constructeur automobile ayant délibérément opté pour une approche monoculaire (et multicaméra) plutôt que pour la fusion de capteurs.

Assistance à la conduite monoculaire après-vente : comma.ai — Indépendant des systèmes ADAS d'origine des constructeurs automobiles, comma.ai, fondée par George Hotz, connu pour le jailbreak de l'iPhone, commercialise openpilot, qui ajoute l'assistance au maintien de voie de niveau 2 et le régulateur de vitesse adaptatif aux véhicules compatibles grâce à un unique dispositif après-vente à 999 $ (le comma 3X/4) fixé au pare-brise. Plutôt qu'un système de perception modulaire et traditionnel, il utilise un réseau neuronal de bout en bout appelé « Supercombo » qui prédit la trajectoire future du véhicule et l'état de la route directement à partir du flux vidéo de la caméra monoculaire. Étant donné qu'il est open source, il est largement utilisé dans les communautés de passionnés et de recherche.

Paramètres déterminant les performances

  • Résolution (nombre de pixels) : Détermine directement la précision de la reconnaissance des panneaux de signalisation, des feux de circulation et des petits obstacles éloignés. Le gain de résolution d'environ quatre fois du HW4 de Tesla par rapport au HW3 visait principalement à améliorer la visibilité des petites cibles éloignées. La résolution des caméras monoculaires automobiles continue de progresser d'année en année, comme en témoignent les MFC500 de Continental et IMX490 de Sony, qui atteignent toutes deux les 8 mégapixels.

  • Champ de vision (FOV) : Un champ de vision plus large permet à une seule caméra de couvrir un contexte plus étendu, par exemple les piétons traversant la route et les véhicules s'insérant aux intersections. L'EyeQ6L de Mobileye, avec son champ de vision de 120 degrés (20 degrés de plus que l'EyeQ4M), répond précisément à ce besoin. Le MFC500 de Continental va plus loin, avec un angle de vision de 125 degrés, conçu pour détecter les véhicules circulant latéralement aux intersections.

  • Plage dynamique : Détermine la fiabilité de la reconnaissance dans des scènes à contraste extrême (entrées/sorties de tunnels, éblouissement des phares et contre-jour nocturne) sans surexposer les hautes lumières ni écraser les ombres. La plage dynamique de 150 dB du Sony IMX490 et la réduction du scintillement des LED (qui atténue le scintillement des feux de signalisation à LED) répondent directement à ce besoin.

  • Conditions préalables à l’estimation des distances : Les caméras monoculaires estimant les distances à partir d’hypothèses (surface de la route plane, largeur de voie connue, dimensions standard des objets), l’erreur tend à augmenter sur les routes accidentées, les pentes ou en présence d’obstacles de dimensions inhabituelles. Les applications nécessitant une mesure de distance de haute précision supposent généralement l'utilisation d'une caméra stéréo, d'un LiDAR ou d'un radar. Cependant, des approches comme Tesla Vision tentent de s'affranchir de cette contrainte grâce à la puissance de l'entraînement des réseaux neuronaux.

  • Coût et encombrement : L'utilisation d'un seul objectif et d'un seul capteur rend une caméra monoculaire plus compacte et moins coûteuse à fabriquer qu'une caméra stéréo ou de profondeur. C'est un avantage considérable dans l'espace restreint du pare-brise d'un véhicule, où plusieurs capteurs se disputent la place. Le prix de 999 $ de comma.ai illustre parfaitement cet avantage en termes de coût.

  • Performances de traitement (côté SoC) : L'utilité concrète d'une caméra monoculaire dépend fortement de la sophistication du traitement de l'image capturée. Les performances de calcul 4,5 fois supérieures d'EyeQ6L par rapport à EyeQ4M visent spécifiquement à améliorer la précision de la reconnaissance et le nombre de caractéristiques prises en charge.

Vérification de la distance monoculaire avec un exemple numérique

Si la route est assimilée à un plan, avec une hauteur de caméra H, une distance focale f et un décalage en pixels y entre l'horizon et le point de contact de l'objet, une relation de perspective inverse simplifiée est :

Z=\frac{fH}{y}

Pour H=1.4\,\mathrm{m}, f=1200\,\mathrm{px} et y=84\,\mathrm{px}, on obtient Z\simeq20\,\mathrm{m}. Sous les mêmes hypothèses, une erreur de 2 pixels au niveau du point de contact entraîne une erreur de distance d'environ 0.48\,\mathrm{m} en utilisant l'approximation différentielle \sigma_Z\simeq fH\sigma_y/y^2. La pente de la route, l'angle de la caméra, la hauteur de la voie et un point de contact ambigu ajoutent des erreurs supplémentaires.

Ce calcul ne remet pas en cause l'estimation de profondeur monoculaire neuronale. Il sert de référence pour vérifier une sortie apprise par rapport à la géométrie de la route, aux dimensions connues de l'objet, à la stéréoscopie ou au radar. Il est recommandé de présenter les résultats des tests par bande de distance, contre-jour, pente, pluie, nuit et hauteur de l'objet, plutôt que de se contenter d'une erreur moyenne.

Diagram 1 · Use the button to switch views
Schéma de télémétrie monoculaire sur terrain plat montrant l'évolution de l'erreur de point de contact de deux pixels à 10, 20 et 30 mètres
Diagram 2 · Use the button to switch views
Z=fH/y: pixel offset shrinks with rangerange Zpixel offset from horizon ythe same 2px causes more range error
Diagramme : Duskcoil. Conceptuel plutôt que mesuré ; Elle illustre la relation inverse entre le décalage en pixels et la distance.
Vérifiez votre compréhension
Une image permet-elle de déterminer la distance d'un objet ?

L'échelle est ambiguë sans hypothèses supplémentaires. Indiquez si l'estimation utilise une taille connue, plusieurs vues ou des connaissances a priori.

## Références - [Lancement du Mobileye EyeQ6 Lite (Mobileye)](https://www.mobileye.com/news/mobileye-eyeq6-lite-launches-to-speed-adas-upgrades-worldwide/) - [Lancement du Mobileye EyeQ6 Lite (Business Wire)](https://www.businesswire.com/news/home/20240417952266/en/Mobileye-EyeQ6-Lite-Launches-to-Speed-ADAS-Upgrades-Worldwide) - [Comparaison des caméras Tesla HW3/HW4 (Application non Tesla)](https://www.notateslaapp.com/news/1564/tesla-s-hw3-and-hw4-cameras-comparing-the-differences-in-quality-and-hardware) - Brevet sur l'estimation de distance monoculaire : US8164628B2 - [Annonce de la plateforme de caméra Continental MFC500](https://www.continental.com/en/press/press-releases/mfc-500-camera-platform/) - [Page produit Continental MFC525 (AUMOVIO)](https://www.continental-automotive.com/en/components/cameras/multi-function-mono-camera-mfc525.html) - [Présentation du capteur Sony IMX490 (Sony Semiconductor Solutions)](https://www.sony-semicon.com/en/products/is/automotive/automotive.html) - [comma.ai openpilot Site officiel](https://comma.ai/openpilot) - Documentation OpenPilot](https://docs.comma.ai/) - Conduite autonome de niveau 2 sur un seul appareil (arXiv:2206.08176)](https://arxiv.org/pdf/2206.08176) - Historique de Mobileye (Wikipedia)](https://en.wikipedia.org/wiki/Mobileye) - Acquisition de Mobileye par Intel (15,3 milliards de dollars)](https://en.wikipedia.org/wiki/Mobileye) - Conférence d'Andrej Karpathy à CVPR 2021 (Ce n'est pas une application Tesla)](https://www.notateslaapp.com/tesla-interviews/512/andrej-karpathy-talks-about-how-tesla-is-solving-vision-in-autopilot-at-cvpr-2021) - Tesla supprime les capteurs radar (The Drive)](https://www.thedrive.com/tech/40794/tesla-removes-radar-sensors-from-model-3-and-model-y-so-autopilot-will-use-cameras-only) - Étude sur l'estimation de profondeur métrique monoculaire (arXiv:2501.11841)](https://arxiv.org/abs/2501.11841)

What to read next

Review the backgroundFonctionnement du LiDAR et principaux produits — Livox, Velodyne, HesaiContinue the seriesFonctionnement des caméras stéréo et principaux produits — ZED 2i, Subaru EyeSightExplore another aspect of this fieldLecture d'un enregistrement IMU stationnaire : biais, dispersion et écart d'Allan