Contents — find the section you need

Eine monokulare Kamera erfasst die Straße vor dem Fahrzeug mit einem einzigen Objektiv und einem einzigen Bildsensor. Anschließend nutzt sie Bildverarbeitung, um Fahrbahnmarkierungen, Verkehrszeichen, Ampeln, Fußgänger und Fahrzeuge zu erkennen. Im Gegensatz zu LiDAR oder Radar sendet sie keine Radiowellen oder Licht aus, sondern empfängt lediglich reflektiertes sichtbares Licht. Dadurch ist ihre Struktur einfach, und sie bietet in der Regel Vorteile hinsichtlich Kosten und Platzbedarf. In Fahrerassistenzsystemen (ADAS) für autonome Fahrzeuge ist sie einer der am weitesten verbreiteten Sensoren und wird für die Spurverlassenswarnung, den Spurhalteassistenten (LKA) und die rein visuelle adaptive Geschwindigkeitsregelung (ACC) eingesetzt.

Eine Mobileye-Systemkamera an der WindschutzscheibeMobileyes Fensterkamera (fotografiert 2017)

Bild: Car Fensterkamera des Mobileye-Systems (Ranbar, CC BY-SA 4.0), Wikimedia Commons. Dies ist nicht die neueste, im Text erwähnte EyeQ6L-basierte Kamera, sondern ein Beispiel eines älteren Modells.

Prinzip: Ein einzelnes Bild hat keinen „absoluten Maßstab“

Die größte Schwäche einer monokularen Kamera besteht darin, dass ein einzelnes Bild prinzipiell nicht die absolute Entfernung (den realen Maßstab) zu einem Objekt bestimmen kann. Eine Kamera lässt sich näherungsweise mit dem Lochkameramodell beschreiben: Ein Punkt (X, Y, Z) im dreidimensionalen Raum wird über die Brennweite f auf einen Punkt (x, y) in der Bildebene projiziert, wie folgt:

x = f \frac{X}{Z}, \qquad y = f \frac{Y}{Z}

Wie diese Gleichung zeigt, lässt sich aus den Bildkoordinaten (x, y) lediglich das Verhältnis der realen Koordinaten (X, Y, Z), normiert auf die Tiefe Z, bestimmen – die Tiefe Z selbst kann nicht allein aus einem einzelnen Bild zurückgerechnet werden. Zwei Objekte, die im Bild gleich groß erscheinen, könnten ein kleines, nahes oder ein großes, weit entferntes Objekt sein, und diese Gleichung allein kann sie nicht unterscheiden. Dies steht im direkten Gegensatz zu einer Stereokamera, die Z direkt durch Triangulation aus der Disparität zwischen zwei Linsen berechnen kann.

Bild: Pinhole Kameramodellgeometrie (KYN, CC0 1.0 Public Domain), Wikimedia Commons.

Um diese Einschränkung zu umgehen, schätzen Systeme mit monokularen Kameras die Entfernung mithilfe einer Art „bekannter Referenz“. Ein repräsentatives Verfahren, das von Mobileye verwendet wird, ist die Geometrie einer einzelnen Ansicht mittels inverser Perspektivabbildung (IPM): Dabei wird angenommen, dass die Straßenoberfläche eben ist, und ein Objekt mit bekannter realer Größe – beispielsweise die Fahrbahnbreite – dient als Referenz. Die tatsächliche Entfernung wird dann anhand der Position im Bild zurückgerechnet (zugehöriges Patent: US8164628B2). Weitere Techniken umfassen die Entfernungsschätzung anhand der scheinbaren Größe eines Objekts (den typischen Abmessungen eines Fahrzeugs oder Fußgängers in der realen Welt) sowie die Schätzung von Entfernung und Geschwindigkeit anhand der Bewegung in aufeinanderfolgenden Bildern (optischer Fluss). Da all diese Verfahren auf Annahmen beruhen, nimmt der Fehler tendenziell zu, wenn die Fahrbahn geneigt ist oder die Größe eines Objekts von den Annahmen abweicht.

In den letzten Jahren hat die Forschung zur „Monokularen Tiefenschätzung“ (MDE) – die Deep Learning nutzt, um diese Lücke direkt zu schließen – rasante Fortschritte gemacht. Während frühere Methoden nur relative Tiefen (Nah-Fern-Sortierung) ausgeben konnten, wurde 2025 eine Übersichtsarbeit speziell zur „metrischen“ monokularen Tiefenschätzung veröffentlicht, die absolute Entfernungen in Metern in der realen Welt ausgibt (arXiv:2501.11841). Dies zeigt, dass die Überwindung der grundlegenden Schwäche von Monokularen mithilfe neuronaler Netze heute ein zentrales Forschungsfeld ist.

Vergleich der wichtigsten Produktspezifikationen

Produkt Auflösung Sichtfeld (FOV) Hinweise
Mobileye EyeQ6L (EyeQ6 Lite) 8 Megapixel 120 Grad 20 Grad größerer Bildwinkel als die Kamera der EyeQ4M. Etwa 4,5-fache Rechenleistung der EyeQ4M bei etwa halber Chipfläche.
Tesla HW4 Kamera 5 Megapixel Deutlich größerer Bildwinkel als die HW3 (1,2 MP) – genaue Angabe nicht veröffentlicht. Ein bedeutendes Upgrade von 1,2 MP auf 5 MP bei der HW3. Die Rückkamera bietet einen stärkeren Fisheye-Effekt und einen größeren Bildwinkel.
Continental MFC500 (MFC525/MFC526) Bis zu 8 Megapixel Bis zu 125 Grad Eine modulare, skalierbare Kameraplattform, deren Erkennungsverarbeitung entweder in der Kamera selbst oder in einer externen ADCU (integrierte Steuereinheit) erfolgen kann.
comma.ai openpilot (comma 4) (Nachrüstgerät, Monokularkamera + dedizierter SoC) — Ein 999 US-Dollar teures Nachrüstkit, das Serienfahrzeuge mit Fahrerassistenzsystemen der Stufe 2 ausstattet. Ein durchgängiges neuronales Netzwerk namens „Supercombo“ prognostiziert die zukünftige Fahrspur des Fahrzeugs direkt anhand des Monokularbildes.

Sony IMX490 Bildsensor | Ca. 8,8 Megapixel | (nur Sensor, objektivunabhängig) | Ein CMOS-Sensor in Automobilqualität mit einem großen Dynamikumfang von 150 dB und LED-Flimmerunterdrückung. Er wird als Standardkomponente in Kameramodulen von Mobileye, Continental und anderen Herstellern verwendet. |

Mobileyes EyeQ6L ist ein ADAS-SoC (System-on-Chip), der 2024 angekündigt wurde und eher als „Kamera + Prozessorchip“-Set denn als eigenständige Monokularkamera angeboten wird. Die 8-Megapixel-Auflösung und das 120-Grad-Sichtfeld ermöglichen Spurhalte- und Spurwechselfunktionen, die nicht nur die aktuelle Spur, sondern auch die Spurmitte zwei Spuren weiter links erkennen. Tesla HW4 ist die ab 2023 eingeführte Hardwaregeneration und bietet einen deutlichen Auflösungssprung von 1,2 Megapixeln (HW3) auf 5 Megapixel, was die Erkennungsgenauigkeit von Schildern und Kennzeichen verbessert. Continentals MFC500 zeichnet sich durch seine Flexibilität aus – die Erkennungsverarbeitung kann entweder im Kameragehäuse oder in einer externen Einheit untergebracht werden – und die Produktfamilie umfasst auch die für Lkw konzipierte MFC526. Das System openpilot von comma.ai ist die Ausnahme: Es ist das einzige Produkt in dieser Liste, das als Nachrüstoption und nicht als werkseitiges System eines Automobilherstellers angeboten wird. Es verwendet ein durchgängiges neuronales Netzwerk namens „Supercombo“, das die zukünftige Fahrspur des Fahrzeugs direkt aus dem monokularen Bild vorhersagt.

Vom Labor der Hebräischen Universität zu Mobileye und Teslas „Radar-Abschaffung“

Vom Labor der Hebräischen Universität zur Intel-Übernahme für über 15 Milliarden US-Dollar – Mobileye wurde 1999 von Amnon Shashua, einem Computer-Vision-Forscher an der Hebräischen Universität Jerusalem, und dem Manager Ziv Aviram gegründet. Vor Mobileye war Shashua an der Gründung von CogniTens (optische Messsysteme für die Automobil- und Luftfahrtindustrie) und CogniTech (Videoanalysetechnologie) beteiligt. Mobileye entstand als Erweiterung dieser Arbeit mit dem Ziel, ein erschwingliches Bildverarbeitungssystem für Fahrzeuge des Massenmarktes zu entwickeln. Der erste Chip, der EyeQ1, kam 2004 auf den Markt, ein Jahrzehnt nach der ursprünglichen Roadmap des Unternehmens. Mobileye ging 2014 mit einer Bewertung von rund 5,3 Milliarden US-Dollar an die Nasdaq und wurde 2017 von Intel für 15,3 Milliarden US-Dollar übernommen – damals die größte Technologieübernahme in der israelischen Geschichte. Ende 2022 kehrte Tesla als unabhängiges börsennotiertes Unternehmen (weiterhin unter Intel) an die Nasdaq zurück und hat sein Angebot seither von Fahrerassistenzsystemen (ADAS) auf autonomes Fahren und „physikalische KI“ ausgeweitet.

Der Moment 2021, als Tesla Vision das Radar „abschaffte“ – Ab Mai 2021 wurden die nordamerikanischen Modelle 3 und Y auf eine Konfiguration ohne Radarsensor umgestellt. Dies markierte den Beginn der Umstellung auf „Tesla Vision“, das ausschließlich auf Kameras und neuronalen Netzen basiert. Andrej Karpathy, damals Leiter der KI-Abteilung bei Tesla, hielt im Juni desselben Jahres auf dem Workshop für autonomes Fahren der CVPR 2021 (einer führenden Konferenz für Computer Vision) eine Keynote. Er erklärte: „Wir haben das Radar entfernt und fahren in diesen Fahrzeugen ausschließlich mit Bilderkennung.“ Er erläuterte, dass Teslas Deep-Learning-Vision-System etwa hundertmal leistungsfähiger sei als das Radar, das es ersetzt hatte. Er sagte außerdem: „Alles, was passiert, geschieht im Auto zum ersten Mal, basierend auf den Videos der acht Kameras, die das Fahrzeug umgeben.“ Er räumte die technischen Schwierigkeiten eines rein visuellen Ansatzes ein, argumentierte aber, dass dieser, sobald er funktioniere, zu einem universell einsetzbaren Bildverarbeitungssystem werde, das überall auf der Welt genutzt werden könne. Auch die europäischen und nahöstlichen Model 3/Y-Modelle wurden später auf das radarfreie Tesla Vision umgestellt – ein wegweisender Fall, in dem ein Automobilhersteller bewusst einen monokularen (und auf mehreren Kameras basierenden) Ansatz der Sensorfusion vorzog.

Nachrüstbare monokulare Fahrerassistenzsysteme: comma.ai – Unabhängig von den werkseitigen ADAS-Systemen der Automobilhersteller bietet comma.ai – gegründet von George Hotz, bekannt für das Jailbreaking des iPhones – openpilot an. Dieses System rüstet unterstützte Fahrzeuge mit Spurhalteassistent (Level 2) und adaptivem Tempomat aus. Es wird über ein einzelnes, 999 US-Dollar teures Nachrüstgerät (das comma 3X/4) an der Windschutzscheibe montiert. Anstelle einer modularen, herkömmlichen Wahrnehmungspipeline nutzt es ein durchgängiges neuronales Netzwerk namens „Supercombo“, das die zukünftige Fahrspur des Fahrzeugs und die Straßenstruktur direkt aus dem Bild der Monokularkamera vorhersagt. Da es Open Source ist, findet es breite Anwendung in der DIY- und Forschungsszene.

Leistungsbestimmende Parameter

  • Auflösung (Pixelanzahl): Bestimmt direkt die Erkennungsgenauigkeit für entfernte Schilder, Ampeln und kleine Hindernisse. Teslas HW4-Technologie, die die Auflösung im Vergleich zu HW3 um etwa das Vierfache erhöht, zielte primär darauf ab, die Sichtbarkeit kleiner, entfernter Objekte zu verbessern. Die Auflösung von Monokularkameras im Automobilbereich steigt kontinuierlich, wie die 8-Megapixel-Klasse der Continental MFC500 und der Sony IMX490 zeigen.

  • Sichtfeld (FOV): Ein größeres Sichtfeld ermöglicht es einer einzelnen Kamera, mehr Umgebungsdetails zu erfassen – beispielsweise querende Fußgänger und einfädelnde Fahrzeuge an Kreuzungen. Mobileyes EyeQ6L mit einem Sichtfeld von 120 Grad, 20 Grad breiter als die EyeQ4M, zielt genau darauf ab. Continentals MFC500 geht mit 125 Grad noch weiter und ist für die seitliche Erkennung von Querverkehrsfahrzeugen an Kreuzungen konzipiert.

  • Dynamikumfang: Dieser Wert bestimmt, ob die Erkennung auch in Szenen mit extremen Kontrasten – wie Tunnelein- und -ausfahrten, Scheinwerferblendung und Gegenlicht bei Nacht – zuverlässig funktioniert, ohne dass Lichter überbelichtet oder Schatten abgesoffen werden. Der Dynamikumfang von 150 dB und die LED-Flimmerunterdrückung des Sony IMX490 (die das Flimmern von LED-Ampeln reduziert) begegnen dieser Herausforderung direkt.

  • Voraussetzungen für die Entfernungsschätzung: Da monokulare Kameras die Entfernung anhand von Annahmen schätzen – einer ebenen Fahrbahnoberfläche, bekannter Fahrspurbreite und standardisierten Objektgrößen –, nimmt der Fehler auf unebenen Straßen, Steigungen oder bei ungewöhnlich großen Hindernissen tendenziell zu. Anwendungen, die hochpräzise Entfernungsmessungen erfordern, setzen typischerweise die Kombination mit einer Stereokamera, LiDAR oder Radar voraus. Ansätze wie Tesla Vision versuchen jedoch, diese Einschränkung allein durch das Training neuronaler Netze zu überwinden.

  • Kosten und Montageplatz: Da eine monokulare Kamera nur ein Objektiv und einen Sensor benötigt, ist sie kleiner und kostengünstiger als eine Stereo- oder Tiefenkamera – ein Vorteil im beengten Platzangebot auf der Windschutzscheibe eines Fahrzeugs, wo mehrere Sensoren um Platz konkurrieren. Der Preis von 999 US-Dollar für comma.ai verdeutlicht diesen Kostenvorteil.

  • Verarbeitungsleistung (auf der SoC-Seite): Die praktische Anwendbarkeit einer monokularen Kamera hängt maßgeblich von der Leistungsfähigkeit der Bildverarbeitung ab. Die 4,5-fache Rechenleistung des EyeQ6L gegenüber dem EyeQ4M dient speziell der Steigerung der Erkennungsgenauigkeit und der Anzahl unterstützter Merkmale.

Überprüfung der monokularen Entfernung anhand eines numerischen Beispiels

Wird die Straße als Ebene mit der Kamerahöhe H, der Brennweite f und dem Pixelabstand y vom Horizont zum Kontaktpunkt eines Objekts angenähert, ergibt sich folgende vereinfachte inverse Perspektive:

Z=\frac{fH}{y}

Für H=1.4\,\mathrm{m}, f=1200\,\mathrm{px} und y=84\,\mathrm{px} ergibt sich daraus Z\simeq20\,\mathrm{m}. Unter denselben Annahmen führt ein Fehler von 2 Pixeln im Kontaktpunkt zu einem Entfernungsfehler von etwa 0.48\,\mathrm{m} bei Verwendung der differentiellen Näherung \sigma_Z\simeq fH\sigma_y/y^2. Straßenneigung, Kameraausrichtung, Fahrbahnhöhe und ein uneindeutiger Kontaktpunkt erhöhen den Fehler.

Diese Berechnung widerlegt die neuronale monokulare Tiefenschätzung nicht. Sie dient als Referenz, um die gelernten Ergebnisse mit der Straßengeometrie, bekannten Objektabmessungen, Stereo- oder Radardaten zu vergleichen. Die Ergebnisse sollten nach Entfernungsbereich, Gegenlicht, Neigung, Regen, Nacht und Objekthöhe aufgeschlüsselt werden, anstatt nur einen durchschnittlichen Fehlerwert anzugeben.

Diagram 1 · Use the button to switch views
Diagramm zur Entfernungsmessung mit einem Monokular auf ebener Straße, das zeigt, wie ein Kontaktpunktfehler von zwei Pixeln auf 10, 20 und 30 Meter zunimmt
Diagram 2 · Use the button to switch views
Z=fH/y: pixel offset shrinks with rangerange Zpixel offset from horizon ythe same 2px causes more range error
Diagramm: Duskcoil. Konzeptionell statt gemessen; es zeigt die umgekehrte Beziehung zwischen Pixelversatz und Entfernung.
Überprüfen Sie Ihr Verständnis
Bestimmt ein einzelnes Bild die Entfernung eines Objekts?

Der Maßstab ist ohne zusätzliche Annahmen mehrdeutig.

Ermitteln Sie, ob die Schätzung auf bekannter Größe, mehreren Ansichten oder gelernten Vorinformationen basiert.

Referenzen

What to read next

Review the backgroundWie LiDAR funktioniert und wichtige Produkte – Livox, Velodyne, HesaiContinue the seriesFunktionsweise von Stereokameras und wichtige Produkte – ZED 2i, Subaru EyeSightExplore another aspect of this fieldLesen Sie ein stationäres IMU-Log: Bias, Streuung und Allan-Abweichung