Contents — find the section you need

Uma câmera monocular captura a estrada à frente com uma única lente e um único sensor de imagem, utilizando processamento de imagem para reconhecer faixas de rodagem, placas de sinalização, semáforos, pedestres e veículos. Ao contrário do LiDAR ou do radar, ela não emite ativamente ondas de rádio ou luz — simplesmente recebe a luz visível refletida — portanto, sua estrutura é simples e tende a apresentar vantagens tanto em custo quanto em espaço de instalação. Em ADAS (Sistemas Avançados de Assistência ao Condutor) para veículos autônomos, é um dos sensores mais amplamente utilizados, sendo empregado em alerta de saída de faixa, assistência de manutenção de faixa (LKA) e controle de cruzeiro adaptativo (ACC) baseado apenas em visão.

A câmera monocular captura a estrada à frente com uma única lente e um único sensor de imagem, utilizando processamento de imagem para reconhecer faixas de rodagem, placas de sinalização, semáforos, pedestres e veículos.

Uma câmera do sistema Mobileye montada em um para-brisaCâmera da Mobileye montada em janela (fotografada em 2017)

Imagem: Car câmera de janela do sistema Mobileye (Ranbar, CC BY-SA 4.0), Wikimedia Commons. Esta não é a câmera mais recente baseada no EyeQ6L discutida no texto, mas um exemplo de um modelo anterior.

Princípio: uma única imagem não possui "escala absoluta"

A maior desvantagem de uma câmera monocular é que uma única imagem, por si só, não pode, em princípio, determinar a distância absoluta (escala do mundo real) de um objeto. Uma câmera pode ser aproximada pelo modelo de câmera estenopeica: um ponto (X, Y, Z) no espaço 3D projeta-se em um ponto (x, y) no plano da imagem, através da distância focal f, como

x = f \frac{X}{Z}, \qquad y = f \frac{Y}{Z}

Como esta equação mostra, tudo o que você pode recuperar das coordenadas da imagem (x, y) é a razão entre as coordenadas reais (X, Y, Z) normalizadas pela profundidade Z — a profundidade Z em si não pode ser calculada retroativamente a partir de uma única imagem. Dois objetos que se projetam com o mesmo tamanho na imagem podem ser um objeto pequeno próximo ou um grande distante, e esta equação sozinha não consegue distingui-los. Isso contrasta diretamente com uma câmera estéreo, que pode calcular Z diretamente por meio de triangulação a partir da disparidade entre duas lentes.

Imagem: Pinhole geometria do modelo de câmera (KYN, CC0 1.0 domínio público), Wikimedia Commons.

Para contornar essa limitação, os sistemas baseados em câmeras monoculares estimam a distância usando algum tipo de "referência conhecida". Uma técnica representativa, usada pela Mobileye, é a geometria de visão única via Mapeamento de Perspectiva Inversa (IPM): ela assume que a superfície da estrada é plana e usa um objeto com um tamanho conhecido no mundo real — largura da faixa, por exemplo — como referência, calculando retroativamente a distância real a partir da posição na imagem (patente relacionada: US8164628B2). Outras técnicas incluem estimar a distância a partir do tamanho aparente de um objeto (as dimensões típicas de um veículo ou pedestre no mundo real) e estimar a distância e a velocidade a partir do movimento em quadros consecutivos (fluxo óptico). Como todas essas técnicas dependem de suposições, o erro tende a aumentar quando a superfície da estrada é inclinada ou quando o tamanho de um objeto se desvia do que é presumido.

Nos últimos anos, a pesquisa sobre "Estimativa de Profundidade Monocular" (MDE) — usando aprendizado profundo para preencher essa lacuna diretamente — avançou rapidamente. Enquanto os métodos anteriores só conseguiam fornecer profundidade relativa (ordenação perto-longe), um artigo de revisão de 2025 focado especificamente na estimativa de profundidade monocular "métrica", que fornece a distância absoluta em metros reais (arXiv:2501.11841), foi publicado em 2025 — um sinal de que superar a fraqueza fundamental da visão monocular com uma rede neural é agora um dos principais campos de pesquisa.

Comparação das principais especificações do produto

Produto Resolução Campo de visão (FOV) Observações
Mobileye EyeQ6L (EyeQ6 Lite) 8 megapixels 120 graus 20 graus mais amplo que a câmera do EyeQ4M. Desempenho de processamento aproximadamente 4,5 vezes maior que o do EyeQ4M, com cerca de metade da área do chip
Câmera Tesla HW4 5 megapixels Substancialmente mais ampla que a HW3 (1,2 MP) — valor exato não divulgado Uma grande atualização em relação aos 1,2 MP da HW3, que agora possui 5 MP. A câmera traseira tem um efeito olho de peixe mais forte e um ângulo mais amplo
Continental MFC500 (MFC525/MFC526) Até 8 megapixels Até 125 graus Uma plataforma de câmera modular e escalável, onde o processamento de reconhecimento pode ser executado dentro da câmera ou em uma ADCU (unidade de controle integrada) externa
comma.ai openpilot (comma 4) (Dispositivo adicional de pós-venda, câmera monocular + SoC dedicado) — Um kit de pós-venda de US$ 999 que adiciona assistência ao motorista de Nível 2 a veículos de produção. Uma única rede neural de ponta a ponta, "Supercombo", prevê a trajetória futura do veículo diretamente a partir da imagem monocular
Sensor de imagem Sony IMX490 Aprox. 8,8 megapixels (somente sensor, independente da lente) Um sensor CMOS de nível automotivo com ampla faixa dinâmica de 150 dB e mitigação de cintilação de LED, usado como componente comum em módulos de câmera da Mobileye, Continental e outras

O EyeQ6L da Mobileye é um SoC (System on Chip) ADAS anunciado em 2024, fornecido mais como um conjunto de "câmera + chip de processamento" do que como uma câmera monocular independente. Sua resolução de 8 MP e campo de visão amplo de 120 graus permitem recursos de manutenção de faixa e mudança automática de faixa que detectam não apenas a faixa atual, mas também os centros das duas faixas laterais. O hardware HW4 da Tesla é a geração lançada a partir de 2023, um grande salto de resolução em relação aos 1,2 MP do HW3 para 5 MP, o que melhora a precisão do reconhecimento de placas e sinais de trânsito. O MFC500 da Continental se destaca por sua flexibilidade — o mecanismo de processamento de reconhecimento pode estar integrado ao corpo da câmera ou em uma unidade externa — e a família se estende até o MFC526, voltado para caminhões. O openpilot da comma.ai é o único produto aqui que é um acessório de mercado paralelo, em vez de um sistema de fábrica de uma montadora, e utiliza uma rede neural de ponta a ponta, "Supercombo", que prevê a trajetória futura do veículo diretamente a partir da imagem monocular.

De um laboratório da Universidade Hebraica à Mobileye e a "exclusão" do radar pela Tesla

**De um laboratório da Universidade Hebraica à aquisição pela Intel por mais de US15 bilhões** — A Mobileye foi fundada em 1999 por Amnon Shashua, pesquisador de visão computacional da Universidade Hebraica de Jerusalém, juntamente com o executivo Ziv Aviram. Antes da Mobileye, Shashua havia participado da fundação da CogniTens (sistemas de medição óptica para os setores automotivo e aeroespacial) e da CogniTech (tecnologia de análise de vídeo), e a Mobileye foi lançada como uma extensão desse trabalho, com o objetivo de levar um sistema de visão acessível a veículos de mercado de massa. Seu primeiro chip, o EyeQ1, foi lançado em 2004, uma década após o cronograma inicial da empresa. A Mobileye abriu seu capital na Nasdaq em 2014 com uma avaliação de aproximadamente US 5,3 bilhões e, em 2017, a Intel a adquiriu por US$ 15,3 bilhões — na época, a maior aquisição de tecnologia da história de Israel. A Tesla voltou a ser negociada na Nasdaq como uma empresa pública independente (ainda sob o controle da Intel) no final de 2022 e, desde então, expandiu sua atuação de ADAS para direção autônoma e "IA física".

O momento em que o Tesla Vision "eliminou" o radar em 2021 — A partir de maio de 2021, os veículos Model 3 e Model Y da América do Norte passaram a utilizar uma configuração sem sensor de radar, iniciando a transição para o "Tesla Vision" — que depende exclusivamente de câmeras e processamento de redes neurais. Andrej Karpathy, então líder de IA da Tesla, fez um discurso de abertura no workshop de direção autônoma da CVPR 2021 (uma das principais conferências de visão computacional) em junho daquele ano, afirmando categoricamente: "Eliminamos o radar e estamos dirigindo apenas com visão nesses carros", e explicando que o sistema de visão de aprendizado profundo da Tesla havia atingido um nível de desempenho aproximadamente cem vezes superior ao do radar que substituiu. Ele também afirmou que "tudo o que acontece, acontece pela primeira vez no carro, com base nos vídeos das oito câmeras que o circundam", reconhecendo a dificuldade técnica de uma abordagem baseada apenas em visão, mas argumentando que, uma vez funcionando, ela se torna um sistema de visão geral implantável em qualquer lugar do mundo. Os Model 3/Y europeus e do Oriente Médio também passaram a utilizar o Tesla Vision, que dispensa o uso de radar — um caso histórico de uma montadora que optou deliberadamente por uma abordagem monocular (e com múltiplas câmeras) em vez da fusão de sensores.

Assistência ao motorista monocular de terceiros: comma.ai — Independente dos sistemas ADAS de fábrica de qualquer montadora, a comma.ai — fundada por George Hotz, conhecido por desbloquear o iPhone — vende o openpilot, que adiciona assistência de permanência na faixa de nível 2 e controle de cruzeiro adaptativo a veículos compatíveis por meio de um único dispositivo de pós-venda de US$ 999 (o comma 3X/4) instalado no para-brisa. Em vez de um pipeline de percepção modular e tradicional, ele usa uma rede neural de ponta a ponta chamada "Supercombo" que prevê a trajetória futura do veículo e a estrutura da estrada diretamente a partir da imagem da câmera monocular. Por ser de código aberto, é amplamente utilizado nas comunidades de entusiastas e pesquisadores.

Parâmetros que Determinam o Desempenho

  • Resolução (contagem de pixels): Determina diretamente a precisão do reconhecimento de placas distantes, semáforos e pequenos obstáculos. O aumento de aproximadamente 4 vezes na resolução do HW4 da Tesla em relação ao HW3 teve como objetivo principal melhorar a visibilidade de alvos pequenos e distantes. A resolução das câmeras monoculares automotivas continua aumentando ano após ano, como visto com o MFC500 da Continental e o IMX490 da Sony, ambos atingindo a classe de 8 megapixels.
  • Campo de visão (FOV): Um FOV mais amplo permite que uma única câmera cubra mais contexto ao redor — pedestres atravessando e veículos convergindo em cruzamentos, por exemplo. O EyeQ6L da Mobileye, com 120 graus, 20 graus mais amplo que o EyeQ4M, visa exatamente isso. A MFC500 da Continental vai além, chegando a 125 graus, com o objetivo de detectar veículos que cruzam lateralmente em cruzamentos.
  • Faixa dinâmica: Determina se o reconhecimento se mantém em cenas com contraste extremo — entradas/saídas de túneis, brilho dos faróis e contraluz à noite — sem estourar as altas luzes ou saturar as sombras. A faixa dinâmica de 150 dB do Sony IMX490 e a mitigação de cintilação de LED (que suprime a cintilação dos semáforos de LED) resolvem esse desafio diretamente.
  • Pré-condições para estimativa de distância: Como as câmeras monoculares estimam a distância com base em suposições — uma superfície de estrada plana, largura da faixa conhecida, tamanhos de objetos padrão — o erro tende a aumentar em estradas irregulares, declives ou obstáculos de tamanho incomum. Aplicações que necessitam de alta precisão de distância normalmente pressupõem o uso de uma câmera estéreo, LiDAR ou radar, embora abordagens como a Tesla Vision tentem superar essa limitação puramente por meio da escala do treinamento de redes neurais.
  • Custo e espaço de montagem: A necessidade de apenas uma lente e um sensor torna uma câmera monocular menor e mais barata de fabricar do que uma câmera estéreo ou de profundidade — uma vantagem no layout apertado do para-brisa de um veículo, onde vários sensores competem por espaço. O preço de US$ 999 da comma.ai é emblemático dessa vantagem de baixo custo.
  • Desempenho de processamento (no lado do SoC): A utilidade prática de uma câmera monocular depende muito da sofisticação do processamento por trás da imagem capturada. O desempenho computacional 4,5 vezes superior do EyeQ6L em comparação com o EyeQ4M existe especificamente para aumentar a precisão do reconhecimento e o número de recursos suportados.

Verificando a Distância Monocular com um Exemplo Numérico

Se a estrada for aproximada como um plano, com altura da câmera H, distância focal f e deslocamento em pixels y da linha do horizonte até o ponto de contato de um objeto, uma relação de perspectiva inversa simplificada é:

Z=\frac{fH}{y}

Para H=1.4\,\mathrm{m}, f=1200\,\mathrm{px} e y=84\,\mathrm{px}, isso resulta em Z\simeq20\,\mathrm{m}. Sob as mesmas premissas, um erro de 2px no ponto de contato resulta em um erro de alcance de aproximadamente 0.48\,\mathrm{m} usando a aproximação diferencial \sigma_Z\simeq fH\sigma_y/y^2. Inclinação da estrada, atitude da câmera, altura da faixa e um ponto de contato ambíguo adicionam erros adicionais.

Este cálculo não rejeita a estimativa de profundidade monocular neural. Ele fornece uma referência para verificar uma saída aprendida em relação à geometria da estrada, dimensões conhecidas do objeto, estéreo ou radar. Relate os testes por faixa de distância, contraluz, inclinação, chuva, noite e altura do objeto, em vez de apenas um erro médio.

Diagram 1 · Use the button to switch views
Diagrama de alcance monocular em estrada plana mostrando como um erro de ponto de contato de dois pixels aumenta a 10, 20 e 30 metros
Diagram 2 · Use the button to switch views
Z=fH/y: pixel offset shrinks with rangerange Zpixel offset from horizon ythe same 2px causes more range error
Diagrama: Duskcoil. Conceitual em vez de medido; mostra a relação inversa entre o deslocamento do pixel e a distância.
Verifique sua compreensão
Uma única imagem determina a distância de um objeto?

A escala é ambígua sem suposições adicionais. Identifique se a estimativa usa tamanho conhecido, múltiplas vistas ou conhecimentos prévios aprendidos.

Referências

What to read next

Review the backgroundComo funciona o LiDAR e principais produtos — Livox, Velodyne, HesaiContinue the seriesComo funcionam as câmeras estéreo e principais produtos — ZED 2i, Subaru EyeSightExplore another aspect of this fieldLeia o registro de uma IMU estacionária: viés, dispersão e desvio de Allan.