Contents — find the section you need

Uma câmera de profundidade captura a distância (profundidade) até um objeto pixel a pixel. Enquanto uma câmera estéreo é um dispositivo passivo que detecta a disparidade usando apenas luz visível, a maioria das câmeras de profundidade projeta ativamente algum tipo de luz sobre o objeto e calcula a profundidade a partir do sinal recebido. As implementações se dividem em três categorias principais: "estéreo ativo", que projeta um padrão de pontos aleatórios com um emissor infravermelho e realiza a correspondência estéreo com base nele; "luz estruturada", que calcula a profundidade geometricamente a partir da distorção de um padrão conhecido; e "Tempo de Voo" (ToF), que calcula a distância diretamente a partir do tempo de percurso (ou defasagem) da luz. Todas as três compartilham a mesma vantagem fundamental: por utilizarem uma pista artificial, conseguem capturar a profundidade mesmo em alvos como uma parede branca lisa ou um piso de cor sólida, onde o estéreo passivo tem dificuldade em detectar a disparidade. Elas são usadas para SLAM em robôs de ambientes internos, rastreamento de mãos em VR/AR, autenticação facial em smartphones e medição 3D industrial.

Um Xbox 360 e um sensor Kinect em exibição na E3 2010Kinect (2010, em exibição na E3)
Um Intel RealSense D435 completo e seu pequeno tripéIntel RealSense D435

Imagens: Kinect e Xbox 360 na E3 2010 (James Pfaff, CC BY 2.0) / Intel Câmera de profundidade RealSense D435 (Marc Auledas, CC BY-SA 4.0), ambos Wikimedia Commons. A foto do RealSense mostra o modelo básico D435, não o D435i equipado com IMU discutido no texto.

Princípio: três abordagens ativas

Estereoscopia ativa utiliza um projetor infravermelho para projetar um padrão de pontos aleatórios sobre um objeto e, em seguida, realiza a correspondência estéreo entre duas câmeras infravermelhas com base na mudança desse padrão para calcular a profundidade. O princípio subjacente é a mesma triangulação da estereoscopia passiva ( Z = fB/d , veja o artigo sobre câmeras estéreo), exceto que a textura é adicionada artificialmente. A série RealSense D400 da Intel utiliza essa abordagem.

Luz estruturada triangula utilizando um par composto por "um projetor emitindo um padrão conhecido" e "uma única câmera", em vez de duas câmeras. Há também uma linha de base entre o projetor e a câmera, e a profundidade é calculada comparando como o padrão projetado (pontos, listras, etc.) se distorce em relação às superfícies do objeto com um padrão de referência conhecido. O Kinect original (2010) e o TrueDepth da Apple (Face ID do iPhone) utilizam essa abordagem — o TrueDepth projeta mais de 30.000 pontos infravermelhos em um rosto para ler seu formato 3D.

O ToF (Time of Flight) aplica o mesmo princípio de tempo de ida e volta da luz usado pelo LiDAR, em paralelo, por pixel. Além de medir diretamente o tempo de ida e volta de um pulso (dToF), a abordagem que domina as câmeras de profundidade para consumidores e indústrias é o iToF: ele projeta luz contínua modulada e deriva a distância da mudança de fase entre o sinal emitido e o refletido. Com frequência de modulação f_{mod} e velocidade da luz c, a distância Z é dada por

Z = \frac{c \cdot \Delta\phi}{4\pi f_{mod}}

Como não necessita de triangulação, não precisa de uma linha de base entre um projetor e uma câmera, o que facilita a miniaturização e elimina peças móveis. Os produtos da Microsoft, do Kinect v2 em diante, e o Femto Bolt da Orbbec, utilizam essa abordagem. Todas as três abordagens dependem de luz infravermelha, portanto, compartilham uma fraqueza comum: a precisão tende a se degradar em ambientes externos sob forte luz solar, que é rica em infravermelho.

Diagram 1 · Use the button to switch views
Comparação de layouts de sensores de estéreo ativo, luz estruturada e tempo de voo e suas pistas de alcance: disparidade, distorção de padrão e deslocamento de fase

Diagrama: Duskcoil. As linhas azuis mostram a luz projetada; As linhas tracejadas laranja mostram a luz que retorna do alvo. O estéreo ativo e a luz estruturada triangulam sobre uma linha de base, enquanto o ToF usa uma mudança de tempo ou fase.

Comparação das principais especificações do produto

Produto Método Alcance de profundidade IMU integrada Uso
Intel RealSense D435i Estéreo ativo (projeção de padrão infravermelho) Aprox. 0,3–3 m (até aproximadamente 10 m equivalentes em algumas condições) Bosch BMI055 (6 eixos: acelerômetro + giroscópio) SLAM, VR/AR, compensação de movimento de drones
Microsoft Kinect (original, 2010) Luz estruturada (fabricada pela PrimeSense) Aprox. 1,2–3,5 m Nenhuma Detecção de movimento para o console de jogos Xbox 360. Profundidade de 320x240 a 30 fps
Microsoft Kinect v2 / Azure Kinect ToF (As especificações oficiais variam conforme a aplicação) O Azure Kinect possui uma IMU integrada O Azure Kinect foi lançado em 2020 para realidade mista, robótica e uso industrial; descontinuado em 2023
Orbbec Femto Bolt ToF (usa tecnologia licenciada da Microsoft) Resolução de profundidade de até 1024x1024, campo de visão horizontal de 120° IMU de 6 eixos Anunciado em 2023 como sucessor do Azure Kinect. Profundidade de 15 fps em 1024x1024 / 30 fps em 640x576, com câmera RGB 4K integrada
Apple iPhone TrueDepth Luz estruturada (projeta mais de 30.000 pontos infravermelhos) Alcance muito curto, otimizado para autenticação facial (funciona em conjunto com a IMU do próprio iPhone) Face ID, Animoji, separação de assunto no modo retrato

A D435i é a D435 básica com uma IMU de 6 eixos (Bosch BMI055) adicionada. Os dados da IMU são sincronizados temporalmente (alinhados por timestamp) com os dados de profundidade, o que permite corrigir o movimento da própria câmera durante o processamento de nuvens de pontos e profundidade. O Kinect original foi construído com base na tecnologia de luz estruturada desenvolvida pela startup israelense PrimeSense; seu sucessor, o Kinect v2, passou a utilizar a tecnologia ToF (Time-of-Flight). O Azure Kinect saiu de produção em 2023, mas a Microsoft licenciou sua tecnologia de tempo de voo para a Orbbec, e o sucessor, Femto Bolt, utiliza o mesmo módulo de câmera de profundidade do Azure Kinect, facilitando a migração para aplicações existentes. O TrueDepth do iPhone é um ramo comercial separado dessa mesma linhagem de luz estruturada da PrimeSense — um exemplo real de uma raiz tecnológica se dividindo em duas aplicações completamente diferentes: "detecção de movimento para consoles de jogos" e "autenticação facial para smartphones".

Como uma única tecnologia, a PrimeSense, se ramificou para o Xbox, o iPhone e os robôs industriais

A empresa israelense PrimeSense, criadora do Kinect — A tecnologia central do Kinect original (lançado em 2010) não foi desenvolvida internamente pela Microsoft — tratava-se de uma tecnologia de sensoriamento de profundidade por luz estruturada, criada pela startup israelense PrimeSense. O Kinect rapidamente transcendeu suas origens como console de jogos e encontrou ampla aplicação na robótica acadêmica e comercial: a combinação de resolução inferior a 720p com captura simultânea de profundidade e RGB, a uma fração do custo do caro LiDAR, representou um negócio notável para a pesquisa em robótica na época. Um artigo de 2011 de Richard Newcombe, Shahram Izadi e colegas da Microsoft Research, "KinectFusion: Mapeamento e rastreamento de superfície densa em tempo real" (IEEE ISMAR 2011), demonstrou o mapeamento de superfície 3D densa em tempo real usando apenas uma única câmera de profundidade de baixo custo e uma GPU comum, tornando-se um dos trabalhos fundadores da pesquisa em SLAM RGB-D. A aquisição da PrimeSense pela Apple e seu renascimento como Face ID — Em novembro de 2013, a Apple adquiriu a PrimeSense por US$ 360 milhões. Isso não apagou a tecnologia de luz estruturada do Kinect original do mercado — sua linhagem técnica se tornou o núcleo do Face ID, materializando-se no sistema de câmera "TrueDepth" do iPhone X (um iluminador infravermelho, um projetor de pontos e uma câmera infravermelha) anunciado em 2017. É um caso incomumente grande de reaproveitamento de tecnologia: uma tecnologia criada para detecção de movimento em consoles de jogos tornou-se, sete anos depois, a principal tecnologia de autenticação biométrica presente em smartphones em uma escala de um bilhão de unidades.

A aquisição da PrimeSense pela Apple e seu renascimento como Face ID — Em novembro de 2013, a Apple adquiriu a PrimeSense por US$ 360 milhões. Microsoft descontinua o Kinect "novamente" — Ao longo de mais de uma década, a Microsoft lançou e descontinuou repetidamente gerações de produtos da família Kinect: Kinect para Xbox 360, Kinect para Xbox One, Kinect para Windows v2 e o Azure Kinect DK, voltado para aplicações industriais e de pesquisa. A descontinuação do Azure Kinect DK, anunciada em agosto de 2023, foi o mais recente (e até agora último) "fim do Kinect" nessa linhagem. Mas desta vez não foi um abandono completo — a Microsoft optou por licenciar sua tecnologia ToF para a Orbbec, e o "Femto Bolt" da Orbbec chegou com o mesmo módulo de câmera de profundidade do Azure Kinect. É um padrão que ecoa a aquisição da PrimeSense uma década antes: uma tecnologia sobrevivendo a uma transição corporativa.

Parâmetros que Determinam o Desempenho

  • Alcance de profundidade: O alcance de aproximadamente 0,3 a 3 m do D435i (até o equivalente a cerca de 10 m em algumas condições) é um projeto de curto a médio alcance, adequado para detectar obstáculos em uma mesa ou ao redor de prateleiras para um robô de interior, ou para uso em curta distância, como rastreamento de mãos. O monitoramento externo de longo alcance é melhor atendido por uma câmera estéreo ou LiDAR.
  • Escolha do método (estéreo ativo / luz estruturada / ToF): O estéreo ativo tem o custo computacional da correspondência estéreo, mas pode ser construído com componentes relativamente baratos. A luz estruturada oferece alta precisão em curta distância, adequada para aplicações de alta precisão em curta distância, como reconhecimento facial, mas tende a enfrentar restrições de miniaturização devido à necessidade de uma linha de base entre o projetor e a câmera. O ToF não precisa de partes móveis ou linha de base, o que facilita a miniaturização, embora tenda a não igualar a precisão em curta distância da luz estruturada. O Femto Bolt, com sua resolução de profundidade de 1024x1024 em um corpo compacto, é um projeto que aproveita exatamente essa vantagem de miniaturização do ToF.
  • IMU integrada e sincronização de tempo: Para aplicações em que a própria câmera se move (câmera portátil, montada em drone, robô móvel), a precisão com que os dados de profundidade e os dados da IMU são sincronizados determina a acurácia da correção de desfoque de movimento. As IMUs integradas no D435i, Azure Kinect e Femto Bolt foram projetadas especificamente para esse caso de uso.
  • Tolerância à luz ambiente: Todas as três abordagens baseadas em infravermelho são estáveis em ambientes internos, mas a precisão tende a se degradar em ambientes externos sob forte luz solar, que distorce o padrão projetado ou o sinal refletido. Aplicações que se presume serem executadas ao ar livre normalmente precisam recorrer ao estéreo passivo (ZED, etc.) ou a uma combinação de abordagens.
  • Textura do objeto: Para robótica em ambientes internos e VR/AR que lidam com alvos com pouca textura — uma parede branca, um piso de cor sólida — um método ativo que pode projetar artificialmente um padrão infravermelho tem a vantagem. Essa vantagem diminui em ambientes externos ricos em textura.
  • Distância mínima de alcance: Para aplicações que precisam de profundidade em distâncias muito curtas — rastreamento de mãos, autenticação facial — o limite inferior do alcance de profundidade determina diretamente a usabilidade. O TrueDepth, projetado especificamente para um alvo a apenas dezenas de centímetros de distância (um rosto), é o exemplo arquetípico disso.

Estimando o Erro de Alcance por Método

Para estéreo ativo, a relação básica é Z=fB/d, portanto, a incerteza de disparidade \sigma_d é amplificada como

\sigma_Z\simeq\frac{Z^2}{fB}\sigma_d

Com f=600\,\mathrm{px}, B=0.05\,\mathrm{m}, Z=3\,\mathrm{m} e \sigma_d=0.25\,\mathrm{px}, o erro de alcance é de aproximadamente 7.5\,\mathrm{cm}. Um padrão projetado auxilia na correspondência em uma parede com pouca textura, mas os pontos podem desaparecer sob forte luz solar ou em materiais que absorvem infravermelho.

Para ToF, a leitura de fase ou tempo, a refletividade, o multicaminho e o tempo de integração são os fatores dominantes. Portanto, uma resolução de profundidade de 1024×1024 pixels não é a mesma especificação que o desvio padrão de alcance. Ao selecionar um dispositivo, mantenha a distância e o material do alvo constantes e meça a taxa de retornos ausentes, a taxa de outliers, a latência do quadro e o deslocamento do carimbo de data/hora entre profundidade, RGB e IMU.

Diagram 2 · Use the button to switch views
Erro de alcance estéreo ativo calculado por distância, além de caminhos de erro ToF separados para leitura de fase, multicaminho e baixa refletância

Figura 2 — Os valores à esquerda são calculados a partir do artigo f,B,\sigma_d. A figura à direita explica por que o erro aleatório ToF, o viés e os retornos inválidos exigem medições separadas. Esta não é uma curva de desempenho do dispositivo.

Verifique seu entendimento
A ausência de profundidade equivale a zero metros?

Significa que o alcance não foi obtido. Defina o tratamento de valores inválidos em vez de tratar dados ausentes como um objeto próximo ou espaço livre.

Referências

What to read next

Review the backgroundComo funcionam as câmeras estéreo e principais produtos — ZED 2i, Subaru EyeSightContinue the seriesComo funcionam as IMUs e principais produtos — Xsens, Bosch, Analog DevicesExplore another aspect of this fieldLeia o registro de uma IMU estacionária: viés, dispersão e desvio de Allan.