Contents — find the section you need
Uma câmera de profundidade captura a distância (profundidade) até um objeto pixel a pixel. Enquanto uma câmera estéreo é um dispositivo passivo que detecta a disparidade usando apenas luz visível, a maioria das câmeras de profundidade projeta ativamente algum tipo de luz sobre o objeto e calcula a profundidade a partir do sinal recebido. As implementações se dividem em três categorias principais: "estéreo ativo", que projeta um padrão de pontos aleatórios com um emissor infravermelho e realiza a correspondência estéreo com base nele; "luz estruturada", que calcula a profundidade geometricamente a partir da distorção de um padrão conhecido; e "Tempo de Voo" (ToF), que calcula a distância diretamente a partir do tempo de percurso (ou defasagem) da luz. Todas as três compartilham a mesma vantagem fundamental: por utilizarem uma pista artificial, conseguem capturar a profundidade mesmo em alvos como uma parede branca lisa ou um piso de cor sólida, onde o estéreo passivo tem dificuldade em detectar a disparidade. Elas são usadas para SLAM em robôs de ambientes internos, rastreamento de mãos em VR/AR, autenticação facial em smartphones e medição 3D industrial.
Kinect (2010, em exibição na E3)
Intel RealSense D435Imagens: Kinect e Xbox 360 na E3 2010 (James Pfaff, CC BY 2.0) / Intel Câmera de profundidade RealSense D435 (Marc Auledas, CC BY-SA 4.0), ambos Wikimedia Commons. A foto do RealSense mostra o modelo básico D435, não o D435i equipado com IMU discutido no texto.
Princípio: três abordagens ativas
Estereoscopia ativa utiliza um projetor infravermelho para projetar um padrão de pontos aleatórios sobre um objeto e, em seguida, realiza a correspondência estéreo entre duas câmeras infravermelhas com base na mudança desse padrão para calcular a profundidade. O princípio subjacente é a mesma triangulação da estereoscopia passiva ( Z = fB/d , veja o artigo sobre câmeras estéreo), exceto que a textura é adicionada artificialmente. A série RealSense D400 da Intel utiliza essa abordagem.
Luz estruturada triangula utilizando um par composto por "um projetor emitindo um padrão conhecido" e "uma única câmera", em vez de duas câmeras. Há também uma linha de base entre o projetor e a câmera, e a profundidade é calculada comparando como o padrão projetado (pontos, listras, etc.) se distorce em relação às superfícies do objeto com um padrão de referência conhecido. O Kinect original (2010) e o TrueDepth da Apple (Face ID do iPhone) utilizam essa abordagem — o TrueDepth projeta mais de 30.000 pontos infravermelhos em um rosto para ler seu formato 3D.
O ToF (Time of Flight) aplica o mesmo princípio de tempo de ida e volta da luz usado pelo LiDAR, em paralelo, por pixel. Além de medir diretamente o tempo de ida e volta de um pulso (dToF), a abordagem que domina as câmeras de profundidade para consumidores e indústrias é o iToF: ele projeta luz contínua modulada e deriva a distância da mudança de fase entre o sinal emitido e o refletido. Com frequência de modulação f_{mod} e velocidade da luz c, a distância Z é dada por
Como não necessita de triangulação, não precisa de uma linha de base entre um projetor e uma câmera, o que facilita a miniaturização e elimina peças móveis. Os produtos da Microsoft, do Kinect v2 em diante, e o Femto Bolt da Orbbec, utilizam essa abordagem. Todas as três abordagens dependem de luz infravermelha, portanto, compartilham uma fraqueza comum: a precisão tende a se degradar em ambientes externos sob forte luz solar, que é rica em infravermelho.
Diagrama: Duskcoil. As linhas azuis mostram a luz projetada; As linhas tracejadas laranja mostram a luz que retorna do alvo. O estéreo ativo e a luz estruturada triangulam sobre uma linha de base, enquanto o ToF usa uma mudança de tempo ou fase.
Comparação das principais especificações do produto
| Produto | Método | Alcance de profundidade | IMU integrada | Uso |
|---|---|---|---|---|
| Intel RealSense D435i | Estéreo ativo (projeção de padrão infravermelho) | Aprox. 0,3–3 m (até aproximadamente 10 m equivalentes em algumas condições) | Bosch BMI055 (6 eixos: acelerômetro + giroscópio) | SLAM, VR/AR, compensação de movimento de drones |
| Microsoft Kinect (original, 2010) | Luz estruturada (fabricada pela PrimeSense) | Aprox. 1,2–3,5 m | Nenhuma | Detecção de movimento para o console de jogos Xbox 360. Profundidade de 320x240 a 30 fps |
| Microsoft Kinect v2 / Azure Kinect | ToF | (As especificações oficiais variam conforme a aplicação) | O Azure Kinect possui uma IMU integrada | O Azure Kinect foi lançado em 2020 para realidade mista, robótica e uso industrial; descontinuado em 2023 |
| Orbbec Femto Bolt | ToF (usa tecnologia licenciada da Microsoft) | Resolução de profundidade de até 1024x1024, campo de visão horizontal de 120° | IMU de 6 eixos | Anunciado em 2023 como sucessor do Azure Kinect. Profundidade de 15 fps em 1024x1024 / 30 fps em 640x576, com câmera RGB 4K integrada |
| Apple iPhone TrueDepth | Luz estruturada (projeta mais de 30.000 pontos infravermelhos) | Alcance muito curto, otimizado para autenticação facial | (funciona em conjunto com a IMU do próprio iPhone) | Face ID, Animoji, separação de assunto no modo retrato |
A D435i é a D435 básica com uma IMU de 6 eixos (Bosch BMI055) adicionada. Os dados da IMU são sincronizados temporalmente (alinhados por timestamp) com os dados de profundidade, o que permite corrigir o movimento da própria câmera durante o processamento de nuvens de pontos e profundidade. O Kinect original foi construído com base na tecnologia de luz estruturada desenvolvida pela startup israelense PrimeSense; seu sucessor, o Kinect v2, passou a utilizar a tecnologia ToF (Time-of-Flight). O Azure Kinect saiu de produção em 2023, mas a Microsoft licenciou sua tecnologia de tempo de voo para a Orbbec, e o sucessor, Femto Bolt, utiliza o mesmo módulo de câmera de profundidade do Azure Kinect, facilitando a migração para aplicações existentes. O TrueDepth do iPhone é um ramo comercial separado dessa mesma linhagem de luz estruturada da PrimeSense — um exemplo real de uma raiz tecnológica se dividindo em duas aplicações completamente diferentes: "detecção de movimento para consoles de jogos" e "autenticação facial para smartphones".
Como uma única tecnologia, a PrimeSense, se ramificou para o Xbox, o iPhone e os robôs industriais
A empresa israelense PrimeSense, criadora do Kinect — A tecnologia central do Kinect original (lançado em 2010) não foi desenvolvida internamente pela Microsoft — tratava-se de uma tecnologia de sensoriamento de profundidade por luz estruturada, criada pela startup israelense PrimeSense. O Kinect rapidamente transcendeu suas origens como console de jogos e encontrou ampla aplicação na robótica acadêmica e comercial: a combinação de resolução inferior a 720p com captura simultânea de profundidade e RGB, a uma fração do custo do caro LiDAR, representou um negócio notável para a pesquisa em robótica na época. Um artigo de 2011 de Richard Newcombe, Shahram Izadi e colegas da Microsoft Research, "KinectFusion: Mapeamento e rastreamento de superfície densa em tempo real" (IEEE ISMAR 2011), demonstrou o mapeamento de superfície 3D densa em tempo real usando apenas uma única câmera de profundidade de baixo custo e uma GPU comum, tornando-se um dos trabalhos fundadores da pesquisa em SLAM RGB-D. A aquisição da PrimeSense pela Apple e seu renascimento como Face ID — Em novembro de 2013, a Apple adquiriu a PrimeSense por US$ 360 milhões. Isso não apagou a tecnologia de luz estruturada do Kinect original do mercado — sua linhagem técnica se tornou o núcleo do Face ID, materializando-se no sistema de câmera "TrueDepth" do iPhone X (um iluminador infravermelho, um projetor de pontos e uma câmera infravermelha) anunciado em 2017. É um caso incomumente grande de reaproveitamento de tecnologia: uma tecnologia criada para detecção de movimento em consoles de jogos tornou-se, sete anos depois, a principal tecnologia de autenticação biométrica presente em smartphones em uma escala de um bilhão de unidades.
A aquisição da PrimeSense pela Apple e seu renascimento como Face ID — Em novembro de 2013, a Apple adquiriu a PrimeSense por US$ 360 milhões. Microsoft descontinua o Kinect "novamente" — Ao longo de mais de uma década, a Microsoft lançou e descontinuou repetidamente gerações de produtos da família Kinect: Kinect para Xbox 360, Kinect para Xbox One, Kinect para Windows v2 e o Azure Kinect DK, voltado para aplicações industriais e de pesquisa. A descontinuação do Azure Kinect DK, anunciada em agosto de 2023, foi o mais recente (e até agora último) "fim do Kinect" nessa linhagem. Mas desta vez não foi um abandono completo — a Microsoft optou por licenciar sua tecnologia ToF para a Orbbec, e o "Femto Bolt" da Orbbec chegou com o mesmo módulo de câmera de profundidade do Azure Kinect. É um padrão que ecoa a aquisição da PrimeSense uma década antes: uma tecnologia sobrevivendo a uma transição corporativa.
Parâmetros que Determinam o Desempenho
- Alcance de profundidade: O alcance de aproximadamente 0,3 a 3 m do D435i (até o equivalente a cerca de 10 m em algumas condições) é um projeto de curto a médio alcance, adequado para detectar obstáculos em uma mesa ou ao redor de prateleiras para um robô de interior, ou para uso em curta distância, como rastreamento de mãos. O monitoramento externo de longo alcance é melhor atendido por uma câmera estéreo ou LiDAR.
- Escolha do método (estéreo ativo / luz estruturada / ToF): O estéreo ativo tem o custo computacional da correspondência estéreo, mas pode ser construído com componentes relativamente baratos. A luz estruturada oferece alta precisão em curta distância, adequada para aplicações de alta precisão em curta distância, como reconhecimento facial, mas tende a enfrentar restrições de miniaturização devido à necessidade de uma linha de base entre o projetor e a câmera. O ToF não precisa de partes móveis ou linha de base, o que facilita a miniaturização, embora tenda a não igualar a precisão em curta distância da luz estruturada. O Femto Bolt, com sua resolução de profundidade de 1024x1024 em um corpo compacto, é um projeto que aproveita exatamente essa vantagem de miniaturização do ToF.
- IMU integrada e sincronização de tempo: Para aplicações em que a própria câmera se move (câmera portátil, montada em drone, robô móvel), a precisão com que os dados de profundidade e os dados da IMU são sincronizados determina a acurácia da correção de desfoque de movimento. As IMUs integradas no D435i, Azure Kinect e Femto Bolt foram projetadas especificamente para esse caso de uso.
- Tolerância à luz ambiente: Todas as três abordagens baseadas em infravermelho são estáveis em ambientes internos, mas a precisão tende a se degradar em ambientes externos sob forte luz solar, que distorce o padrão projetado ou o sinal refletido. Aplicações que se presume serem executadas ao ar livre normalmente precisam recorrer ao estéreo passivo (ZED, etc.) ou a uma combinação de abordagens.
- Textura do objeto: Para robótica em ambientes internos e VR/AR que lidam com alvos com pouca textura — uma parede branca, um piso de cor sólida — um método ativo que pode projetar artificialmente um padrão infravermelho tem a vantagem. Essa vantagem diminui em ambientes externos ricos em textura.
- Distância mínima de alcance: Para aplicações que precisam de profundidade em distâncias muito curtas — rastreamento de mãos, autenticação facial — o limite inferior do alcance de profundidade determina diretamente a usabilidade. O TrueDepth, projetado especificamente para um alvo a apenas dezenas de centímetros de distância (um rosto), é o exemplo arquetípico disso.
Estimando o Erro de Alcance por Método
Para estéreo ativo, a relação básica é Z=fB/d, portanto, a incerteza de disparidade \sigma_d é amplificada como
Com f=600\,\mathrm{px}, B=0.05\,\mathrm{m}, Z=3\,\mathrm{m} e \sigma_d=0.25\,\mathrm{px}, o erro de alcance é de aproximadamente 7.5\,\mathrm{cm}. Um padrão projetado auxilia na correspondência em uma parede com pouca textura, mas os pontos podem desaparecer sob forte luz solar ou em materiais que absorvem infravermelho.
Para ToF, a leitura de fase ou tempo, a refletividade, o multicaminho e o tempo de integração são os fatores dominantes. Portanto, uma resolução de profundidade de 1024×1024 pixels não é a mesma especificação que o desvio padrão de alcance. Ao selecionar um dispositivo, mantenha a distância e o material do alvo constantes e meça a taxa de retornos ausentes, a taxa de outliers, a latência do quadro e o deslocamento do carimbo de data/hora entre profundidade, RGB e IMU.
Figura 2 — Os valores à esquerda são calculados a partir do artigo f,B,\sigma_d. A figura à direita explica por que o erro aleatório ToF, o viés e os retornos inválidos exigem medições separadas. Esta não é uma curva de desempenho do dispositivo.
A ausência de profundidade equivale a zero metros?
Significa que o alcance não foi obtido. Defina o tratamento de valores inválidos em vez de tratar dados ausentes como um objeto próximo ou espaço livre.
Referências
- Página do produto Intel RealSense D435i
- Kinect (Wikipedia)
- Azure Kinect (Wikipedia)
- Microsoft anuncia o fim da produção do Azure Kinect DK (Microsoft Tech Community)
- Página do produto Orbbec Femto Bolt
- Visão geral da colaboração Orbbec x Microsoft
- Microsoft não consegue parar de descontinuar o Kinect (TechCrunch)
- Cobertura da aquisição da PrimeSense pela Apple
- Como funciona o TrueDepth/Face ID do iPhone (Estrutura)
- Artigo sobre KinectFusion (IEEE ISMAR 2011)
- Detecção de alcance do Kinect: Luz estruturada versus Kinect de tempo de voo (arXiv:1505.05459)
- Detecção de alcance do Kinect: Luz estruturada versus Kinect de tempo de voo (arXiv:1505.05459)
Comentários
Entre na sua conta para continuar.
Ainda não há dados.