Contents — find the section you need

Una telecamera di profondità rileva la distanza (profondità) di un oggetto pixel per pixel. Mentre una telecamera stereoscopica è un sistema passivo che rileva la disparità utilizzando solo la luce visibile, la maggior parte delle telecamere di profondità proietta attivamente una qualche forma di luce sull'oggetto e ricava la profondità da ciò che viene riflesso. Le implementazioni si dividono in tre categorie principali: "stereoscopica attiva", che proietta un pattern di punti casuale con un emettitore a infrarossi ed esegue la corrispondenza stereo su di esso; "luce strutturata", che calcola la profondità geometricamente in base alla distorsione di un pattern noto; e "Time of Flight" (ToF), che calcola la distanza direttamente dal tempo di andata e ritorno (o sfasamento) della luce. Tutte e tre condividono lo stesso punto di forza fondamentale: poiché possono utilizzare un indizio artificiale, sono in grado di rilevare la profondità anche su oggetti come una semplice parete bianca o un pavimento a tinta unita, dove la stereoscopica passiva fatica a rilevare la disparità. Sono utilizzate per il SLAM (Single-Lapse and Motion) di robot in ambienti interni, il tracciamento delle mani in realtà virtuale/aumentata, l'autenticazione facciale tramite smartphone e la misurazione 3D industriale.

Principio: tre approcci attivi

La stereoscopia attiva utilizza un proiettore a infrarossi che proietta un pattern di punti casuale su un oggetto, quindi esegue la corrispondenza stereo tra due telecamere a infrarossi in base allo spostamento di tale pattern per calcolare la profondità. Il principio alla base è lo stesso della stereoscopia passiva (Z = fB/d, vedi l'articolo sulla telecamera stereo), con la differenza che la texture viene aggiunta artificialmente. La serie RealSense D400 di Intel utilizza questo approccio.

La luce strutturata triangola utilizzando una coppia composta da "un proiettore che emette un pattern noto" e "una singola telecamera", anziché due telecamere. Esiste una linea di base anche tra il proiettore e la telecamera, e la profondità viene calcolata a ritroso confrontando la distorsione del pattern proiettato (punti, strisce, ecc.) rispetto alla superficie dell'oggetto con un pattern di riferimento noto. Il Kinect originale (2010) e TrueDepth di Apple (Face ID dell'iPhone) utilizzano entrambi questo approccio: TrueDepth proietta più di 30.000 punti infrarossi su un volto per leggerne la forma 3D.

La ToF (Time of Flight) applica lo stesso principio del tempo di andata e ritorno della luce utilizzato dal LiDAR, in parallelo, per ogni pixel. Oltre alla misurazione diretta del tempo di andata e ritorno di un impulso (dToF), l'approccio dominante nelle telecamere di profondità per uso consumer e industriale è l'iToF: proietta luce continua modulata e ricava la distanza dallo sfasamento \Delta\phi tra il segnale emesso e quello riflesso. Con frequenza di modulazione f_{mod} e velocità della luce c, la distanza Z è data da

Z = \frac{c \cdot \Delta\phi}{4\pi f_{mod}}

Poiché non richiede triangolazione, non necessita di una linea di base tra un proiettore e una telecamera, il che ne facilita la miniaturizzazione ed elimina le parti mobili. I prodotti Microsoft a partire da Kinect v2 e Femto Bolt di Orbbec utilizzano questo approccio. Tutti e tre gli approcci si basano sulla luce infrarossa, quindi condividono una debolezza comune: la precisione tende a degradarsi all'aperto sotto la forte luce solare, ricca di infrarossi.

Diagram 1 · Use the button to switch views
Confronto tra configurazioni di sensori stereo attivi, a luce strutturata e a tempo di volo e i relativi indicatori di distanza: disparità, distorsione del pattern e sfasamento

Diagramma: Duskcoil. Le linee blu mostrano la luce proiettata; le linee arancioni tratteggiate mostrano la luce riflessa dal bersaglio. La stereoscopia attiva e la luce strutturata triangolano su una linea di base, mentre il ToF utilizza uno sfasamento temporale o di fase.

Confronto delle specifiche chiave dei prodotti

Prodotto Metodo Portata di profondità IMU integrata Utilizzo
Intel RealSense D435i Stereoscopia attiva (proiezione di pattern a infrarossi) Circa 0,3–3 m (fino a circa 10 m equivalenti in alcune condizioni) Bosch BMI055 (6 assi: accelerometro + giroscopio) SLAM, VR/AR, compensazione del movimento dei droni
Microsoft Kinect (originale, 2010) Luce strutturata (realizzata da PrimeSense) Circa 1,2–3,5 m Nessuno Rilevamento del movimento per la console di gioco Xbox 360. Profondità 320x240 a 30 fps

Orbbec Femto Bolt | ToF (utilizza tecnologia con licenza Microsoft) | Risoluzione di profondità fino a 1024x1024, campo visivo orizzontale di 120° | IMU a 6 assi | Annunciato nel 2023 come successore di Azure Kinect. 15 fps di profondità a 1024x1024 / 30 fps a 640x576, con una telecamera RGB 4K integrata |

Apple iPhone TrueDepth | Luce strutturata (proietta oltre 30.000 punti IR) | Portata molto ravvicinata, ottimizzato per l'autenticazione facciale | (funziona in combinazione con l'IMU dell'iPhone) | Riconoscimento facciale, Animoji, separazione del soggetto in modalità ritratto |

La D435i è la D435 base con l'aggiunta di un'unità di misura inerziale (IMU) a 6 assi (Bosch BMI055). I dati dell'IMU vengono emessi in sincronia temporale (allineamento temporale) con i dati di profondità, ed è proprio questo che permette di correggere il movimento della telecamera durante l'elaborazione di nuvole di punti e dati di profondità. La Kinect originale era basata sulla tecnologia a luce strutturata sviluppata dalla startup israeliana PrimeSense; il suo successore, Kinect v2, è passato alla tecnologia ToF (Time-of-Flight). Azure Kinect è uscito di produzione nel 2023, ma Microsoft ha concesso in licenza la sua tecnologia ToF a Orbbec, e il successore Femto Bolt utilizza lo stesso modulo telecamera di profondità di Azure Kinect, semplificando la migrazione per le applicazioni esistenti. La tecnologia TrueDepth dell'iPhone è una branca commerciale separata della stessa tecnologia a luce strutturata di PrimeSense: un esempio concreto di come una singola radice tecnologica possa ramificarsi in due applicazioni completamente diverse: "rilevamento del movimento nelle console di gioco" e "autenticazione facciale negli smartphone".

Come una tecnologia, PrimeSense, si è evoluta in Xbox, iPhone e robot industriali

L'azienda israeliana PrimeSense che ha creato Kinect — La tecnologia alla base del Kinect originale (rilasciato nel 2010) non è stata sviluppata internamente da Microsoft, bensì si tratta di una tecnologia di rilevamento della profondità a luce strutturata creata dalla startup israeliana PrimeSense. Kinect ha rapidamente superato le sue origini di console di gioco, trovando ampio impiego nella robotica accademica e commerciale: la combinazione di una risoluzione inferiore a 720p con acquisizione simultanea di profondità e RGB, a una frazione del costo del costoso LiDAR, rappresentava all'epoca un risultato straordinario per la ricerca robotica. Un articolo del 2011 di Richard Newcombe, Shahram Izadi e colleghi di Microsoft Research, "KinectFusion: Real-time dense surface mapping and tracking" (IEEE ISMAR 2011), ha dimostrato la mappatura 3D densa di superfici in tempo reale utilizzando nient'altro che una singola telecamera di profondità a basso costo e una GPU standard, diventando uno dei lavori fondanti della ricerca SLAM RGB-D.

L'acquisizione di PrimeSense da parte di Apple e la sua rinascita come Face ID — Nel novembre 2013, Apple ha acquisito PrimeSense per 360 milioni di dollari. Ciò non ha cancellato dal mercato la tecnologia a luce strutturata del Kinect originale: la sua discendenza tecnica è diventata il nucleo di Face ID, concretizzandosi nel sistema di fotocamere "TrueDepth" dell'iPhone X (un illuminatore a infrarossi, un proiettore di punti e una fotocamera a infrarossi) annunciato nel 2017. Si tratta di un caso insolitamente ampio di riutilizzo tecnologico: una tecnologia creata per il rilevamento del movimento nelle console di gioco è diventata, sette anni dopo, la tecnologia di autenticazione biometrica principale presente sugli smartphone, venduti a miliardi di unità.

Microsoft interrompe "di nuovo" la produzione di Kinect — Per oltre un decennio, Microsoft ha ripetutamente lanciato e poi interrotto la produzione di diverse generazioni di prodotti della famiglia Kinect: Kinect per Xbox 360, Kinect per Xbox One, Kinect per Windows v2 e Azure Kinect DK, orientato all'uso industriale e alla ricerca. L'interruzione della produzione di Azure Kinect DK, annunciata nell'agosto 2023, è stata l'ultima (e finora definitiva) "fine di Kinect" in questa linea di prodotti. Questa volta, però, non si è trattato di un completo abbandono: Microsoft ha scelto di concedere in licenza la sua tecnologia ToF a Orbbec, e il "Femto Bolt" di Orbbec è arrivato sul mercato con lo stesso modulo telecamera di profondità di Azure Kinect. È uno schema che ricorda l'acquisizione di PrimeSense avvenuta un decennio prima: una tecnologia che sopravvive a un passaggio di proprietà aziendale.

Parametri che determinano le prestazioni

  • Portata di profondità: la portata del D435i, di circa 0,3-3 metri (equivalente a circa 10 metri in alcune condizioni), è pensata per il rilevamento di ostacoli su un tavolo o intorno a degli scaffali per un robot da interni, o per usi a corto raggio come il tracciamento delle mani. Il monitoraggio esterno a lungo raggio è gestito al meglio da una telecamera stereo o da un LiDAR.
  • Scelta del metodo (stereo attivo / luce strutturata / ToF): Lo stereo attivo comporta il costo computazionale dell'allineamento stereo, ma può essere realizzato con componenti relativamente economici. La luce strutturata offre un'elevata precisione a distanza ravvicinata, adatta ad applicazioni ad alta precisione e a distanza ravvicinata come il Face ID, ma tende a incontrare vincoli di miniaturizzazione dovuti alla necessità di una linea di base tra il proiettore e la telecamera. Il ToF non richiede parti mobili o una linea di base, il che lo rende più facile da miniaturizzare, sebbene tenda a non eguagliare la precisione a distanza ravvicinata della luce strutturata. Femto Bolt, che integra una risoluzione di profondità di 1024x1024 in un corpo compatto, è un progetto che sfrutta proprio questo vantaggio di miniaturizzazione del ToF.
  • IMU integrata e sincronizzazione temporale: Per le applicazioni in cui la telecamera stessa si muove (a mano, montata su drone, robot mobile), la precisione con cui i dati di profondità e i dati IMU vengono sincronizzati temporalmente determina l'accuratezza della correzione della sfocatura da movimento. Le IMU integrate su D435i, Azure Kinect e Femto Bolt sono progettate specificamente per questo caso d'uso.
  • Tolleranza alla luce ambientale: tutti e tre gli approcci basati sugli infrarossi sono stabili in ambienti interni, ma la precisione tende a degradarsi all'esterno in presenza di forte luce solare, che sbiadisce il pattern proiettato o il segnale riflesso. Le applicazioni che si presume vengano eseguite all'aperto in genere devono ricorrere alla stereoscopia passiva (ZED, ecc.) o a una combinazione di approcci.
  • Texture degli oggetti: per la robotica indoor e la VR/AR che si occupano di bersagli con scarsa texture, come una parete bianca o un pavimento a tinta unita, un metodo attivo in grado di proiettare artificialmente un pattern a infrarossi offre un vantaggio. Tale vantaggio si riduce in ambienti esterni ricchi di texture.
  • Distanza minima di rilevamento: per le applicazioni che necessitano di rilevamento della profondità a distanza ravvicinata, come il tracciamento della mano o l'autenticazione facciale, il limite inferiore della portata di profondità determina direttamente l'usabilità. TrueDepth, progettato specificamente per un bersaglio a poche decine di centimetri di distanza (un volto), ne è l'esempio archetipico.

Stima dell'errore di distanza per metodo

Per la stereoscopia attiva, la relazione di base è Z=fB/d, quindi l'incertezza di disparità \sigma_d viene amplificata come

\sigma_Z\simeq\frac{Z^2}{fB}\sigma_d

Con f=600\,\mathrm{px}, B=0.05\,\mathrm{m}, Z=3\,\mathrm{m} e \sigma_d=0.25\,\mathrm{px}, l'errore di distanza è circa 7.5\,\mathrm{cm}. Un pattern proiettato aiuta la corrispondenza su una parete con scarsa texture, ma i punti possono scomparire sotto la forte luce solare o su materiali che assorbono gli infrarossi.

Per il ToF, i fattori dominanti sono la lettura di fase o di temporizzazione, la riflettività, il multipath e il tempo di integrazione. Pertanto, una risoluzione di profondità di 1024×1024 pixel non corrisponde alla deviazione standard di distanza. Quando si seleziona un dispositivo, mantenere costanti la distanza del target e il materiale e misurare il tasso di mancata ricezione, il tasso di valori anomali, la latenza del frame e l'offset del timestamp tra profondità, RGB e IMU.

Errore di distanza stereo attivo calcolato in base alla distanza, accanto ai percorsi di errore ToF separati per lettura di fase, multipath e bassa riflettanza

Figura 2 — I valori a sinistra sono calcolati a partire da f,B,\sigma_d dell'articolo. La figura a destra spiega perché l'errore casuale ToF, il bias e i ritorni non validi richiedono misurazioni separate. Questa non è una curva di prestazione del dispositivo.

Verifica la tua comprensione
La profondità mancante equivale a zero metri?

Significa che la distanza non è stata rilevata.

Definisci la gestione dei valori non validi anziché trattare i dati mancanti come un oggetto vicino o uno spazio libero.

Riferimenti

-

What to read next

Review the backgroundCome funzionano le telecamere stereo e i prodotti principali: ZED 2i, Subaru EyeSightContinue the seriesCome funzionano le IMU e i prodotti principali: Xsens, Bosch, Analog DevicesExplore another aspect of this fieldAnalisi del log di un'IMU stazionaria: bias, dispersione e deviazione di Allan.