Contents — find the section you need
Une caméra de profondeur capture la distance (profondeur) d'un objet pixel par pixel. Contrairement aux caméras stéréoscopiques, qui sont passives et détectent les disparités grâce à la lumière visible, la plupart des caméras de profondeur projettent activement une source lumineuse sur l'objet et déduisent la profondeur de la lumière réfléchie. On distingue trois grandes catégories de caméras de profondeur : la stéréoscopique active, qui projette un motif de points aléatoires à l'aide d'un émetteur infrarouge et effectue une correspondance stéréoscopique ; la lumière structurée, qui calcule la profondeur géométriquement à partir de la distorsion d'un motif connu ; et le temps de vol (ToF), qui calcule la distance directement à partir du temps de trajet aller-retour (ou déphasage) de la lumière. Ces trois types de caméras ont un point commun : grâce à l'utilisation d'un repère artificiel, elles peuvent capturer la profondeur même sur des cibles comme un mur blanc uni ou un sol de couleur unie, là où la stéréoscopique passive peine à détecter les disparités. Elles sont utilisées pour le SLAM en robotique d'intérieur, le suivi des mains en réalité virtuelle/augmentée, l'authentification faciale sur smartphone et la mesure 3D industrielle.
Kinect (2010, présenté à l'E3)
Intel RealSense D435Images : Kinect et Xbox 360 à l'E3 2010 (James Pfaff, CC BY 2.0) / Intel Caméra de profondeur RealSense D435 (Marc Auledas, CC BY-SA 4.0), toutes deux issues de Wikimedia Commons. La photo RealSense montre le modèle D435 de base, et non le D435i équipé d'une centrale inertielle (IMU) mentionné dans le texte.
Principe : trois approches actives
Stéréo active utilise un projecteur infrarouge pour projeter un motif de points aléatoire sur un objet. Deux caméras infrarouges effectuent ensuite une correspondance stéréoscopique en analysant le décalage de ce motif afin de calculer la profondeur. Le principe sous-jacent est la même triangulation que pour la stéréo passive (Z = fB/d, voir l'article sur les caméras stéréo), à la différence que la texture est ajoutée artificiellement. La gamme Intel RealSense D400 utilise cette approche.
Lumière structurée utilise la triangulation à l'aide d'une paire composée d'un projecteur émettant un motif connu et d'une seule caméra, au lieu de deux caméras. Une ligne de base est également définie entre le projecteur et la caméra, et la profondeur est calculée en comparant la distorsion du motif projeté (points, rayures, etc.) sur les surfaces de l'objet à un motif de référence connu. Le Kinect original (2010) et TrueDepth d'Apple (Face ID sur iPhone) utilisent tous deux cette approche : TrueDepth projette plus de 30 000 points infrarouges sur un visage pour en déduire sa forme 3D.
La technologie ToF (Time of Flight) applique le même principe de temps de parcours aller-retour de la lumière que le LiDAR, en parallèle, pour chaque pixel. Outre la mesure directe du temps de parcours aller-retour d'une impulsion (dToF), l'approche dominante pour les caméras de profondeur grand public et industrielles est l'iToF : elle projette une lumière continue modulée et calcule la distance à partir du déphasage entre le signal émis et le signal réfléchi. Avec une fréquence de modulation f_{mod} et la vitesse de la lumière c, la distance Z est donnée par :
Comme elle ne nécessite aucune triangulation, elle n'a pas besoin de ligne de base entre un projecteur et une caméra, ce qui facilite sa miniaturisation et élimine les pièces mobiles. Les produits Microsoft à partir de Kinect v2 et le Femto Bolt d'Orbbec utilisent cette approche. Ces trois approches reposent sur la lumière infrarouge et partagent donc une faiblesse commune : la précision tend à se dégrader en extérieur sous un fort ensoleillement, riche en infrarouge.
Schéma : Bobine crépusculaire. Les lignes bleues représentent la lumière projetée ; les lignes orange pointillées représentent la lumière réfléchie par la cible. La stéréovision active et la lumière structurée utilisent la triangulation sur une ligne de base, tandis que le ToF (temps de vol) utilise un déphasage ou un décalage temporel.
Comparaison des spécifications clés des produits
| Produit | Méthode | Portée en profondeur | Centrale inertielle intégrée | Utilisation |
|---|---|---|---|---|
| Intel RealSense D435i | Stéréovision active (projection de motifs infrarouges) | Environ 0,3–3 m (jusqu'à environ 10 m dans certaines conditions) | Bosch BMI055 (6 axes : accéléromètre + gyroscope) | SLAM, VR/AR, compensation de mouvement pour drones |
| Microsoft Kinect (original, 2010) | Lumière structurée (conçu par PrimeSense) | Environ 1,2–3,5 m | Aucun | Détection de mouvement pour la console de jeux Xbox 360. Profondeur 320 x 240 à 30 images/s |
| Microsoft Kinect v2 / Azure Kinect | ToF | (Les spécifications officielles varient selon l'application) | Azure Kinect intègre une centrale inertielle (IMU) | Lancée en 2020 pour la réalité mixte, la robotique et les applications industrielles, Azure Kinect a été abandonnée en 2023 |
| Orbbec Femto Bolt | ToF (technologie sous licence Microsoft) | Résolution de profondeur jusqu'à 1024 x 1024, champ de vision horizontal de 120° | Centrale inertielle 6 axes | Annoncée en 2023 comme successeur d'Azure Kinect. 15 images/s en profondeur à 1024 x 1024 / 30 images/s à 640 x 576, avec une caméra RVB 4K intégrée |
| Apple iPhone TrueDepth | Lumière structurée (projette plus de 30 000 points infrarouges) | Portée très courte, optimisée pour l'authentification faciale | (fonctionne avec la centrale inertielle de l'iPhone) | Face ID, Animoji, séparation du sujet en mode portrait |
La D435i est la D435 de base à laquelle on a ajouté une centrale inertielle (IMU) à 6 axes (Bosch BMI055). Les données de son IMU sont synchronisées temporellement (alignées sur l'horodatage) avec les données de profondeur, ce qui lui permet de corriger les mouvements de la caméra lors du traitement de la profondeur et des nuages de points. La Kinect originale reposait sur la technologie de lumière structurée développée par la start-up israélienne PrimeSense ; son successeur, la Kinect v2, est passée à la technologie ToF (temps de vol). La production d'Azure Kinect a cessé en 2023, mais Microsoft a concédé une licence pour sa technologie de temps de vol à Orbbec, et son successeur, le Femto Bolt, utilise le même module de caméra de profondeur qu'Azure Kinect, facilitant ainsi la migration pour les applications existantes. TrueDepth de l'iPhone est une branche commerciale distincte de cette même lignée de lumière structurée PrimeSense — un exemple concret d'une même technologie se scindant en deux applications totalement différentes : la détection de mouvements pour consoles de jeux et l'authentification faciale pour smartphones.
Comment une technologie, PrimeSense, a donné naissance à la Xbox, à l'iPhone et aux robots industriels
PrimeSense, la société israélienne à l'origine de Kinect — La technologie de base du Kinect original (sorti en 2010) n'a pas été développée en interne chez Microsoft ; il s'agissait d'une technologie de détection de profondeur par lumière structurée, conçue par la start-up israélienne PrimeSense. Kinect a rapidement dépassé le cadre des consoles de jeux et a trouvé de nombreuses applications dans la robotique académique et commerciale : la combinaison d'une résolution inférieure à 720p avec la capture simultanée de la profondeur et des données RVB, à un coût bien inférieur à celui du LiDAR, représentait une avancée remarquable pour la recherche en robotique à l'époque. Un article de 2011, signé par Richard Newcombe, Shahram Izadi et leurs collègues de Microsoft Research, intitulé « KinectFusion : Real-time dense surface mapping and tracking » (IEEE ISMAR 2011), a démontré la cartographie 3D dense de surfaces en temps réel à l'aide d'une simple caméra de profondeur à bas coût et d'un GPU standard, devenant ainsi l'un des travaux fondateurs de la recherche sur le SLAM RVB-D.
L'acquisition de PrimeSense par Apple et sa renaissance sous le nom de Face ID — En novembre 2013, Apple a acquis PrimeSense pour 360 millions de dollars. Cette acquisition n'a pas fait disparaître la technologie de lumière structurée du Kinect original du marché : son héritage technique est devenu le cœur de Face ID, concrétisé par le système de caméra « TrueDepth » de l'iPhone X (un illuminateur infrarouge, un projecteur de points et une caméra infrarouge) annoncé en 2017. Il s'agit d'un cas exceptionnellement large de réutilisation technologique : une technologie conçue pour la détection de mouvements des consoles de jeux est devenue, sept ans plus tard, la technologie d'authentification biométrique de base intégrée aux smartphones à l'échelle d'un milliard d'unités.
Microsoft abandonne « à nouveau » Kinect — Depuis plus d'une décennie, Microsoft a lancé puis abandonné à plusieurs reprises des générations successives de produits de la famille Kinect : Kinect pour Xbox 360, Kinect pour Xbox One, Kinect pour Windows v2 et le kit de développement Azure Kinect destiné à l'industrie et à la recherche. L'arrêt du kit de développement Azure Kinect, annoncé en août 2023, a marqué la dernière (et jusqu'à présent la dernière) fin de la gamme Kinect. Cependant, cette fois-ci, il ne s'agissait pas d'un retrait total : Microsoft a choisi de concéder sa technologie ToF sous licence à Orbbec, et le « Femto Bolt » d'Orbbec a été commercialisé, intégrant le même module de caméra de profondeur qu'Azure Kinect. Ce schéma rappelle l'acquisition de PrimeSense une décennie plus tôt : une technologie qui survit à un changement de propriétaire.
Paramètres déterminant les performances
-
Portée en profondeur : La portée du D435i, d'environ 0,3 à 3 m (jusqu'à 10 m dans certaines conditions), est idéale pour la détection d'obstacles sur une table ou autour d'étagères pour un robot d'intérieur, ou pour des applications de proximité comme le suivi des mains. La surveillance extérieure à longue portée est mieux assurée par une caméra stéréoscopique ou un LiDAR.
-
Choix de la méthode (stéréoscopique active / lumière structurée / ToF) : La stéréoscopique active implique un coût de calcul plus élevé pour la mise en correspondance stéréoscopique, mais peut être réalisée avec des composants relativement peu coûteux. La lumière structurée offre une grande précision à courte portée, convenant aux applications de très haute précision comme la reconnaissance faciale, mais sa miniaturisation est souvent limitée par la nécessité d'une ligne de base entre le projecteur et la caméra. La technologie ToF ne nécessite ni pièces mobiles ni ligne de base, ce qui facilite sa miniaturisation, même si sa précision à courte portée est généralement inférieure à celle de la lumière structurée. La Femto Bolt, avec sa résolution de profondeur de 1024 x 1024 pixels intégrée dans un boîtier compact, tire précisément parti de cet avantage de miniaturisation propre à la technologie ToF.
-
Centrale inertielle intégrée et synchronisation temporelle : Pour les applications où la caméra est en mouvement (caméra portable, drone, robot mobile), la précision de la synchronisation temporelle des données de profondeur et des données de la centrale inertielle détermine la précision de la correction du flou de mouvement. Les centrales inertielles intégrées des D435i, Azure Kinect et Femto Bolt sont conçues spécifiquement pour ce cas d'utilisation.
-
Tolérance à la lumière ambiante : Les trois approches infrarouges sont stables en intérieur, mais leur précision tend à se dégrader en extérieur sous un fort ensoleillement, qui altère le motif projeté ou le signal réfléchi. Les applications destinées à fonctionner en extérieur doivent généralement recourir à la stéréoscopie passive (ZED, etc.) ou à une combinaison de plusieurs approches.
-
Texture de l'objet : Pour la robotique d'intérieur et la VR/AR traitant de cibles peu texturées (mur blanc, sol uni), une méthode active capable de projeter artificiellement un motif infrarouge est avantageuse. Cet avantage diminue dans les environnements extérieurs riches en textures.
-
Distance de détection minimale : Pour les applications nécessitant la mesure de la profondeur à très courte portée (suivi des mains, authentification faciale), la limite inférieure de la portée de profondeur détermine directement l'utilisabilité. TrueDepth, conçu spécifiquement pour une cible située à quelques dizaines de centimètres (un visage), en est l'exemple type.
Estimation de l'erreur de portée par méthode
Pour la stéréoscopie active, la relation de base est Z=fB/d, l'incertitude de disparité \sigma_d est donc amplifiée comme suit :
Avec f=600\,\mathrm{px}, B=0.05\,\mathrm{m}, Z=3\,\mathrm{m} et \sigma_d=0.25\,\mathrm{px}, l'erreur de portée est d'environ 7.5\,\mathrm{cm}. Un motif projeté facilite la mise en correspondance sur un mur peu texturé, mais les points peuvent disparaître sous un fort ensoleillement ou sur des matériaux absorbant les infrarouges.
Pour la tonalité de temps de vol (ToF), la lecture de phase ou de synchronisation, la réflectivité, les trajets multiples et le temps d'intégration sont les facteurs prédominants. Par conséquent, une résolution de profondeur de 1024 × 1024 pixels ne correspond pas à la spécification d'écart type de la portée. Lors du choix d'un appareil, maintenez la distance cible et le matériau constants et mesurez le taux de retours manquants, le taux de valeurs aberrantes, la latence d'image et le décalage temporel entre la profondeur, le RGB et l'IMU.
Figure 2 — Les valeurs de gauche sont calculées à partir de f,B,\sigma_d de l'article. Celle de droite explique pourquoi l'erreur aléatoire, le biais et les retours invalides du ToF nécessitent des mesures séparées. Ceci n'est pas une courbe de performance de l'appareil.
Une profondeur manquante équivaut-elle à zéro mètre ?
Cela signifie que la portée n'a pas pu être mesurée.
Définissez une gestion des valeurs invalides plutôt que de considérer les données manquantes comme un objet proche ou un espace libre. ## Références - [Page produit Intel RealSense D435i](https://www.intelrealsense.com/depth-camera-d435i/) - [Kinect (Wikipédia)](https://en.wikipedia.org/wiki/Kinect) - [Azure Kinect (Wikipédia)](https://en.wikipedia.org/wiki/Azure_Kinect) - [Microsoft annonce l'arrêt de la production du kit de développement Azure Kinect (Communauté technique Microsoft)](https://techcommunity.microsoft.com/t5/mixed-reality-blog/microsoft-s-azure-kinect-developer-kit-technology-transfers-to/ba-p/3899122) - [Page produit Orbbec Femto Bolt](https://www.orbbec.com/products/tof-camera/femto-bolt/) - [Présentation de la collaboration Orbbec x Microsoft](https://www.orbbec.com/microsoft-collaboration/) - [Microsoft ne cesse d'abandonner Kinect (TechCrunch)](https://techcrunch.com/2023/08/22/microsoft-cant-stop-discontinuing-kinect/) - [Article sur PrimeSense d'Apple] Acquisition](https://www.popsci.com/apple-face-ID/) - Fonctionnement de TrueDepth/Face ID sur iPhone (Structure)](https://structure.io/blog/the-power-of-pocket-3d-scanning-how-apples-truedepth-transformed-mobile-tech/) - Article KinectFusion (IEEE ISMAR 2011)](https://research.lancaster-university.uk/en/publications/kinectfusion-real-time-dense-surface-mapping-and-tracking/) - Détection de distance avec Kinect : Kinect à lumière structurée versus Kinect à temps de vol (arXiv:1505.05459)](https://arxiv.org/pdf/1505.05459)
Commentaires
Veuillez vous connecter.
Aucune entrée pour le moment.