Contents — find the section you need

L'estimation de pose peut inférer les articulations 2D ((u,v)), les articulations 3D, ou la rotation (R) et la translation (t) de l'objet. La projection peut être notée (\tilde p\sim K[R|t]P). L'étalonnage, la gestion des occlusions, l'ambiguïté gauche-droite et l'alignement temporel sont aussi importants que l'architecture du réseau.

Diagram 1 · Use the button to switch views
Image keypoint estimationAn image is transformed to feature heatmaps and keypoint or pose coordinates.imagefeatures/heatmapskeypoints/pose

Diagramme : Duskcoil, conceptuel. Il n'autorise pas l'identification ni la surveillance.

Utilisez une carte thermique ou une régression de coordonnées, PnP et un filtrage temporel. Évaluez les erreurs PCK, OKS ou de reprojection en fonction de l'occlusion, de l'éclairage, des vêtements, des aides techniques et des données démographiques. Pour une utilisation auprès de personnes, spécifiez le consentement, la limitation de l'utilisation, la durée de conservation et la vérification humaine des erreurs.

Méthodes et systèmes de coordonnées

Pour la pose humaine 2D, un réseau peut sélectionner le maximum d'une carte thermique pour chaque articulation, effectuer une régression directe des coordonnées, estimer une personne à la fois après détection (approche descendante) ou associer toutes les personnes à partir d'une image complète (approche ascendante). Pour la pose d'un objet 6D, PnP estime la rotation et la translation à partir de points 3D connus et des correspondances d'images. Une rotation R\in SO(3) obéit à R^TR=I,\det R=1 ; la régression directe des angles d'Euler présente des singularités et des discontinuités, c'est pourquoi des quaternions normalisés ou des représentations 6D continues sont utilisés.

Sortie Utilisation typique Métrique Échec
Point clé 2D Analyse de pose, interface utilisateur PCK, OKS Occlusion, inversion gauche-droite
Squelette 3D Analyse de mouvement, imitation de robot MPJPE Ambiguïté de profondeur, erreur de caméra
Pose d'un objet 6D Préhension, RA ADD, erreur de reprojection Symétrie, réflexion, valeurs aberrantes PnP

Gestion des données et des erreurs

Évaluer séparément l'occlusion, le contre-jour, les miroirs, la présence de plusieurs personnes, les dispositifs d'assistance, les vêtements, la morphologie, l'apparence de la peau et la hauteur de la caméra. Un score OKS moyen élevé ne garantit pas la latence et le taux d'erreur les plus faibles nécessaires à la détection de chutes ou à l'évitement d'obstacles par robot collaboratif. Ne pas réutiliser les points clés pour l'identification ou l'inférence émotionnelle sans consentement. Définir les procédures de limitation d'utilisation, de conservation, de contrôle d'accès, de suppression et d'appel.

Lors de la mise en œuvre, calibrer les paramètres intrinsèques et extrinsèques et documenter l'image, l'unité, l'horodatage et le niveau de confiance. En cas de faible confiance, ne pas considérer l'interpolation comme une vérité : ralentir le robot, l'arrêter ou demander une vérification humaine. Le lissage temporel réduit les saccades, mais ajoute un délai, qui doit être pris en compte dans la distance d'arrêt.

  1. Définir les sorties, les tolérances et la latence de la tâche.

  2. Séparer l'évaluation par attributs, occlusion et éclairage.

  3. Consigner l'étalonnage et les coordonnées. Transformations et valeurs aberrantes PnP.

  4. Tester les règles d'arrêt en cas de faible confiance, de perte de signal de la caméra et d'approche de personnes.

  5. Évaluation des points clés COCO

L'étalonnage et le temps doivent être gérés en dehors du réseau

L'erreur de pose n'est pas uniquement liée au réseau. Une distance focale ou un point principal incorrects rendent un point visuellement correct erroné en 3D. Conservez la même convention pour l'ordre de distorsion, le redimensionnement/recadrage, l'origine et le centre des pixels lors de l'entraînement et de l'inférence. Les paramètres extrinsèques varient avec les mouvements et les vibrations de la caméra ; il est donc important de revérifier l'erreur de reprojection par rapport à une cible de référence plutôt que de se fier indéfiniment à un seul étalonnage.

Avec plusieurs caméras ou une centrale inertielle (IMU), vérifiez les horodatages avant les images. Un retard d'une image de 30 images/s peut considérablement déplacer une main ou un outil rapidement. Enregistrez le temps matériel, le temps de réception, le temps d'achèvement de l'inférence et les échantillons utilisés pour l'interpolation. Une trajectoire parfaitement lissée peut s'avérer trop tardive pour éviter les collisions.

Choix du pipeline

Pipeline Avantage Besoins en calcul/données Principale défaillance
Monoculaire 2D Simple et économique Étiquettes 2D, une caméra Profondeur inconnue, occlusion
Monoculaire 3D Installation simple Données 3D a priori, données volumineuses Capture hors domaine, mise à l'échelle
Triangulation multivue Contrainte géométrique 3D Synchronisation, étalonnage, vues Correspondances erronées, hors champ de vision
RGB-D Profondeur directe Capteur de profondeur, limite de portée Réflexion, lumière du soleil, profondeur manquante
Points clés + PnP Utilise la CAO Correspondances 3D, paramètres intrinsèques Symétrie, valeurs aberrantes, disposition dégénérée

Normalisation de l'erreur 2D par la taille de la cible et des unités et du repère 3D. Pour les objets symétriques, la comparaison avec une rotation canonique peut indiquer une pose physiquement correcte comme erronée ; utiliser ADD-S ou une reprojection prenant en compte la symétrie et évaluer le dégagement de préhension. Rapport du 95e percentile, des erreurs manquées et des erreurs à haute confiance. et la latence de bout en bout, en plus de l'erreur moyenne.

Cas d'échec : inversion gauche-droite confirmée

Les miroirs, les vues arrière et l'auto-occlusion peuvent rendre géométriquement plausible une inversion gauche-droite du squelette. Le lissage peut figer l'erreur pendant plusieurs images. Combinez l'orientation, les indices visuels, plusieurs hypothèses et une limite de mouvement ; ne vous fiez pas uniquement aux contraintes de longueur osseuse. Dans les applications de sécurité, un niveau de confiance élevé n'est pas une preuve : utilisez la détection d'inversion et la divergence avec un capteur indépendant comme conditions d'arrêt.

Procédure d'implémentation reproductible

  1. Corrigez les repères image, caméra, monde et robot à l'aide d'un schéma et de données de test.

  2. Effectuez un test aller-retour des transformations de points clés après redimensionnement, remplissage et augmentation, en incluant une erreur sous-pixel connue.

  3. Définissez le seuil et le nombre minimal de points pour le RANSAC PnP ; vérifiez les points conformes, l'erreur de reprojection et la profondeur positive.

  4. Enregistrez les cas statiques, de marche, de mouvement rapide, d'occlusion, de contours d'image et de perte de signal de la caméra, avec la latence.

  5. Testez l'arrêt. et réinitialisation en cas de faible confiance, de déformation soudaine du squelette, de dérive d'étalonnage et d'inversion temporelle.

  6. Documenter l'objectif, l'accès, la conservation, l'anonymisation et la suppression des documents si les images originales sont stockées.

La pose est une hypothèse d'observation, et non l'identité, l'intention ou l'état d'une personne. Transmettre l'image, l'heure et l'incertitude aux systèmes en aval afin qu'ils puissent traiter les données « inconnues » en toute sécurité.

Qualité des annotations et audits opérationnels

Les annotations comportent également une part d'incertitude. Les centres des articulations sous les vêtements, les poignets occultés et l'orientation symétrique des objets varient d'un annotateur à l'autre. Stocker séparément les états visibles, occultés et hors cadre ; conserver les désaccords entre annotateurs, les révisions de définition et les points interpolés plutôt que de forcer l'ambiguïté dans une étiquette définitive. Conserver une image réelle de référence afin que les éléments synthétiques et les indices d'éclairage ne puissent pas dominer.

Les opérations peuvent être surveillées sans Conserver toutes les images indéfiniment. Calculer la confiance, le nombre d'articulations manquantes, l'erreur de reprojection, la latence, l'état de la caméra et les arrêts ; ne conserver que les données d'incident pendant une courte période à accès contrôlé. Lors des mises à jour du modèle, relire les vidéos identiques et comparer la durée des pertes d'images, les inversions gauche-droite et l'erreur maximale dans les zones dangereuses, puis recalibrer après le remplacement de la caméra.

Vérifiez votre compréhension
Les articulations 2D déterminent-elles de manière unique une pose 3D ?

La profondeur reste ambiguë. Consultez les vues supplémentaires, les mesures de profondeur ou les hypothèses du modèle corporel utilisées pour la résoudre.

What to read next

Review the backgroundGuide complet de SegFormer — Pourquoi un transformateur sans encodage positionnel fonctionne pour la segmentationContinue the seriesIntroduction à l'apprentissage automatique : Modèles génératifsExplore another aspect of this fieldÉvaluation comparative des LLM locaux : temps de réponse initial, taux de génération et mémoire