Contents — find the section you need

Die Pose-Schätzung kann 2D-Gelenke ((u,v)), 3D-Gelenke oder die Rotation (R) und Translation (t) eines Objekts ableiten. Die Projektion kann als \tilde p\sim K[R|t]P dargestellt werden. Kalibrierung, Verdeckung, Links-Rechts-Mehrdeutigkeit und zeitliche Ausrichtung sind ebenso wichtig wie die Netzwerkarchitektur.

Die Pose-Schätzung kann 2D-Gelenke ((u,v)), 3D-Gelenke oder die Rotation (R) und Translation (t) eines Objekts ableiten.

Diagram 1 · Use the button to switch views
Image keypoint estimationAn image is transformed to feature heatmaps and keypoint or pose coordinates.imagefeatures/heatmapskeypoints/pose

Diagramm: Duskcoil, konzeptionell. Es autorisiert keine Identifizierung oder Überwachung.

Verwenden Sie Heatmaps oder Koordinatenregression, PnP und temporale Filterung. Bewerten Sie PCK, OKS oder Reprojektionsfehler anhand von Verdeckung, Beleuchtung, Kleidung, Hilfsmitteln und demografischen Daten. Bei der Verwendung mit Personenkontakt müssen Einwilligung, Zweckbindung, Aufbewahrung und manuelle Überprüfung auf Fehler festgelegt werden.

Methoden und Koordinatensysteme

Für die 2D-Körperhaltung kann ein Netzwerk für jedes Gelenk das Maximum einer Heatmap auswählen, Koordinaten direkt regressieren, die Position einer Person nach der Erkennung schätzen (Top-Down-Schätzung) oder alle Personen aus einem Gesamtbild zuordnen (Bottom-Up-Schätzung). Für die 6D-Objekthaltung schätzt PnP Rotation und Translation anhand bekannter 3D-Punkte und Bildkorrespondenzen. Eine Rotation R\in SO(3) gehorcht R^TR=I,\det R=1; die direkte Euler-Winkel-Regression weist Singularitäten und Diskontinuitäten auf, daher werden normalisierte Quaternionen oder kontinuierliche 6D-Darstellungen verwendet.

Ausgabe Typische Anwendung Metrik Fehler
2D-Keypoint Pose-Analyse, UI PCK, OKS Verdeckung, Links-Rechts-Vertauschung

3D-Skelett | Bewegungsanalyse, Roboterimitation | MPJPE | Tiefenunsicherheit, Kamerafehler |

6D-Objektpose | Greifen, AR | ADD, Reprojektionsfehler | Symmetrie, Spiegelung, PnP-Ausreißer |

Daten- und Fehlerbehandlung

Verdeckung, Gegenlicht, Spiegel, mehrere Personen, Hilfsmittel, Kleidung, Körperform, Hautbild und Kamerahöhe separat bewerten. Ein hoher mittlerer OKS-Wert beweist nicht die schlechteste Latenz und Fehlerrate, die für Sturzerkennung oder die Vermeidung von Kollisionen mit kollaborativen Robotern erforderlich sind. Keypoints dürfen nicht ohne Einwilligung zur Identitäts- oder Emotionserkennung verwendet werden. Zweckbindung, Aufbewahrung, Zugriffskontrolle, Löschung und Beschwerdeverfahren festlegen.

Bei der Implementierung intrinsische und extrinsische Parameter kalibrieren und Frame, Einheit, Zeitstempel und Konfidenz dokumentieren. Bei geringer Konfidenz die Interpolation nicht als verlässlich betrachten: Den Roboter verlangsamen, anhalten oder eine menschliche Überprüfung anfordern. Temporale Glättung reduziert Jitter, führt aber zu Verzögerungen, die beim Anhalten berücksichtigt werden müssen. Distanz.

  1. Definieren Sie Ausgaben, Toleranzen und Latenz für die Aufgabe.

  2. Teilen Sie die Auswertung nach Attributen, Verdeckung und Beleuchtung auf.

  3. Protokollieren Sie Kalibrierung, Koordinatentransformationen und PnP-Ausreißer.

  4. Testen Sie Abbruchregeln für geringe Konfidenz, Kameraausfall und sich nähernde Personen.

  5. COCO Keypoints-Auswertung

Kalibrierung und Zeit gehören nicht ins Netzwerk

Posefehler sind nicht nur ein Netzwerkproblem. Eine falsche Brennweite oder ein falscher Hauptpunkt führen dazu, dass ein visuell korrekter Punkt in 3D falsch erscheint. Halten Sie die Verzerrungsreihenfolge, die Größenänderung/den Zuschnitt, den Ursprung und die Konvention für den Pixelmittelpunkt beim Training und der Inferenz identisch. Extrinsische Parameter ändern sich mit Kamerabewegung und Vibration. Überprüfen Sie daher den Reprojektionsfehler anhand eines Referenzziels, anstatt sich dauerhaft auf eine Kalibrierung zu verlassen.

Bei mehreren Kameras oder einer IMU überprüfen Sie die Zeitstempel vor den Frames. Ein Frame mit 30 fps Verzögerung kann die Bewegung einer schnellen Hand oder eines Werkzeugs erheblich beeinflussen. Speichern Sie die Hardwarezeit, die Empfangszeit, die Zeit bis zum Abschluss der Inferenz und Für die Interpolation verwendete Samples. Selbst eine optimal geglättete Trajektorie kann für die Kollisionsvermeidung zu spät sein.

Pipeline-Optionen

Pipeline Nutzen Rechen-/Datenbedarf Hauptfehler
Monokulares 2D Kostengünstig und einfach 2D-Labels, eine Kamera Unbekannte Tiefe, Verdeckung
Monokulares 3D Einfache Installation 3D-Priordaten, große Datenmengen Erfassung außerhalb des Bereichs, Skalierung
Multi-View-Triangulation Geometrische 3D-Beschränkung Synchronisierung, Kalibrierung, Ansichten Falsche Korrespondenzen, außerhalb des Sichtfelds
RGB-D Direkte Tiefe Tiefensensor, Reichweitenbegrenzung Reflexion, Sonnenlicht, fehlende Tiefe
Keypoints + PnP Verwendet CAD 3D-Korrespondenzen, intrinsische Parameter Symmetrie, Ausreißer, degeneriertes Layout

Normalisierung des 2D-Fehlers anhand der Zielgröße und Festlegung der 3D-Einheiten und des Frames. Bei symmetrischen Objekten Vergleich mit einem kanonischen Frame. Rotation kann eine physikalisch korrekte Pose fälschlicherweise als falsch markieren. Verwenden Sie symmetriebewusstes ADD-S oder Reprojektion und bewerten Sie den Greifraum. Geben Sie neben dem mittleren Fehler auch das 95. Perzentil, Fehlalarme, Fehler mit hoher Konfidenz und die End-to-End-Latenz an.

Fehlerfall: Eine sichere Links-Rechts-Spiegelung

Spiegel, Rückansichten und Selbstverdeckung können ein links-rechts vertauschtes Skelett geometrisch plausibel erscheinen lassen. Glättung kann den Fehler über viele Frames fixieren. Kombinieren Sie Orientierung, sichtbare Hinweise, mehrere Hypothesen und eine Bewegungsbegrenzung; verlassen Sie sich nicht allein auf Knochenlängenbeschränkungen. In Sicherheitsanwendungen ist hohe Konfidenz kein Beweis – verwenden Sie Vertauschungserkennung und Abweichungen von einem unabhängigen Sensor als Abbruchbedingungen.

Reproduzierbares Implementierungsverfahren

  1. Fixieren Sie Bild-, Kamera-, Welt- und Roboter-Frames mithilfe eines Diagramms und Testdaten.

  2. Führen Sie nach Größenänderung, Padding und Augmentierung einen Roundtrip-Test der Keypoint-Transformationen durch, einschließlich eines bekannten Subpixel-Fehlers.

  3. Legen Sie den PnP-RANSAC-Schwellenwert fest. und minimale Punkte; prüfen Sie Inlier, Reprojektionsfehler und positive Tiefe.

  4. Zeichnen Sie statische, Geh-, schnelle Bewegungs-, Okklusions-, Bildkanten- und Kameraausfallfälle mit Latenz auf.

  5. Testen Sie Stopp und Reinitialisierung bei geringer Konfidenz, plötzlicher Skelettverformung, Kalibrierungsdrift und umgekehrter Zeit.

  6. Dokumentieren Sie Zweck, Zugriff, Aufbewahrung, Anonymisierung und Löschung, falls Originalbilder gespeichert werden.

Die Pose ist eine Beobachtungshypothese, nicht die Identität, Absicht oder der Zustand einer Person. Geben Sie Frame, Zeit und Unsicherheit an nachfolgende Systeme weiter, damit diese „unbekannt“ sicher behandeln können.

Annotationsqualität und Funktionsprüfungen

Auch Annotationen sind mit Unsicherheiten behaftet. Gelenkzentren unter Kleidung, verdeckte Handgelenke und die Ausrichtung symmetrischer Objekte variieren zwischen den Annotatoren. Speichern Sie sichtbare, verdeckte, Zustände außerhalb des Bildausschnitts sollten separat behandelt werden. Abweichungen zwischen Annotatoren, Definitionsänderungen und interpolierte Punkte sollten beibehalten werden, anstatt Mehrdeutigkeiten in eine feste Bezeichnung zu zwingen. Ein separates Bild mit realen Daten sollte verwendet werden, um zu verhindern, dass synthetisches Material und Lichteffekte dominieren.

Der Betrieb kann überwacht werden, ohne jedes Bild dauerhaft zu speichern. Konfidenzintervalle, Anzahl fehlender Gelenke, Reprojektionsfehler, Latenz, Kamerastatus und Stopps sollten aggregiert werden. Nur Ereignisdaten sollten für einen kurzen, zugriffskontrollierten Zeitraum gespeichert werden. Bei Modellaktualisierungen sollten identische Videos erneut abgespielt und die Ausfalldauer, Links-Rechts-Vertauschungen und der größte Fehler in Gefahrenbereichen verglichen werden. Nach dem Kamerawechsel sollte eine Neukalibrierung durchgeführt werden.

Überprüfen Sie Ihr Verständnis
Bestimmen 2D-Gelenke eindeutig eine 3D-Pose?

Die Tiefe bleibt mehrdeutig. Überprüfen Sie die zusätzlichen Ansichten, Tiefenmessungen oder Körpermodellannahmen, die zur Auflösung verwendet wurden.

What to read next

Review the backgroundEin ausführlicher Leitfaden zu SegFormer – Warum ein Transformer ohne Positionskodierung für die Segmentierung funktioniertContinue the seriesEinführung in das maschinelle Lernen: Generative ModelleExplore another aspect of this fieldBenchmark für lokale LLMs: Erste Antwortzeit, Generierungsrate und Speicher