Contents — find the section you need

Einem Roboter beizubringen, eine Tasse sicher abzustellen, einer Person in einem engen Gang auszuweichen oder ein komplexes Werkzeug zu bedienen, ist oft schwieriger als gedacht, da die Belohnung schwer zu definieren ist. Die Belohnung der zurückgelegten Entfernung zum Ziel kann dazu verleiten, Objekte beiseitezuschieben; die Belohnung allein des erfolgreichen Abschlusses liefert möglicherweise kein sinnvolles Signal für die Erkundung. Imitationslernen nutzt Demonstrationen von Menschen, Fernbedienern oder eine bestehende Richtlinie, um Aktionen aus Beobachtungen zu lernen. Inverses Reinforcement Learning (IRL) hingegen versucht, das Ziel – oder die Belohnung – zu erschließen, das/die das demonstrierte Verhalten sinnvoll macht, und leitet daraus eine Richtlinie für dieses Ziel ab.

Keine der beiden Methoden wird allein durch die Verwendung menschlicher Daten sicher. Die zentralen Fragen sind: Was bewirkt eine Richtlinie in Zuständen, die nicht demonstriert wurden? Wie werden Labels zeitlich erfasst und zugeordnet? Wie werden Fehler erfasst? Und was begrenzt unabhängig eine physische Aktion? Dieser Artikel verknüpft Verhaltensklonierung (BC), Kovariatenverschiebung, DAgger, IRL, Vision-Language-Action-Modelle, Evaluierung, Sicherheit und Datenherkunft. Siehe Grundlagen des Reinforcement Learning, PPO und SAC und VLA-Einführung für verwandte Konzepte.

Praktische Schlussfolgerung

  • BC ist überwachtes Lernen vom demonstrierten Zustand s zur Expertenaktion a. Es startet schnell, aber ein kleiner Fehler zu Beginn kann die Policy in eine Zustandsverteilung führen, die sie noch nie gesehen hat.

  • DAgger führt die aktuelle Policy in einer kontrollierten Umgebung aus, fragt einen Experten nach der Aktion in Zuständen, die die Policy tatsächlich besucht, aggregiert diese Labels und trainiert die Policy neu. Es wandelt Fehlermodi in Daten um, erfordert aber eine sichere Ausführung und zuverlässige Expertenintervention.

  • IRL schätzt eine Belohnung r_\theta(s,a) aus Demonstrationen und optimiert dann eine Policy dafür. Belohnungen sind nicht eindeutig identifizierbar; sie werden anhand des Verhaltens unter festgelegten Bedingungen und expliziten Sicherheitsvorgaben beurteilt, nicht anhand einer plausibel wirkenden Heatmap.

– Eine VLA kann eine umfangreiche bedingte Imitationsrichtlinie sein, doch Sprache und Bildskalierung heben physikalische Grenzen, Timing, Kontaktsicherheit oder einen sicheren Stopppfad nicht auf.

Demonstrationen sind Betriebsaufzeichnungen, nicht nur Videos

Eine nutzbare Demonstration vereint Beobachtungen (Bilder, Tiefe, Kraft, Gelenkzustand), Aktionen (Gelenkbefehl, Geschwindigkeit, Greifer, Stopp), Zeitstempel, Frames, Aufgabenanweisungen, Erfolg/Misserfolg, Bediener, Umgebungsbedingungen und Eingriffsereignisse. Wenn der protokollierte Befehl das ist, was nach einer Transportverzögerung beim Roboter ankam, anstatt dem vom Bediener beabsichtigten Befehl, gehört die Verzögerung in den Datensatz. Ein Bild-zu-Arm-Offset von 100 ms führt zu inkonsistenten Trainingspaaren bei korrektem Verhalten.

Die Datenherkunft umfasst die Einwilligung des Datensammlers, die Genehmigung für die Aufzeichnungsumgebung, den Datenschutz, Werke Dritter, die Verantwortung für die Robotersicherheit und die Möglichkeit, eine Probe bis zu ihrer Quelle zurückzuverfolgen. Die Verwendung öffentlicher Datensätze erfordert die Prüfung von Lizenz, Nutzungsbedingungen, Weitergabebestimmungen, Personen- und Audioaufnahmen sowie Kalibrierung für den vorgesehenen Zweck. „Im Internet gefunden“ ist kein Herkunftsnachweis; es bedeutet das Fehlen einer nachweisbaren Einwilligung und entsprechender Nutzungsbedingungen.

Diagram 1 · Use the button to switch views
Lerne aus Demonstrationen; aggregierte besuchte Zustände

Diagramm: Duskcoil, konzeptionell. Ein Rollout ist eine reale Datenerfassung; das Diagramm impliziert nicht, dass Sicherheitsüberwachung, Stopplogik oder Bedienereingriffe weggelassen werden können.

Verhaltensklonierung und Kovariatenverschiebung

Bei gegebenen Expertenpaaren D=\{(s_i,a_i^*)\}_{i=1}^N kann kontinuierliches BC die Anzahl der besuchten Zustände minimieren.

\min_\theta\;\mathcal L_{BC}(\theta)=\frac1N\sum_{i=1}^N\lVert\pi_\theta(s_i)-a_i^*\rVert_2^2

Diskrete Aktionen verwenden Kreuzentropie. Wenn mehr als eine Aktion gültig ist, kann eine einzelne quadratische Fehlervorhersage „links passieren“ und „rechts passieren“ zu einer unsicheren mittleren Aktion mitteln; bedingte Verteilungen, Mischungsmodelle oder Diffusionsstrategien können mehrere Modi darstellen. Kontext, Bedienerstil und Aufgabenstellung sind wichtig.

BC ist attraktiv, da es offline vor der Belohnungsgestaltung oder Exploration trainiert werden kann. Seine größte Schwäche ist, dass Demonstrationen aus der Expertenzustandsverteilung d_{\pi^*}(s) stammen, während die Bereitstellung d_{\pi_\theta}(s) erzeugt. Kleine Fehler Die nächste Beobachtung kann sich ändern und sich verstärken. In vereinfachten Analysen kann der Fehler eines einzelnen Schritts \epsilon über einen sequenziellen Horizont T bis zur Größenordnung O(T^2\epsilon) anwachsen; die genaue Grenze hängt von Annahmen ab, aber der kausale Punkt ist dauerhaft: Eine Strategie erzeugt ihre eigenen zukünftigen Eingaben.

DAgger: Aggregieren von Labels, wo der Lernprozess stattfindet

Die Datensatzaggregation führt die gelernte Strategie unter kontrollierten Bedingungen aus, fordert die gewünschte Expertenaktion a^* im tatsächlich besuchten Zustand s an, fügt das Paar zu D hinzu und trainiert neu. Strategiemischungen können während der Iterationen verwendet werden. Die Methode bringt die Trainingsverteilung in Richtung der Einsatzverteilung.

DAgger ist keine generelle Erlaubnis, einen Roboter in der Öffentlichkeit versagen zu lassen. Beginnen Sie mit Simulation, niedriger Geschwindigkeit, physischen Schutzvorrichtungen, ferngesteuertem Not-Aus, sofortiger Expertenübernahme und einem Aktionssicherheitsfilter. Labels können Aktionen sein, die der Experte physisch ausgeführt hat, oder kontrafaktische Antworten auf die Frage „Was hätte sein sollen?“. Was ist hier passiert? Letzteres kann zwar wertvoll sein, erhöht aber den Arbeitsaufwand der Experten, die Latenz und die subjektive Varianz. Die Planung sollte sich auf unentdeckte Fehlermodi konzentrieren – nicht nur auf die Zeilenanzahl.

IRL: Zielsetzung ableiten statt Aktionen kopieren

IRL schätzt die Belohnung r_\theta(s,a) oder r_\theta(s,a,s') anhand der Expertenstrategie \pi_E. Die Intuition der maximalen Entropie besagt, dass Expertentrajektorien hohe Belohnungen bevorzugen, ohne unter ähnlich guten Trajektorien unnötig deterministisch zu sein. Konzeptionell ist die Wahrscheinlichkeit der Trajektorie \tau:

p_\theta(\tau)\propto\exp\left(\sum_t r_\theta(s_t,a_t)\right)

Die Aktualisierung von \theta zur Erhöhung der Wahrscheinlichkeit der Expertentrajektorie führt zu einer Belohnung, die mit Reinforcement Learning (RL) oder optimaler Steuerung kombiniert werden kann. Dies passt sich möglicherweise besser an neue Anfangszustände oder Nebenbedingungen an als direktes BC, da die Zielsetzung neu optimiert werden kann.

Viele Belohnungen können jedoch dieselben Demonstrationen erklären; unbeobachtete Nebenbedingungen. Bedienergewohnheiten können in eine erlernte Belohnung einfließen. Eine Belohnung, die Trainingsverläufe erklärt, kann gefährlich generalisieren. GAIL-Methoden gleichen stattdessen die Belegungsverteilungen von Experten und Lernenden mithilfe eines Diskriminators ab. Keine der beiden Formulierungen rechtfertigt das Erlernen eines Verbots – Kollision, Quetschkraft, menschlicher Ausschlussbereich – allein durch Schlussfolgerung. Explizite Sicherheitsregeln bleiben explizit.

Verbindung zu VLA

Ein Vision-Language-Action-Modell (VLA) knüpft die nächste Aktion oder einen Aktionsabschnitt an Bilder, Sprache und Roboterzustand. Im weitesten Sinne handelt es sich um groß angelegte bedingte Imitation. Der Umfang der Objekte und der Sprache garantiert keine Extrapolation auf neue Lichtverhältnisse, Reibung, Kameraposition, mehrdeutige Anweisungen oder Kontaktkraftgrenzen. Ein VLA, das „Stell die Tasse ins Regal“ interpretiert, zertifiziert nicht selbst Kraft, Kollisionsabstand, Gelenkbereich oder Bremsweg; siehe VLA Primer.

Validieren Sie Koordinatensystem, Einheiten, Geschwindigkeit, Beschleunigung und Aktualität, bevor eine Aktion einen Aktor erreicht. Leiten Sie die Daten durch Kinematik, Kollisionsprüfung und einen Impedanz- oder Positions-/Geschwindigkeitsregler. Mehrdeutige Formulierungen sollten eine Klärung, Ablehnung oder einen Modus mit niedriger Geschwindigkeit auslösen; eine eingeschränkte Wahrnehmung sollte die Ausführung stoppen. Der Datenumfang ersetzt keine physikalischen Sicherheitsgrenzen.

Bewertung, Sicherheit und Herkunft

Genehmigen Sie eine Richtlinie nicht allein aufgrund eines Fehlers bei Offline-Aktionen. Erstellen Sie separate Bewertungen für die Ausgangsposition, Objekte, Beleuchtung, Hintergründe, Reibung, Latenz, Anweisungsformulierung und Störungen. Berichten Sie über Erfolg, Kollision, Stopp, Anzahl der Interventionen, Spitzenkraft, Ausführungszeit und die schlimmsten beobachteten Fälle. Eine hohe durchschnittliche Erfolgsrate deckt seltene Risiken für Mensch oder Gerät nicht ab. Verfolgen Sie jede DAgger-Iteration, Quelldemonstration, Kennzeichnung, Aufteilung, Modell, Schwellenwerte, Fehler und Rücksetzpfad.

Ebene Überprüfen Reaktion auf Fehler
Daten Einwilligung, Lizenz, Zeit, Frame, Herkunft von Erfolg/Fehler Quarantäne, Neukennzeichnung, Nutzungsstopp
Richtlinie Ausgesetzte Zustände, Verschiebung, Aktionsunsicherheit Langsam, Expertenanfrage, Erinnerung
Aktorik Grenzwerte, Rate, Kollision, Kraft, Kommunikation Sicherheitsfilter, Stopp, Not-Aus
Betrieb Supervisor, Wiederherstellung, Protokolle, Änderungskontrolle Rollback und Ursachenanalyse
Überprüfen Sie Ihr Verständnis
Ermittelt die Imitation die Gründe des Demonstrators?

Verhalten zu reproduzieren und Belohnung abzuleiten sind unterschiedliche Aufgaben. Mehrere Belohnungen können dasselbe Verhalten erklären. Überprüfen Sie daher die Annahmen des realen Lernens.

Referenzen

What to read next

Review the backgroundModellbasiertes Reinforcement Learning und Sim-to-RealContinue the seriesπ0 erklärt – Wie Flow Matching die VLA-Aktionsgenerierung verändert hatExplore another aspect of this fieldEinführung in das Multi-Agent Reinforcement Learning – Optimierung in einer Welt, in der auch die Gegenseite lernt