Contents — find the section you need

Fazit

Modellbasiertes Reinforcement Learning (MBRL) lernt ein Weltmodell \hat f, das Zustände und Aktionen auf vorhergesagte Folgezustände abbildet, Aktionssequenzen innerhalb dieses Modells testet und nur überwachte Aktionen auf die Hardware anwendet. Modellfreie Methoden lernen eine Strategie direkt aus der Belohnung. MBRL kann dateneffizienter sein und Einschränkungen ausdrücken, jedoch können Modellfehler dazu führen, dass nur der Simulator erfolgreich ist. Siehe RL-Grundlagen, Q-Learning, PPO/SAC und MPC.

Weltmodelle und Planung

Diagram 1 · Use the button to switch views
observationsworld modelMPC/policysafety monitor

Abbildung 1 – Konzeptuelles SVG, erstellt von Duskcoil, keine gemessenen Systemdaten.

Lerne \hat s_{t+1}=\hat f_\theta(s_t,a_t) und optimiere eine Zielfunktion mit gleitendem Horizont:

a_{t:t+H}^*=\arg\max\sum_{k=0}^{H-1}\gamma^k\hat r(\hat s_{t+k},a_{t+k})-\lambda C(\hat s,a)
Nur die erste Aktion wird ausgeführt, anschließend wird das System erneut beobachtet. Die Einschränkungen C können Kollisions-, Gelenk-, Temperatur-, Geschwindigkeits- oder Stromgrenzen darstellen. Hierbei ist s der Zustand und a die Aktion; das Modell sagt den nächsten Zustand voraus und \pi(a|s) kann Aktionen vorschlagen. Die gelernte Belohnung \hat r_\theta(s_t,a_t) wird zum Zeitpunkt t über den Horizont H ausgewertet. Im folgenden numerischen Beispiel wird ein Wagen mit der Masse 1\,\mathrm{kg} und dem Eingangssignal u verwendet.

Sim-to-Real, Identifizierung und Sicherheit

Einzelschrittfehler akkumulieren sich bei längeren Rollouts. Ensembles können Unsicherheiten abschätzen; Planer können Bereiche mit hoher Varianz vermeiden und kurze Horizonte nutzen. Die Domänenrandomisierung variiert Masse, Reibung, Verzögerung, Sensorauschen, Beleuchtung und Kameraposition. Die Systemidentifikation misst Trägheit, Reibung, Motorkonstanten und Latenz, sodass diese Bereiche nachvollziehbar und nicht willkürlich sind.

Wechsel von der Protokollierung über die Schattensteuerung bei niedriger Geschwindigkeit zu begrenzten überwachten Versuchen. Notstopp, unabhängige Geschwindigkeits-/Kraft-/Temperaturüberwachung, Stopp bei Kommunikationsverlust und Personentrennung sollten außerhalb der gelernten Strategie liegen. Häufige Fehler sind Simulationen mit fester Reibung, die zu Radschlupf führen, Überanpassung der Beleuchtung, Belohnungs-Hacking, das Vibrationen erzeugt, und Nicht modellierte Verzögerungen verursachen Instabilität. Meldung von Verstößen, Stoppdistanz, durch Unsicherheit ausgelöster Absenten und Worst-Case-Verhalten – nicht nur der durchschnittlichen Belohnung.

Modellfreie und modellbasierte Rollen

Modellfreies RL aktualisiert eine Strategie oder einen Wert direkt aus Erfahrungswerten. Es ist ausdrucksstark, wenn die Kontaktdynamik schwer zu modellieren ist, aber jede Verbesserung kann reale Versuche beanspruchen. MBRL verwendet jeden Übergang wieder, um einen Prädiktor zu trainieren und viele Kandidatensequenzen in diesem Prädiktor zu bewerten. Wenn der Prädiktor eine systematische Verzerrung aufweist, optimiert der Planer eine rein simulatorbasierte Abkürzung.

Aspekt Modellfrei Modellbasiert
Hardware-Daten niedrige bis mittlere Effizienz mittel bis hoch innerhalb des Modellbereichs
Laufzeit oft leichte Strategieinferenz Rollouts und Optimierung in jedem Zyklus
Einschränkungen üblicherweise eine indirekte Belohnungs-/Sicherheitsebene natürlich in das Planungsproblem zu integrieren
Hauptfehler schlechte Extrapolation aus spärlichen Daten Modellfehler über einen langen Zeitraum

Typische Anpassung | Komplexe Kontakt- und Sichtrichtlinien | Kurzfristige Bewegungs-, Energie- und Wärmeplanung |

Hybride Stacks sind üblich: Eine gelernte Richtlinie schlägt Kandidaten vor, ein gelerntes Modell prognostiziert einen Kurzzeithorizont, und MPC setzt Geschwindigkeits-, Kraft- und Strombeschränkungen durch. Verwenden Sie den PPO/SAC-Artikel und den MPC-Artikel, um Zeit- und Sicherheitsverantwortlichkeiten zuzuweisen, anstatt Algorithmen als Ersatz zu betrachten.

Unsicherheit nicht auf eine einzige Zahl reduzieren

Epistemische Unsicherheit entsteht durch fehlende Trainingsdaten; aleatorische Unsicherheit entsteht durch nicht reduzierbare Sensor- und Umgebungsvariationen. Eine Ensemble-Varianz ist ein nützliches Signal für die erste, aber ein Ensemble kann dennoch dieselbe Verzerrung aufweisen. Wenn die Vorhersagevarianz einen Schwellenwert überschreitet, verkürzen Sie den Horizont, reduzieren Sie die Geschwindigkeit, wechseln Sie zu einem klassischen Regler oder erfassen Sie eine weitere Messung, bevor Sie planen. Diese Absenzrichtlinie muss vor der Planung festgelegt werden. Einsatz.

Für den Ein-Schritt-Restwert e_t=s_{t+1}-\hat s_{t+1} sollten zusätzlich zum mittleren quadratischen Fehler auch Quantile und Worst-Case-Szenarien logarithmiert werden. Ein niedriger mittlerer Fehler kann einen großen Fehler kurz vor dem Kontakt verschleiern. Ein probabilistisches Vorhersageintervall darf niemals als Sicherheitszertifikat interpretiert werden; Kollisions-, Kraft-, Temperatur- und Strommessungen sollten unabhängig durchgeführt werden.

Design von Identifikationsexperimenten

Systemidentifikation ist ein Problem der Versuchsplanung, keine einfache Kalibrierung. Bei einem Motor sollten statische Reibung, Trägheit bei verschiedenen Drehzahlen, lastabhängiges Drehmoment und Kommunikationslaufzeit separat gemessen werden. Bei einem Hydraulikaktuator sollten Druck, Durchfluss, Zylindergeschwindigkeit, Öltemperatur und Ventilansteuerung mit einem Zeitstempel erfasst werden. Die Daten sollten nach Tag, Etage, Nutzlast, Beleuchtung und Temperatur aufgeteilt werden – nicht nach zufälligen benachbarten Frames –, sodass der endgültige Datensatz tatsächlich unvoreingenommen ist.

Eine kleine numerische Intuition

Betrachten Sie einen 1 kg schweren Wagen, dessen Geschwindigkeit sich alle T_s=0.1\,\mathrm{s} um 0.1u ändert. Ein reibungsfreies Modell sagt voraus: Die Geschwindigkeitszunahme von 0.5\,\mathrm{m/s} für u=1 über fünf Schritte. Verliert der reale Wagen pro Schritt durch Reibung 0.02\,\mathrm{m/s}, erreicht der Fehler über fünf Schritte 0.1\,\mathrm{m/s}. Ein kürzerer Zeithorizont, Online-Identifizierung, Spielraum in der Geschwindigkeitsbeschränkung und die Neuplanung anhand von Messungen gewährleisten die Nützlichkeit dieses einfachen Modells.

Zu veröffentlichende Nachweise

Neben den Gleichungen sollten die Trainingszeit, die Sensorrate, die Verzögerung, der Zufallsgenerator, die Umgebungsparameter, die Solver-Deadline und die Fallback-Strategie gespeichert werden. Vorhersageresiduen, Verletzungen von Nebenbedingungen, Bremsweg und durch Unsicherheit ausgelöste Absage sollten anhand derselben Experiment-ID wie die Belohnung grafisch dargestellt werden. Falls die Rohdaten nicht geteilt werden können, sollten anonymisierte Statistiken, Simulationseinstellungen, Einheiten und ein Referenzdatum veröffentlicht werden, um die Nachvollziehbarkeit der Aussage zu gewährleisten.

Überprüfen Sie Ihr Verständnis
Garantiert ein gelerntes Modell zuverlässige Langzeitprognosen? Rollouts?

Kleine Modellfehler akkumulieren sich über die Vorhersagen. Überprüfen Sie die Rollout-Länge, unbekannte Zustände und die Validierung in der realen Umgebung.

Referenzen

Weltmodelltypen und Planer

Physikalische Modelle sind interpretierbar, können aber bei Kontakt Probleme haben; latente und Ensemble-Modelle können effizient sein, erfordern jedoch eine Validierung hinsichtlich der Sicherheit im realen Raum. Kandidatenaktionen können Schießen, CEM oder differenzierbares MPC mit einem Deadline-Fallback verwenden.

Datenbereinigung

Markieren Sie gesättigte Sensoren, Zeitfehler, Limiter-Interventionen, interpolierte Werte und Endursachen. Halten Sie den Evaluierungsdatensatz unveränderlich, damit eine Modellaktualisierung keine Regression verschleiern kann.

Evidenz Grenzen

Vorhersagegenauigkeit, Belohnung und sicheres Hardwareverhalten sind separate Ansprüche. Veröffentlichen Sie die Metrik, die Testbedingungen und die verantwortliche Sicherheitsebene für jeden einzelnen Anspruch.

What to read next

Review the backgroundEinführung in das Belohnungsdesign – Warum die Frage „Was soll maximiert werden?“ der schwierigste Teil des RL istContinue the seriesEinführung in das Reinforcement Learning: Imitationslernen und inverses Reinforcement LearningExplore another aspect of this fieldEinführung in das Multi-Agent Reinforcement Learning – Optimierung in einer Welt, in der auch die Gegenseite lernt