Contents — find the section you need
Fazit
Modellbasiertes Reinforcement Learning (MBRL) lernt ein Weltmodell \hat f, das Zustände und Aktionen auf vorhergesagte Folgezustände abbildet, Aktionssequenzen innerhalb dieses Modells testet und nur überwachte Aktionen auf die Hardware anwendet. Modellfreie Methoden lernen eine Strategie direkt aus der Belohnung. MBRL kann dateneffizienter sein und Einschränkungen ausdrücken, jedoch können Modellfehler dazu führen, dass nur der Simulator erfolgreich ist. Siehe RL-Grundlagen, Q-Learning, PPO/SAC und MPC.
Weltmodelle und Planung
Abbildung 1 – Konzeptuelles SVG, erstellt von Duskcoil, keine gemessenen Systemdaten.
Lerne \hat s_{t+1}=\hat f_\theta(s_t,a_t) und optimiere eine Zielfunktion mit gleitendem Horizont:
Sim-to-Real, Identifizierung und Sicherheit
Einzelschrittfehler akkumulieren sich bei längeren Rollouts. Ensembles können Unsicherheiten abschätzen; Planer können Bereiche mit hoher Varianz vermeiden und kurze Horizonte nutzen. Die Domänenrandomisierung variiert Masse, Reibung, Verzögerung, Sensorauschen, Beleuchtung und Kameraposition. Die Systemidentifikation misst Trägheit, Reibung, Motorkonstanten und Latenz, sodass diese Bereiche nachvollziehbar und nicht willkürlich sind.
Wechsel von der Protokollierung über die Schattensteuerung bei niedriger Geschwindigkeit zu begrenzten überwachten Versuchen. Notstopp, unabhängige Geschwindigkeits-/Kraft-/Temperaturüberwachung, Stopp bei Kommunikationsverlust und Personentrennung sollten außerhalb der gelernten Strategie liegen. Häufige Fehler sind Simulationen mit fester Reibung, die zu Radschlupf führen, Überanpassung der Beleuchtung, Belohnungs-Hacking, das Vibrationen erzeugt, und Nicht modellierte Verzögerungen verursachen Instabilität. Meldung von Verstößen, Stoppdistanz, durch Unsicherheit ausgelöster Absenten und Worst-Case-Verhalten – nicht nur der durchschnittlichen Belohnung.
Modellfreie und modellbasierte Rollen
Modellfreies RL aktualisiert eine Strategie oder einen Wert direkt aus Erfahrungswerten. Es ist ausdrucksstark, wenn die Kontaktdynamik schwer zu modellieren ist, aber jede Verbesserung kann reale Versuche beanspruchen. MBRL verwendet jeden Übergang wieder, um einen Prädiktor zu trainieren und viele Kandidatensequenzen in diesem Prädiktor zu bewerten. Wenn der Prädiktor eine systematische Verzerrung aufweist, optimiert der Planer eine rein simulatorbasierte Abkürzung.
| Aspekt | Modellfrei | Modellbasiert |
|---|---|---|
| Hardware-Daten | niedrige bis mittlere Effizienz | mittel bis hoch innerhalb des Modellbereichs |
| Laufzeit | oft leichte Strategieinferenz | Rollouts und Optimierung in jedem Zyklus |
| Einschränkungen | üblicherweise eine indirekte Belohnungs-/Sicherheitsebene | natürlich in das Planungsproblem zu integrieren |
| Hauptfehler | schlechte Extrapolation aus spärlichen Daten | Modellfehler über einen langen Zeitraum |
Typische Anpassung | Komplexe Kontakt- und Sichtrichtlinien | Kurzfristige Bewegungs-, Energie- und Wärmeplanung |
Hybride Stacks sind üblich: Eine gelernte Richtlinie schlägt Kandidaten vor, ein gelerntes Modell prognostiziert einen Kurzzeithorizont, und MPC setzt Geschwindigkeits-, Kraft- und Strombeschränkungen durch. Verwenden Sie den PPO/SAC-Artikel und den MPC-Artikel, um Zeit- und Sicherheitsverantwortlichkeiten zuzuweisen, anstatt Algorithmen als Ersatz zu betrachten.
Unsicherheit nicht auf eine einzige Zahl reduzieren
Epistemische Unsicherheit entsteht durch fehlende Trainingsdaten; aleatorische Unsicherheit entsteht durch nicht reduzierbare Sensor- und Umgebungsvariationen. Eine Ensemble-Varianz ist ein nützliches Signal für die erste, aber ein Ensemble kann dennoch dieselbe Verzerrung aufweisen. Wenn die Vorhersagevarianz einen Schwellenwert überschreitet, verkürzen Sie den Horizont, reduzieren Sie die Geschwindigkeit, wechseln Sie zu einem klassischen Regler oder erfassen Sie eine weitere Messung, bevor Sie planen. Diese Absenzrichtlinie muss vor der Planung festgelegt werden. Einsatz.
Für den Ein-Schritt-Restwert e_t=s_{t+1}-\hat s_{t+1} sollten zusätzlich zum mittleren quadratischen Fehler auch Quantile und Worst-Case-Szenarien logarithmiert werden. Ein niedriger mittlerer Fehler kann einen großen Fehler kurz vor dem Kontakt verschleiern. Ein probabilistisches Vorhersageintervall darf niemals als Sicherheitszertifikat interpretiert werden; Kollisions-, Kraft-, Temperatur- und Strommessungen sollten unabhängig durchgeführt werden.
Design von Identifikationsexperimenten
Systemidentifikation ist ein Problem der Versuchsplanung, keine einfache Kalibrierung. Bei einem Motor sollten statische Reibung, Trägheit bei verschiedenen Drehzahlen, lastabhängiges Drehmoment und Kommunikationslaufzeit separat gemessen werden. Bei einem Hydraulikaktuator sollten Druck, Durchfluss, Zylindergeschwindigkeit, Öltemperatur und Ventilansteuerung mit einem Zeitstempel erfasst werden. Die Daten sollten nach Tag, Etage, Nutzlast, Beleuchtung und Temperatur aufgeteilt werden – nicht nach zufälligen benachbarten Frames –, sodass der endgültige Datensatz tatsächlich unvoreingenommen ist.
Eine kleine numerische Intuition
Betrachten Sie einen 1 kg schweren Wagen, dessen Geschwindigkeit sich alle T_s=0.1\,\mathrm{s} um 0.1u ändert. Ein reibungsfreies Modell sagt voraus: Die Geschwindigkeitszunahme von 0.5\,\mathrm{m/s} für u=1 über fünf Schritte. Verliert der reale Wagen pro Schritt durch Reibung 0.02\,\mathrm{m/s}, erreicht der Fehler über fünf Schritte 0.1\,\mathrm{m/s}. Ein kürzerer Zeithorizont, Online-Identifizierung, Spielraum in der Geschwindigkeitsbeschränkung und die Neuplanung anhand von Messungen gewährleisten die Nützlichkeit dieses einfachen Modells.
Zu veröffentlichende Nachweise
Neben den Gleichungen sollten die Trainingszeit, die Sensorrate, die Verzögerung, der Zufallsgenerator, die Umgebungsparameter, die Solver-Deadline und die Fallback-Strategie gespeichert werden. Vorhersageresiduen, Verletzungen von Nebenbedingungen, Bremsweg und durch Unsicherheit ausgelöste Absage sollten anhand derselben Experiment-ID wie die Belohnung grafisch dargestellt werden. Falls die Rohdaten nicht geteilt werden können, sollten anonymisierte Statistiken, Simulationseinstellungen, Einheiten und ein Referenzdatum veröffentlicht werden, um die Nachvollziehbarkeit der Aussage zu gewährleisten.
Garantiert ein gelerntes Modell zuverlässige Langzeitprognosen? Rollouts?
Kleine Modellfehler akkumulieren sich über die Vorhersagen. Überprüfen Sie die Rollout-Länge, unbekannte Zustände und die Validierung in der realen Umgebung.
Referenzen
Weltmodelltypen und Planer
Physikalische Modelle sind interpretierbar, können aber bei Kontakt Probleme haben; latente und Ensemble-Modelle können effizient sein, erfordern jedoch eine Validierung hinsichtlich der Sicherheit im realen Raum. Kandidatenaktionen können Schießen, CEM oder differenzierbares MPC mit einem Deadline-Fallback verwenden.
Datenbereinigung
Markieren Sie gesättigte Sensoren, Zeitfehler, Limiter-Interventionen, interpolierte Werte und Endursachen. Halten Sie den Evaluierungsdatensatz unveränderlich, damit eine Modellaktualisierung keine Regression verschleiern kann.
Evidenz Grenzen
Vorhersagegenauigkeit, Belohnung und sicheres Hardwareverhalten sind separate Ansprüche. Veröffentlichen Sie die Metrik, die Testbedingungen und die verantwortliche Sicherheitsebene für jeden einzelnen Anspruch.
Kommentare
Bitte zuerst anmelden.
Noch keine Einträge.