Contents — find the section you need
Q-Learning und DQN wählen aus einer endlichen Menge von Aktionen. Radgeschwindigkeit, Drohnenschub oder Manipulatordrehmoment sind jedoch kontinuierlich. Policy-Gradient-Methoden aktualisieren eine Policy, die eine Verteilung über kontinuierliche Aktionen ausgibt. Actor-Critic fügt einen Critic hinzu, der diese Aktionen bewertet; PPO und SAC bieten praktische Stabilisierung, die in der Robotikforschung weit verbreitet ist.
Die 30-Sekunden-Zusammenfassung
-
Policy-Gradienten erhöhen den erwarteten Ertrag direkt. Sie verarbeiten kontinuierliche Aktionen auf natürliche Weise, aber Schätzungen einzelner Trajektorien weisen eine hohe Varianz auf.
-
Actor-Critic verwendet eine Wertschätzung als Basiswert. Advantage misst, ob eine Aktion besser war als die durchschnittliche Aktion im selben Zustand.
-
PPO begrenzt das Wahrscheinlichkeitsverhältnis zwischen der alten und der neuen Policy, sodass eine Aktualisierung nicht zu weit abweichen kann. Es ist unkompliziert, aber die Daten der Policy sind schwer wiederzuverwenden.
-
SAC maximiert sowohl die Belohnung als auch die Policy-Entropie. Es ist außerhalb der Richtlinien, verwendet Replay und eignet sich gut für die kontinuierliche Steuerung.
– Beide Methoden bieten keine Sicherheitsgrenzen. Aktionsgrenzen, Ratenbegrenzungen, PID/MPC-Regler auf niedriger Ebene und Not-Aus-Schalter sollten außerhalb des Lernprozesses liegen.
1. Direkte Optimierung einer Strategie
Abbildung 1 – Der Actor schlägt eine stetige Verteilung vor, und der Critic bewertet den Ertrag. Auf Hardware durchläuft die Aktion einen verifizierten Controller auf niedrigerer Ebene, anstatt direkt an Torque zu gehen.
Für eine stochastische Strategie \pi_\theta(a\mid s) lässt sich der Gradient des erwarteten Ertrags J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] mithilfe des Gradienten der Log-Wahrscheinlichkeit ausdrücken:
Aktionen mit hohem Ertrag werden wahrscheinlicher. Da G_t verrauscht und verzögert ist, reduziert das Subtrahieren einer zustandsabhängigen Baseline b(s_t) die Wahrscheinlichkeit. Varianz ohne Änderung des erwarteten Gradienten:
2. Vorteil und Actor-Critic
Der Critic lernt V_\phi(s) und schätzt mit A_t=Q(s_t,a_t)-V(s_t), ob eine Aktion besser als der Zustandsdurchschnitt war. Eine einstufige TD-Approximation ist
Die generalisierte Vorteilschätzung (GAE) kombiniert mehrere Schritte mit einem Bias-Varianz-Hyperparameter \lambda. Wenn sich \lambda dem Wert Eins nähert, werden ein längerer Horizont und ein niedrigerer Bias, aber eine höhere Varianz verwendet. Für eine schnelle Lageregelungsschleife sollten die tatsächliche Verzögerung und Zeitskala der Aufgabe verwendet werden, anstatt eine Benchmark-Einstellung zu kopieren.
Der Actor-Verlust ist
und der Critic minimiert den quadratischen Fehler
Wenn ein Bildcodierer gemeinsam genutzt wird, ändert ein Gradient beide Schätzungen. Separate Lernraten, Gradientenbegrenzung und ein fester Datensatz zur Beobachtungsnormalisierung erleichtern die Fehlerdiagnose.
3. PPO: Die Strategie nicht zu stark auf einmal ändern
On-Policy-Policy-Gradienten erfassen einen Rollout mit der aktuellen Strategie. Die Wiederverwendung für zu viele Aktualisierungen führt dazu, dass sich die neue Strategie von der Datenverteilung entfernt. PPO bildet ein Wahrscheinlichkeitsverhältnis zwischen der alten Strategie \pi_{\theta_{old}} und der neuen Strategie,
und maximiert die begrenzte Zielfunktion.
Positive Vorteile können ihre Wahrscheinlichkeit nicht unbegrenzt erhöhen, und negative Vorteile können sie nicht unbegrenzt verringern. Ein kleiner \epsilon ist konservativ; ein großer erlaubt mutigere Aktualisierungen. Die Begrenzung ist keine Sicherheitsbeschränkung, daher sind Gelenk-, Geschwindigkeits- und Kraftgrenzen weiterhin separat.
Eine Implementierung erfasst einen festen Rollout, normalisiert Advantage und trainiert mehrere Mini-Batch-Epochen. Alte Log-Wahrscheinlichkeiten werden gespeichert, um eine Unterscheidung zu ermöglichen. Timeout vom tatsächlichen Endzustand und Einfrieren der Normalisierungsstatistiken bei der Auswertung. Andernfalls können zwei Durchläufe mit denselben Gewichtungen unterschiedliche Ergebnisse liefern.
4. SAC: Belohnung plus Entropie
Soft Actor-Critic (SAC) addiert die Policy-Entropie \mathcal{H}(\pi) zur zukünftigen Belohnung als Zielfunktion:
Der Entropieterm verhindert, dass gleichwertige Aktionen zu früh auf eine einzige reduziert werden. Er wirkt als Temperatur \alpha, die die Exploration aufrechterhält. SAC arbeitet außerhalb der Policy und verwendet einen Replay-Puffer, sodass jeder Übergang in der realen Welt wiederverwendet werden kann. Dies verbessert die Sample-Effizienz, jedoch sind veraltete Daten, die Belohnungsskala und die Temperaturanpassung relevant.
Für eine kontinuierliche Aktion gibt der Actor den Mittelwert \mu_\theta(s) und die Standardabweichung \sigma_\theta(s) einer Gaußverteilung aus und transformiert diese anschließend mit tanh oder einer anderen Transformation in Grenzen. Die Log-Wahrscheinlichkeit benötigt die Jacobi-Korrektur. dieser Transformation. Twin-Q-Netzwerke und die kleinere Q-Schätzung reduzieren die Überschätzung. Entscheiden Sie, ob die Bereitstellung den deterministischen Mittelwert verwendet oder das Explorationsrauschen beibehält.
5. Wahl zwischen PPO und SAC
| Aspekt | PPO | SAC |
|---|---|---|
| Daten | On-Policy-Rollouts | Off-Policy-Replay |
| Exploration | Richtlinienverteilung und Entropiebonus | Entropie ist Teil des Ziels |
| Stichprobeneffizienz | niedrig bis mittel | oft höher |
| Hauptfehler | Log-Wahrscheinlichkeit, Terminal-Flags, Clipping | Q-Überschätzung, Belohnungsskala, Tanh-Korrektur |
| Typische Anpassung | viele parallele Simulatoren | kontinuierliches Drehmoment und wenige Hardware-Daten |
PPO ist oft stabil, wenn viele simulierte Umgebungen parallel laufen können. SAC kann attraktiv sein, wenn jeder reale Übergang aufwändig ist. Keine der beiden Methoden modelliert automatisch Sensorverzögerungen, Motor-Totzonen oder Aktuatorsättigung.
6. Sim-to-Real ist eine Grenze, kein Schalter
Die Die Diskrepanz zwischen Simulation und Realität entsteht durch Masse und Reibung, Spiel, Belichtung und Sensorauschen, Netzwerkverzögerung, Leistungsabfall der Batterie, Bodenmaterial und Beleuchtung. Domänenrandomisierung erfasst diese Parameter, um eine Überanpassung der Strategie an einen idealen Wert zu vermeiden. Der Bereich sollte hardwareseitig gemessen werden; die Randomisierung unmöglicher Welten erschwert das Training nur.
Ein stufenweiser Transfer ist sicherer: (1) reine Simulation, (2) Wiedergabe realer Sensordaten ohne Bewegung, (3) Tests mit geringem Stromverbrauch und angehobenen Rädern, (4) begrenzte Geschwindigkeit und Kraft auf freiem Boden und (5) die eigentliche Aufgabe. Protokollieren Sie die angeforderte Aktion separat von der Aktion, die der Sicherheitsbegrenzer tatsächlich freigegeben hat. Der Übergang von der Simulation zur Realität ist ein iterativer Prozess aus Identifizierung und Bewertung, keine einmalige Aktivierung.
7. Sicherheit und Bewertung
PPO-Clipping und SAC-Entropie verhindern keine Kollisionen. Unabhängige Monitore sollten Geschwindigkeit, Beschleunigung, Gelenkwinkel, Kontaktkraft, Hydraulikdruck, Stromstärke und Temperatur überprüfen. Bei ungültigen Messwerten, NaN-Werten, abgelaufenen Zeitstempeln oder Kommunikationsabbrüchen sollte der Monitor eine Aktion auslösen. Sicherer Stopp. Lagern Sie dies in einen separaten Prozess oder eine MCU aus, wenn das Risiko dies erfordert.
Messen Sie neben der Belohnung auch Erfolg, Kollisionsrate, maximale Abweichung, Stoppdistanz, Energie, Aktionsglätte, Inferenzlatenz und die Interventionsrate des Sicherheitsbegrenzers. Eine hohe Erfolgsrate bei häufigen Eingriffen bedeutet, dass die Strategie vom Begrenzer abhängt. Wiederholen Sie die Läufe mit verschiedenen Zufallszahlen und berichten Sie über die Varianz und die schlimmsten Fälle, nicht nur über den Mittelwert.
Checkliste für die Implementierung
-
Testen Sie Aktionseinheiten, Grenzen, Tanh/Clip-Reihenfolge und Log-Wahrscheinlichkeitskorrekturen.
-
Speichern Sie für PPO die alten Log-Wahrscheinlichkeiten, den Vorteil und die Terminal- bzw. Timeout-Flags.
-
Überwachen Sie für SAC die Replay-Verteilung, die Twin-Q-Werte, die Temperatur \alpha und die Belohnungsskala.
-
Verknüpfen Sie Vorverarbeitung, Normalisierung, Seeds, Gewichte und Umgebungsparameter mit der Experiment-ID.
-
Halten Sie Low-Level-PID/MPC, Ratenbegrenzungen, Watchdog und Notstopp unabhängig vom Lernalgorithmus.
-
Definieren Sie Stoppbedingungen für passive Protokolle, niedriger Stromverbrauch und Normalbetrieb vor jedem Übergang.
-
Erfolg, Kollision, Eingriff des Limiters, Latenz, Energieverbrauch und maximale Abweichung gemeinsam protokollieren.
Zusammenfassung
Policy-Gradienten optimieren eine kontinuierliche Aktionsverteilung direkt. Actor-Critic nutzt Advantage zur Varianzreduzierung; PPO begrenzt das Update; SAC nutzt Entropie und Replay zur Verbesserung der Exploration und Dateneffizienz. Keiner dieser Algorithmen behebt Hardwareunsicherheiten oder Sicherheitsrisiken allein. Ein verifizierter Low-Level-Controller, ein unabhängiger Monitor, gestaffelter Transfer und eine Worst-Case-Evaluierung sind Teil des Algorithmus, wenn eine gelernte Policy die Simulation verlässt.
Garantiert das PPO-Clipping sicheres Verhalten?
Es moderiert das Optimierungsziel, nicht die physikalischen Sicherheitsbeschränkungen. Trainingsstabilität und Aktionssicherheit separat bewerten.
Kommentare
Bitte zuerst anmelden.
Noch keine Einträge.