Contents — find the section you need

Q-Learning und DQN wählen aus einer endlichen Menge von Aktionen. Radgeschwindigkeit, Drohnenschub oder Manipulatordrehmoment sind jedoch kontinuierlich. Policy-Gradient-Methoden aktualisieren eine Policy, die eine Verteilung über kontinuierliche Aktionen ausgibt. Actor-Critic fügt einen Critic hinzu, der diese Aktionen bewertet; PPO und SAC bieten praktische Stabilisierung, die in der Robotikforschung weit verbreitet ist.

Die 30-Sekunden-Zusammenfassung

  • Policy-Gradienten erhöhen den erwarteten Ertrag direkt. Sie verarbeiten kontinuierliche Aktionen auf natürliche Weise, aber Schätzungen einzelner Trajektorien weisen eine hohe Varianz auf.

  • Actor-Critic verwendet eine Wertschätzung als Basiswert. Advantage misst, ob eine Aktion besser war als die durchschnittliche Aktion im selben Zustand.

  • PPO begrenzt das Wahrscheinlichkeitsverhältnis zwischen der alten und der neuen Policy, sodass eine Aktualisierung nicht zu weit abweichen kann. Es ist unkompliziert, aber die Daten der Policy sind schwer wiederzuverwenden.

  • SAC maximiert sowohl die Belohnung als auch die Policy-Entropie. Es ist außerhalb der Richtlinien, verwendet Replay und eignet sich gut für die kontinuierliche Steuerung.

– Beide Methoden bieten keine Sicherheitsgrenzen. Aktionsgrenzen, Ratenbegrenzungen, PID/MPC-Regler auf niedriger Ebene und Not-Aus-Schalter sollten außerhalb des Lernprozesses liegen.

1. Direkte Optimierung einer Strategie

Diagram 1 · Use the button to switch views
Actor–Critic: Strategieaktualisierung basierend auf Erfahrungswerten

Abbildung 1 – Der Actor schlägt eine stetige Verteilung vor, und der Critic bewertet den Ertrag. Auf Hardware durchläuft die Aktion einen verifizierten Controller auf niedrigerer Ebene, anstatt direkt an Torque zu gehen.

Für eine stochastische Strategie \pi_\theta(a\mid s) lässt sich der Gradient des erwarteten Ertrags J(\theta)=\mathbb{E}_{\pi_\theta}[G_t] mithilfe des Gradienten der Log-Wahrscheinlichkeit ausdrücken:

\nabla_\theta J(\theta)=\mathbb{E}_{\pi_\theta}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,G_t\right]

Aktionen mit hohem Ertrag werden wahrscheinlicher. Da G_t verrauscht und verzögert ist, reduziert das Subtrahieren einer zustandsabhängigen Baseline b(s_t) die Wahrscheinlichkeit. Varianz ohne Änderung des erwarteten Gradienten:

\nabla_\theta J(\theta)=\mathbb{E}\left[\nabla_\theta\log\pi_\theta(a_t\mid s_t)\,(G_t-b(s_t))\right]

2. Vorteil und Actor-Critic

Der Critic lernt V_\phi(s) und schätzt mit A_t=Q(s_t,a_t)-V(s_t), ob eine Aktion besser als der Zustandsdurchschnitt war. Eine einstufige TD-Approximation ist

\hat A_t=r_{t+1}+\gamma V_\phi(s_{t+1})-V_\phi(s_t)

Die generalisierte Vorteilschätzung (GAE) kombiniert mehrere Schritte mit einem Bias-Varianz-Hyperparameter \lambda. Wenn sich \lambda dem Wert Eins nähert, werden ein längerer Horizont und ein niedrigerer Bias, aber eine höhere Varianz verwendet. Für eine schnelle Lageregelungsschleife sollten die tatsächliche Verzögerung und Zeitskala der Aufgabe verwendet werden, anstatt eine Benchmark-Einstellung zu kopieren.

Der Actor-Verlust ist

L_\pi=-\mathbb{E}[\log\pi_\theta(a_t\mid s_t)\hat A_t]

und der Critic minimiert den quadratischen Fehler

L_V=\mathbb{E}[(V_\phi(s_t)-\hat V_t)^2]

Wenn ein Bildcodierer gemeinsam genutzt wird, ändert ein Gradient beide Schätzungen. Separate Lernraten, Gradientenbegrenzung und ein fester Datensatz zur Beobachtungsnormalisierung erleichtern die Fehlerdiagnose.

3. PPO: Die Strategie nicht zu stark auf einmal ändern

On-Policy-Policy-Gradienten erfassen einen Rollout mit der aktuellen Strategie. Die Wiederverwendung für zu viele Aktualisierungen führt dazu, dass sich die neue Strategie von der Datenverteilung entfernt. PPO bildet ein Wahrscheinlichkeitsverhältnis zwischen der alten Strategie \pi_{\theta_{old}} und der neuen Strategie,

r_t(\theta)=\frac{\pi_\theta(a_t\mid s_t)}{\pi_{\theta_{old}}(a_t\mid s_t)}

und maximiert die begrenzte Zielfunktion.

L^{CLIP}=\mathbb{E}\left[\min\left(r_t\hat A_t,\operatorname{clip}(r_t,1-\epsilon,1+\epsilon)\hat A_t\right)\right]

Positive Vorteile können ihre Wahrscheinlichkeit nicht unbegrenzt erhöhen, und negative Vorteile können sie nicht unbegrenzt verringern. Ein kleiner \epsilon ist konservativ; ein großer erlaubt mutigere Aktualisierungen. Die Begrenzung ist keine Sicherheitsbeschränkung, daher sind Gelenk-, Geschwindigkeits- und Kraftgrenzen weiterhin separat.

Eine Implementierung erfasst einen festen Rollout, normalisiert Advantage und trainiert mehrere Mini-Batch-Epochen. Alte Log-Wahrscheinlichkeiten werden gespeichert, um eine Unterscheidung zu ermöglichen. Timeout vom tatsächlichen Endzustand und Einfrieren der Normalisierungsstatistiken bei der Auswertung. Andernfalls können zwei Durchläufe mit denselben Gewichtungen unterschiedliche Ergebnisse liefern.

4. SAC: Belohnung plus Entropie

Soft Actor-Critic (SAC) addiert die Policy-Entropie \mathcal{H}(\pi) zur zukünftigen Belohnung als Zielfunktion:

J(\pi)=\mathbb{E}\left[\sum_t\gamma^t\left(r_t+\alpha\mathcal{H}(\pi(\cdot\mid s_t))\right)\right]

Der Entropieterm verhindert, dass gleichwertige Aktionen zu früh auf eine einzige reduziert werden. Er wirkt als Temperatur \alpha, die die Exploration aufrechterhält. SAC arbeitet außerhalb der Policy und verwendet einen Replay-Puffer, sodass jeder Übergang in der realen Welt wiederverwendet werden kann. Dies verbessert die Sample-Effizienz, jedoch sind veraltete Daten, die Belohnungsskala und die Temperaturanpassung relevant.

Für eine kontinuierliche Aktion gibt der Actor den Mittelwert \mu_\theta(s) und die Standardabweichung \sigma_\theta(s) einer Gaußverteilung aus und transformiert diese anschließend mit tanh oder einer anderen Transformation in Grenzen. Die Log-Wahrscheinlichkeit benötigt die Jacobi-Korrektur. dieser Transformation. Twin-Q-Netzwerke und die kleinere Q-Schätzung reduzieren die Überschätzung. Entscheiden Sie, ob die Bereitstellung den deterministischen Mittelwert verwendet oder das Explorationsrauschen beibehält.

5. Wahl zwischen PPO und SAC

Aspekt PPO SAC
Daten On-Policy-Rollouts Off-Policy-Replay
Exploration Richtlinienverteilung und Entropiebonus Entropie ist Teil des Ziels
Stichprobeneffizienz niedrig bis mittel oft höher
Hauptfehler Log-Wahrscheinlichkeit, Terminal-Flags, Clipping Q-Überschätzung, Belohnungsskala, Tanh-Korrektur
Typische Anpassung viele parallele Simulatoren kontinuierliches Drehmoment und wenige Hardware-Daten

PPO ist oft stabil, wenn viele simulierte Umgebungen parallel laufen können. SAC kann attraktiv sein, wenn jeder reale Übergang aufwändig ist. Keine der beiden Methoden modelliert automatisch Sensorverzögerungen, Motor-Totzonen oder Aktuatorsättigung.

6. Sim-to-Real ist eine Grenze, kein Schalter

Die Die Diskrepanz zwischen Simulation und Realität entsteht durch Masse und Reibung, Spiel, Belichtung und Sensorauschen, Netzwerkverzögerung, Leistungsabfall der Batterie, Bodenmaterial und Beleuchtung. Domänenrandomisierung erfasst diese Parameter, um eine Überanpassung der Strategie an einen idealen Wert zu vermeiden. Der Bereich sollte hardwareseitig gemessen werden; die Randomisierung unmöglicher Welten erschwert das Training nur.

Ein stufenweiser Transfer ist sicherer: (1) reine Simulation, (2) Wiedergabe realer Sensordaten ohne Bewegung, (3) Tests mit geringem Stromverbrauch und angehobenen Rädern, (4) begrenzte Geschwindigkeit und Kraft auf freiem Boden und (5) die eigentliche Aufgabe. Protokollieren Sie die angeforderte Aktion separat von der Aktion, die der Sicherheitsbegrenzer tatsächlich freigegeben hat. Der Übergang von der Simulation zur Realität ist ein iterativer Prozess aus Identifizierung und Bewertung, keine einmalige Aktivierung.

7. Sicherheit und Bewertung

PPO-Clipping und SAC-Entropie verhindern keine Kollisionen. Unabhängige Monitore sollten Geschwindigkeit, Beschleunigung, Gelenkwinkel, Kontaktkraft, Hydraulikdruck, Stromstärke und Temperatur überprüfen. Bei ungültigen Messwerten, NaN-Werten, abgelaufenen Zeitstempeln oder Kommunikationsabbrüchen sollte der Monitor eine Aktion auslösen. Sicherer Stopp. Lagern Sie dies in einen separaten Prozess oder eine MCU aus, wenn das Risiko dies erfordert.

Messen Sie neben der Belohnung auch Erfolg, Kollisionsrate, maximale Abweichung, Stoppdistanz, Energie, Aktionsglätte, Inferenzlatenz und die Interventionsrate des Sicherheitsbegrenzers. Eine hohe Erfolgsrate bei häufigen Eingriffen bedeutet, dass die Strategie vom Begrenzer abhängt. Wiederholen Sie die Läufe mit verschiedenen Zufallszahlen und berichten Sie über die Varianz und die schlimmsten Fälle, nicht nur über den Mittelwert.

Checkliste für die Implementierung

  1. Testen Sie Aktionseinheiten, Grenzen, Tanh/Clip-Reihenfolge und Log-Wahrscheinlichkeitskorrekturen.

  2. Speichern Sie für PPO die alten Log-Wahrscheinlichkeiten, den Vorteil und die Terminal- bzw. Timeout-Flags.

  3. Überwachen Sie für SAC die Replay-Verteilung, die Twin-Q-Werte, die Temperatur \alpha und die Belohnungsskala.

  4. Verknüpfen Sie Vorverarbeitung, Normalisierung, Seeds, Gewichte und Umgebungsparameter mit der Experiment-ID.

  5. Halten Sie Low-Level-PID/MPC, Ratenbegrenzungen, Watchdog und Notstopp unabhängig vom Lernalgorithmus.

  6. Definieren Sie Stoppbedingungen für passive Protokolle, niedriger Stromverbrauch und Normalbetrieb vor jedem Übergang.

  7. Erfolg, Kollision, Eingriff des Limiters, Latenz, Energieverbrauch und maximale Abweichung gemeinsam protokollieren.

Zusammenfassung

Policy-Gradienten optimieren eine kontinuierliche Aktionsverteilung direkt. Actor-Critic nutzt Advantage zur Varianzreduzierung; PPO begrenzt das Update; SAC nutzt Entropie und Replay zur Verbesserung der Exploration und Dateneffizienz. Keiner dieser Algorithmen behebt Hardwareunsicherheiten oder Sicherheitsrisiken allein. Ein verifizierter Low-Level-Controller, ein unabhängiger Monitor, gestaffelter Transfer und eine Worst-Case-Evaluierung sind Teil des Algorithmus, wenn eine gelernte Policy die Simulation verlässt.

Überprüfen Sie Ihr Verständnis
Garantiert das PPO-Clipping sicheres Verhalten?

Es moderiert das Optimierungsziel, nicht die physikalischen Sicherheitsbeschränkungen. Trainingsstabilität und Aktionssicherheit separat bewerten.

Referenzen

What to read next

Review the backgroundQ-Learning und DQN – Von einer Q-Tabelle zu Deep Reinforcement LearningContinue the seriesEinführung in das Belohnungsdesign – Warum die Frage „Was soll maximiert werden?“ der schwierigste Teil des RL istExplore another aspect of this fieldEinführung in das Multi-Agent Reinforcement Learning – Optimierung in einer Welt, in der auch die Gegenseite lernt