Contents — find the section you need

Reinforcement Learning (RL) ermöglicht es Robotern, durch Interaktion mit ihrer Umgebung zu lernen, welche Aktionen sich langfristig auszahlen. Anders als bei der Bildklassifizierung, wo Eingabe und Label gleichzeitig eintreffen, beobachtet der Roboter seine Umgebung, bewegt einen Motor und erhält eine Belohnung – oft erst einige Sekunden später. Der grundlegende Ablauf ist: Ausprobieren, Ergebnis beobachten und Strategie aktualisieren.

Zusammenfassung (30 Sekunden)

  • Der kleinste RL-Übergang ist zum Zeitpunkt t der Zustand (oder die Beobachtung) s_t, die Aktion a_t, die Belohnung r_{t+1} und der Folgezustand s_{t+1}.

  • Ein Markov-Entscheidungsprozess (MDP) modelliert, wie der aktuelle Zustand und die aktuelle Aktion den Folgezustand und die Belohnung bestimmen. Der Zustand muss die Vorgeschichte ausreichend genau zusammenfassen, um eine Vorhersage zu ermöglichen.

  • Eine Strategie \pi(a\mid s) wählt die Aktionen aus. Eine Wertfunktion V^\pi(s) ist der erwartete zukünftige Ertrag, wenn diese Strategie befolgt wird.

  • Der Ertrag diskontiert zukünftige Belohnungen mit \gamma. Ein zu langer Horizont kann das Lernen destabilisieren, während ein zu kurzer Horizont einen kurzsichtigen und unsicheren Roboter hervorbringt.

  • Exploration erprobt unsichere Aktionen; Exploitation wählt die Aktion, die aktuell als die beste angesehen wird. Auf Hardwareebene haben Sicherheitsbeschränkungen Vorrang vor beiden.

1. Betrachten Sie den Roboter als Agenten

Diagram 1 · Use the button to switch views
Observation, action, and reward loop in reinforcement learning An agent selects an action from an observation and the environment returns the next observation and a reward Agentcomputes π(a|s) Environmentphysics, simulator, or people action aₜ observation oₜ₊₁ and reward rₜ₊₁ state sₜ is an internal summary of the observation history

Abbildung 1 – Nachdem ein Agent eine Aktion ausgeführt hat, ändert sich die Umgebung und liefert die nächste Beobachtung und Belohnung. Ein realer Roboter fügt diesem Kreislauf Kommunikationsverzögerungen, Sensorauschen und Aktuatorsättigung hinzu.

Bei einem Differenzialantriebsroboter kann der Agent Kamera-, LiDAR- und Encoderdaten als Zustand verwenden und die Geschwindigkeiten des linken und rechten Rades als Aktionen ausgeben. Die Umgebung umfasst die Fahrzeugdynamik, die Bodenreibung, Hindernisse und den Batteriestand. Die Annäherung an ein Ziel kann eine positive Belohnung einbringen, während eine Kollision oder ein abrupter Lenkwechsel bestraft werden kann. Ein einzelnes „+1 am Ziel“-Signal ist in der Regel zu spärlich; Entfernung, Geschwindigkeit, Bremsweg und Energie müssen gemeinsam berücksichtigt werden.

2. MDP: Aufteilung des Problems in Komponenten

Ein MDP ist definiert durch einen Zustandsraum \mathcal{S}, einen Aktionsraum \mathcal{A}, eine Übergangswahrscheinlichkeit P(s'\mid s,a), eine Belohnungsfunktion R(s,a,s') und einen Diskontierungsfaktor \gamma:

\mathcal{M}=(\mathcal{S},\mathcal{A},P,R,\gamma),\qquad 0\le\gamma<1

Wählt der Agent im Zustand s_t die Aktion a_t, wechselt die Umgebung gemäß P in den nächsten Zustand s_{t+1} und gibt die Belohnung r_{t+1}=R(s_t,a_t,s_{t+1}) zurück.

„Markov“ bedeutet, dass, sobald der aktuelle Zustand bekannt ist, die Vergangenheit keine weiteren Informationen mehr liefert, die zur Vorhersage der Zukunft benötigt werden. Ein mobiler Roboter, dessen Zustand nur die Position enthält, kann einen stillstehenden Roboter nicht von einem unterscheiden, der sich an derselben Position bewegt. Berücksichtigen Sie Geschwindigkeit, Winkelgeschwindigkeit und Sensorgenauigkeit oder verwenden Sie ein rekursives Modell, das den Verlauf speichert.

Wenn der vollständige Zustand s_t nicht direkt beobachtet werden kann, handelt es sich um ein partiell beobachtbares MDP (POMDP). Fast jeder reale Roboter ist aufgrund von Verdeckungen und fehlenden LiDAR-Daten ein POMDP. Ein Zustandschätzer – ein EKF, ein Faktorgraph oder ein gelerntes Modell – wandelt Beobachtungen o_t in einen nutzbaren internen Zustand um. Der Artikel zur Sensorfusion (/de/blog/posts/robotics-sensor-fusion.html) erläutert diese Grenze, und die ROS 2-Einführung (/de/blog/posts/robotics-ros2.html) zeigt, wie man daraus eine reproduzierbare Softwarekomponente erstellt.

3. Wertfunktionen und Rückgabewert

Die diskontierte Summe der Belohnungen ab Zeitpunkt t ist der Rückgabewert G_t:

G_t=r_{t+1}+\gamma r_{t+2}+\gamma^2r_{t+3}+\cdots

Der Wert des Zustands s unter der Richtlinie \pi ist

V^\pi(s)=\mathbb{E}_\pi[G_t\mid s_t=s]

und der Zustand-Aktionswert gibt auch die erste Aktion an:

Q^\pi(s,a)=\mathbb{E}_\pi[G_t\mid s_t=s,a_t=a]

Die Auswahl des größten Q-Werts ist ein wertbasierter Ansatz. Die direkte Aktualisierung der Parameter \theta einer neuronalen Richtlinie \pi_\theta(a\mid s) ist richtlinienbasiert. Kontinuierliche Lenkwinkel und Gelenkmomente begünstigen häufig Richtliniengradienten- oder Actor-Critic-Methoden, da die Aufzählung aller möglichen Aktionen unmöglich ist.

4. Die Bellman-Gleichung unterteilt einen langen Zeithorizont in einen Schritt.

Anstatt die gesamte Zukunft auf einmal zu bewerten, wird sie in die unmittelbare Belohnung und den Wert einen Schritt später aufgeteilt. Die Bellman-Erwartungsgleichung lautet:

V^\pi(s)=\sum_a\pi(a\mid s)\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^\pi(s')\right]

Der optimale Wert V^*(s) erfüllt die Bellman-Optimalitätsgleichung:

V^*(s)=\max_a\sum_{s'}P(s'\mid s,a)\left[R(s,a,s')+\gamma V^*(s')\right]

Deshalb kann ein Zielwert aus anderen Schätzungen anstatt aus einer vom Menschen vorgegebenen Bezeichnung generiert werden. Die Selbstreferenz ist ebenfalls eine Quelle der Instabilität. Zielnetzwerke, Experience Replay und Belohnungsnormalisierung trennen alte Schätzungen von der aktuellen Aktualisierung und reduzieren schädliche Korrelationen.

5. Ausgewogenes Verhältnis zwischen Exploration und Exploitation

Die ständige Auswahl der Aktion mit der aktuell höchsten Schätzung kann den Agenten in einer glücklichen lokalen Lösung gefangen halten. Exploration erprobt unbekannte Aktionen, aber zufällige Bewegungen auf einer realen Maschine können zu Kollisionen führen. Gängige Entscheidungen sind:

Methode Intuition Stärke Hardware-Bedenken
ε-greedy Zufällige Auswahl mit Wahrscheinlichkeit ε Einfach Abrupte Änderungen sind bei kontinuierlichem Drehmoment unsicher
Boltzmann/Softmax Stichproben proportional zum Wert Bevorzugt vielversprechende Optionen Temperatur muss angepasst werden
UCB Aktionen mit hoher Unsicherheit ausprobieren Explizite Explorationsbegründung Unsicherheitsabschätzungen erforderlich
Noisy Policy Kontinuierliches Rauschen zu Aktionen oder Gewichten hinzufügen Glattere Exploration Sättigung und Grenzwerte weiterhin erforderlich

Auf Hardware sollte die Exploration auf einen validierten Betriebsbereich beschränkt werden. Geschwindigkeitsbegrenzungen, Gelenk-Softlimits, Kraft-/Strombegrenzungen, ein Watchdog und ein Not-Aus sollten außerhalb des Lernalgorithmus platziert werden, sodass jede Policy-Ausgabe abgefangen werden kann. Randomisierung in einem Simulator ist nützlich; sie ist jedoch keine Erlaubnis, einer Maschine zufällige Befehle zu erteilen.

6. Überprüfen Sie das Konzept in einer kleinen Gitterwelt

Ein 5×5-Gitter macht die Lerndynamik sichtbar. Eine Zelle repräsentiert den Zustand, die Aktionen oben/unten/links/rechts, die Zielbelohnung +1, eine Wand −0,1 und jeder Schritt −0,01. Initialisiere Q auf Null und wiederhole die Aktualisierung der zeitlichen Differenz:

Q(s_t,a_t)\leftarrow Q(s_t,a_t)+\alpha\left[r_{t+1}+\gamma\max_{a'}Q(s_{t+1},a')-Q(s_t,a_t)\right]

Der Ausdruck in Klammern ist der TD-Fehler: die Differenz zwischen der Vorhersage und dem Ein-Schritt-Ziel. Ist \alpha zu groß, dominieren neue Erfahrungen; ist er zu klein, kann die Strategie nicht auf eine sich verändernde Umgebung reagieren. Protokolliere Erfolgsrate, durchschnittliche Schritte, Kollisionsrate und den Anteil der nicht besuchten Zustände – nicht nur eine einzelne Belohnungskurve.

7. Formuliere die Belohnung wie eine Spezifikation

Das Belohnungsdesign ist oft wichtiger als ein algorithmisches Detail. Ein Lieferroboter könnte beispielsweise

r=w_d\,\Delta d-w_c\,\mathbf{1}_{\mathrm{collision}}-w_u\,|u|^2-w_j\,\|\Delta u\|^2

Fortschritt, Kollisionen, Eingangsenergie und Glätte kombinieren. Eine Erhöhung eines Gewichts w verbessert das Verhalten nicht immer. Wenn die Kollisionsstrafe überwiegt, kann der Roboter die zwar sichere, aber nutzlose Strategie erlernen, sich nie zu bewegen. Protokollieren Sie jeden Term separat und überprüfen Sie, welchen Term die Strategie tatsächlich optimiert.

Reward Hacking ist eine weitere Fehlerquelle: Ein Fehler im Zieldetektor, ein toter Winkel der Sensoren oder eine nur im Simulator gültige Kontaktregel kann eine hohe Punktzahl erzeugen, ohne die beabsichtigte Aufgabe zu erfüllen. Verständliche Ziele, physikbasierte Randbedingungen und eine unabhängige Evaluierungsumgebung erleichtern das Erkennen dieser Abkürzungen.

8. Wo Forschung auf Produkt trifft

Wertmethoden sind dateneffizient, setzen aber oft diskrete Zustände und Aktionen voraus. Policy Gradients und Actor-Critic-Methoden ermöglichen kontinuierliche Steuerung; SAC fügt ein Entropieziel hinzu, während modellbasierte RL-Methoden mit einem gelernten oder analytischen Dynamikmodell planen, bevor der Roboter bewegt wird. Modellbasierte Methoden können die Anzahl realer Daten reduzieren, müssen aber Modellfehler tolerieren.

In der Produktion wird RL nicht unbedingt auf jeder Ebene angewendet, von der Sicherheitsüberwachung bis zum Motorstrom. Ein klassischer PID- oder MPC-Regler kann den Sicherheitsbereich festlegen, während RL einen Greifkontakt, eine bevorzugte Route oder einen Verstärkungsplan auswählt. Die VLA-Übersicht beschreibt eine ähnliche Grenze: Ein Bildverarbeitungs- und Sprachmodell kann Aktionsblöcke vorschlagen, während ein verifizierter Low-Level-Regler Drehmoment und Geschwindigkeit begrenzt.

9. Vor der Hardware-Implementierung

  • Enthält der Zustand Geschwindigkeit, Verzögerung und Sensorkonsistenz, oder wurde die Markov-Annahme stillschweigend verletzt?

  • Werden Belohnungsparameter separat protokolliert, einschließlich Kollisionsrate, Energie, Eingabeglätte und Bremsweg zusätzlich zur Erfolgsrate?

  • Sind Aktionsbereiche, Ratenbegrenzungen, Überwachungsmechanismen und Notstopps unabhängig vom Lernalgorithmus?

  • Wurden Reibung, Masse, Sensorverzögerung, Beleuchtung und Paketverlust in der Simulation randomisiert, und wurde die Verteilungslücke anhand realer Protokolle gemessen?

  • Wird ein separater, nicht eingesehener Evaluierungsdatensatz von den Trainingsdaten getrennt aufbewahrt? Werden Fehler berücksichtigt, anstatt herausgefiltert zu werden?

  • Führt ein Prozessneustart zu einem sicheren Zustand und verhindert die Wiederholung eines alten Befehls?

Zusammenfassung

Bestärkendes Lernen lässt einen Roboter keine „korrekte Bewegung“ auswendig lernen. Es definiert Zustände, Aktionen, Übergänge und Belohnungen als Markov-Entscheidungsprozess (MDP) und schätzt dann den langfristigen Wert schrittweise mithilfe der Bellman-Gleichungen. Exploration, Belohnungsoptimierung und Hardware-Sicherheit müssen Teil des Systemdesigns sein, bevor eine gelernte Strategie die Simulation verlassen kann. Die nächsten Artikel dieser Reihe vergleichen Q-Learning/DQN, Policy Gradients, PPO und SAC, Imitationslernen und Sim-to-Real im selben Rahmen.

Überprüfen Sie Ihr Verständnis
Ist die Aktion mit der höchsten unmittelbaren Belohnung immer die beste?

Zukünftige Belohnungen und Übergänge können die Antwort ändern.

Unterscheide zwischen unmittelbarer Belohnung und diskontierter Rendite.

Referenzen

What to read next

Continue the seriesQ-Learning und DQN – Von einer Q-Tabelle zu Deep Reinforcement LearningExplore another aspect of this fieldEinführung in das Multi-Agent Reinforcement Learning – Optimierung in einer Welt, in der auch die Gegenseite lerntExplore another aspect of this fieldπ0 erklärt – Wie Flow Matching die VLA-Aktionsgenerierung verändert hat