Contents — find the section you need

Die meisten Reinforcement-Learning-Algorithmen – Q-Learning, PPO usw. – haben eines gemeinsam: die Maximierung der gegebenen Belohnung. Anders ausgedrückt: Ist die Belohnungsfunktion falsch gestaltet, wird, egal wie ausgefeilt der Algorithmus ist, ein unbeabsichtigtes Verhalten zur optimalen Strategie. Wie bereits in den Grundlagen des Reinforcement Learnings (siehe Blogbeitrag) erwähnt, ist die Belohnungsgestaltung das Spezifikationsdokument außerhalb des Algorithmus. In der Praxis wird hier meist mehr Zeit investiert als in die Algorithmusauswahl. Dieser Artikel behandelt den Kompromiss zwischen spärlichen und dichten Belohnungen, die theoretische Grundlage für potenzialbasiertes Reward Shaping, dokumentierte Fälle von Reward Hacking, inverses Reinforcement Learning als Alternative und das Framework für sicheres/beschränktes Reinforcement Learning.

Die 30-Sekunden-Zusammenfassung

  • Eine spärliche Belohnung (z. B. +1 nur bei Erfolg) ist als Spezifikation korrekt, führt aber zu langsamem Lernen; eine dichte Belohnung (die auch Zwischenergebnisse berücksichtigt) beschleunigt das Lernen, birgt aber die Gefahr, unbeabsichtigte Abkürzungen zu schaffen.

  • Reward Shaping ist eine Technik, um dichte Belohnungen sicher hinzuzufügen. Ein willkürliches Hinzufügen birgt jedoch das Risiko, die optimale Strategie selbst zu verändern. Das potenzialbasierte Reward Shaping von Ng et al. (1999) garantiert, dass die optimale Strategie unverändert bleibt, sofern eine bestimmte Bedingung erfüllt ist.

  • Reward Hacking (Specification Gaming) ist ein Phänomen, bei dem sich ein Agent exakt gemäß der Belohnungsvorgabe verhält und hohe Punktzahlen durch ein Verhalten erzielt, das weit von der Intention des Entwicklers entfernt ist – ein bekanntes Beispiel ist das CoastRunners-Experiment von OpenAI.

Inverses Reinforcement Learning (IRL) schätzt die Belohnung anhand von Demonstrationsdaten, anstatt sie von einem Menschen programmieren zu lassen, und knüpft direkt an das in Imitation Learning and Inverse RL beschriebene Framework an.

Constrained RL und Safe RL beheben die Grenzen, die entstehen, wenn alles in einer einzigen Belohnung zusammengefasst wird. Ihr Design maximiert die Belohnung, ohne dabei bestimmte Einschränkungen zu verletzen.

1. Warum ist das Belohnungsdesign der schwierigste Teil?

Von der MDP-Definition werden \mathcal M=(\mathcal S,\mathcal A,P,R,\gamma), \mathcal S und \mathcal A nahezu mechanisch aus den Spezifikationen von Sensoren und Aktoren bestimmt. P beschreibt die physikalischen Gesetze der Umgebung und wird nicht direkt vom Entwickler festgelegt. Somit bleibt nur R(s,a,s') als einziges Fenster übrig, um die Absicht des Entwicklers in etwas zu übersetzen, worauf der Agent reagieren kann.

Diese Übersetzung ist überraschend schwierig. Eine Anweisung, die zwischen zwei Menschen ausreichen würde – „Räum das ordentlich auf“ – muss als Belohnungsfunktion mit strenger numerischer Präzision formuliert werden. Dabei muss genau angegeben werden, was gemessen wird, in welchem Zeitrahmen die Bewertung erfolgt und wie verschiedene Ziele (Geschwindigkeit, Sicherheit, Energieeffizienz) gegeneinander gewichtet werden. Der Agent interpretiert die dahinterstehende „Absicht“ nicht. Er maximiert lediglich die Gleichung, wie sie formuliert ist. Diese Gründlichkeit der Maximierung ist die Hauptursache für die Schwierigkeit, Belohnungssysteme zu gestalten.

2. Sparsame und dichte Belohnungen

Belohnungsarten lassen sich grob in sparsame und dichte unterteilen.

Typ Vergabe Vorteile Nachteile
Sparsame Belohnung Belohnung nur für ein Ergebnis, wie Erfolg oder Misserfolg (z. B. +1 für das Erreichen des Ziels, 0 sonst) Die Absicht des Entwicklers lässt sich kaum verfälschen; die Spezifikation ist transparent. Das Ausprobieren und Scheitern, bevor eine Belohnung erfolgt, kann lange dauern und den Lernprozess verlangsamen oder sogar zum Stillstand bringen.
Dichte Belohnung Sequenzielle Belohnung auch für Zwischenfortschritte (z. B. eine kleine positive Belohnung jedes Mal, wenn sich die Entfernung zum Ziel verringert) Ein Lernsignal trifft häufig ein und beschleunigt oft die Konvergenz Eine Abkürzung, die eine Zwischenmetrik maximiert, kann vom eigentlichen Ziel abweichen

Wenn man beispielsweise einem mobilen Roboter nur eine spärliche Belohnung gibt – „+1 beim Erreichen des Ziels, 0 sonst“ –, trifft, solange die Wahrscheinlichkeit, das Ziel durch zufällige Aktionen zu erreichen, gering ist, fast nie ein Lernsignal ein. Daher ist man versucht, eine dichte Belohnung hinzuzufügen – „eine Belohnung jedes Mal, wenn sich die Entfernung zum Ziel verringert“. Wenn jedoch nur die Entfernung die Belohnung ist, kann es Fälle geben, in denen das Vermeiden einer engen Passage und das Nehmen eines Umwegs eine größere sofortige Entfernungsreduzierung bewirkt, wodurch der Umweg „optimal“ wird. Dichte Belohnung fördert zwar das Lernen, neigt aber auch dazu, die Maximierung einer Metrik zu begünstigen, die der Entwickler nie beabsichtigt hat.

3. Potenzialbasierte Belohnungsgestaltung: Eine Methode zur Belohnungserhöhung ohne Änderung der optimalen Strategie

Potenzialbasierte Belohnungsgestaltung (PBRS), vorgestellt von Ng, Harada und Russell (1999), ermöglicht die sichere Erhöhung der Belohnungsdichte. Definieren Sie eine Potenzialfunktion \Phi(s) über Zustände und geben Sie die zusätzliche Belohnung als Potenzialdifferenz vor und nach einem Zustandsübergang an.

F(s,a,s')=\gamma\,\Phi(s')-\Phi(s)

R'(s,a,s')=R(s,a,s')+F(s,a,s')

Verwenden Sie denselben Diskontierungsfaktor γ wie für die ursprüngliche Rendite. Über T Übergänge ergibt sich die diskontierte Summe der Belohnungsgestaltung zu:

\sum_{t=0}^{T-1}\gamma^t F(s_t,a_t,s_{t+1})=-\Phi(s_0)+\gamma^T\Phi(s_T)

Das Setzen von Φ auf Null an den Endzuständen führt zu einer Differenz nur im Startzustand und vermeidet so eine zusätzliche Präferenz für Episodenlänge oder Route. Bei unendlichem Horizont, 0 ≤ γ < 1 und beschränktem Φ verschwindet der Endterm. Wenn der Endwert mit der Route oder der Haltezeit variiert, ist die Politikinvarianz nicht unbedingt gegeben. Ein Potenzial mit negativer Distanz muss den ursprünglichen Diskont und konsistente End-/Zustandsdefinitionen verwenden. Das Beispiel +2/+1/+2 in der Abbildung verwendet γ=1 und den Endwert Φ=0. ...

Diagram 1 · Use the button to switch views
Potenzielle Unterschiede: Beispiel mit γ = 1

Abbildung 1 – Beispiel mit γ = 1 und terminalem Φ = 0. Für allgemeine γ verwenden Sie die oben beschriebene diskontierte endliche Summe.

4. Reward Hacking: Punkte gemäß den Vorgaben erzielen, aber nicht gemäß der Intention

Reward Hacking, auch Specification Gaming genannt, ist ein Phänomen, bei dem ein Agent die Vorgaben der Belohnungsfunktion exakt erfüllt, aber durch ein Verhalten, das weit von der Intention des Entwicklers entfernt ist, hohe Belohnungen erzielt.

Ein bekanntes Beispiel ist das Experiment von OpenAI, einen Agenten im Bootsrennspiel CoastRunners zu trainieren. In diesem Spiel gab es eine Mechanik, bei der das Treffen von Zielen entlang der Strecke die Punktzahl erhöhte. Die Entwickler legten die Maximierung der Punktzahl als Belohnung fest. Die Absicht war, dass der Agent das Rennen beendet und dabei Ziele einsammelt. Der trainierte Agent bewegte sich jedoch überhaupt nicht auf der Strecke vor – er verharrte in einer Ecke einer Lagune, rammte wiederholt drei Ziele, die dort immer wieder erschienen, setzte sein eigenes Boot in Brand und kollidierte mit anderen Booten. Dabei erzielte er eine Punktzahl, die den durchschnittlichen menschlichen Spieler übertraf. Dies ist das Ergebnis der Maximierung des „vorgegebenen Ziels“ – der Kollision mit Zielen – anstatt des „eigentlichen Ziels“, das Rennen zu beenden.

Solche Phänomene entstehen häufig durch die Ausnutzung einer Lücke in der Belohnungsfunktion (ein Fehler, ein Versehen oder ein Verhalten, das nur im Simulator auftritt). Praktische Gegenmaßnahmen umfassen die Aufteilung jedes Belohnungsterms in ein Protokoll, um zu überprüfen, auf welchem Term die trainierte Strategie punktet, die Formulierung der Absicht in lesbarer Form und die Erkennung von Abweichungen davon sowie die Überprüfung der endgültigen Leistung in einer vom Trainingsumfeld unabhängigen Evaluierungsumgebung. Eine Änderung des Algorithmus allein löst das Problem oft nicht – die Belohnung und die zugehörige Prüfinfrastruktur sind der Kern der Gegenmaßnahme.

5. Schätzung anhand von Demonstrationen statt manueller Festlegung der Belohnung: Inverses Reinforcement Learning als Option

Eine Lösung für die Schwierigkeit der Belohnungsgestaltung besteht darin, die Belohnung nicht manuell festlegen zu lassen. Inverses Reinforcement Learning (IRL) arbeitet rückwärts mit Demonstrationsdaten – von einem Menschen oder einem bestehenden System –, um eine Belohnungsfunktion abzuleiten, die dieses Verhalten erklärt, und optimiert anschließend eine Strategie entsprechend dieser Belohnung.

Je schwieriger es ist, eine gute Belohnung für eine Aufgabe zu formulieren – beispielsweise „Stelle die Tasse ins Regal, ohne sie fallen zu lassen“ –, desto größer ist die Motivation für IRL, das Ziel aus der Demonstration abzuleiten. Wie jedoch in Imitation Learning and Inverse RL erläutert, ist auch eine mittels IRL geschätzte Belohnung nicht eindeutig, und es gibt keine Garantie dafür, wie sie sich in Situationen verhält, die nicht in den Demonstrationen vorkommen. Die Schwierigkeit, eine Belohnung manuell festzulegen, und die Unsicherheit einer aus Demonstrationen geschätzten Belohnung sind zwei Seiten eines Medaillensatzes, der sich nie vollständig auflöst. Egal für welche Methode Sie sich entscheiden, Sie müssen das Verhalten in unbekannten Situationen dennoch durch eine unabhängige Bewertung überprüfen.

6. Nicht alles in eine Belohnung packen: Das Constrained-RL-Framework

Bisher wurde davon ausgegangen, dass alle Ziele (Aufgabenerfüllung, Sicherheit, Energieeffizienz, Komfort) als gewichtete Summe in einer einzigen skalaren Belohnung R(s,a,s') zusammengefasst werden.

R=w_1 R_{\text{task}}+w_2 R_{\text{safety}}+w_3 R_{\text{energy}}+\cdots

Es ist jedoch gefährlich, ein Ziel wie Sicherheit – bei dem „schon ein einziger Verstoß fatal sein kann“ – mit anderen Zielen in dieselbe gewichtete Summe einzubeziehen. Egal wie hoch Sie das Gewicht des Sicherheitsterms ansetzen, es bleibt theoretisch ein Fall, in dem die Aufgabenbelohnung so hoch ist, dass sich ein Verstoß immer noch lohnt. Constrained RL (Safe RL) trennt die Zielfunktion von den Nebenbedingungen.

\max_\pi\ \mathbb E_\pi\!\left[\sum_t\gamma^t R_{\text{task}}(s_t,a_t)\right]\quad \text{s.t.}\quad \mathbb E_\pi\!\left[\sum_t\gamma^t C(s_t,a_t)\right]\le d

Hierbei ist C eine Kostenfunktion (Kollision, Abweichung, Erzeugung gefährlicher Kräfte, …). usw.), und d ist die zulässige Obergrenze. Es maximiert die Belohnung, während die Beschränkung – dass die erwarteten Kosten einen bestimmten Schwellenwert nicht überschreiten dürfen – als separater Faktor behandelt wird. Dies ersetzt das Optimierungsproblem, das Belohnungsdesigner immer wieder beschäftigt – „Wie hoch sollte das Gewicht des Sicherheitsterms sein?“ – durch einen anderen und in vielen Fällen besser interpretierbaren Parameter: den Schwellenwert der Beschränkung.

Auf Implementierungsebene, wie auch in Grundlagen des Reinforcement Learning und Q-Learning und DQN angesprochen, ist die Platzierung von Sicherheitsbeschränkungen – einer Geschwindigkeitsbegrenzung, einer weichen Gelenkwinkelbegrenzung, eines Notstopps – außerhalb des Lernenden (in einem Überwachungssystem) ebenfalls ein praktischer Ausdruck desselben Gedankens, sich nicht nur auf eine einzige Belohnung zu verlassen. Die Constrained-RL-Formulierung und die Sicherheitsüberwachung außerhalb des Lernenden verwirklichen beide dieselbe zugrunde liegende Philosophie. „Sicherheit sollte nicht allein durch die Gewichtung von Belohnungen gewährleistet werden“ – auf verschiedenen Ebenen.

7. Checkliste für das Belohnungsdesign

  • Haben Sie jeden Term der Belohnung in ein Logarithmus zerlegt und einzeln überprüft, auf welchem Term die trainierte Strategie basiert? Ist jeder Term einer dichten Belohnung ein geeigneter Indikator für das eigentliche Ziel?

  • Haben Sie beim Hinzufügen einer dichten Belohnung geprüft, ob diese als Potenzialdifferenz dargestellt werden kann? Falls nicht, können Sie das Risiko akzeptieren, dass sich die optimale Strategie unbeabsichtigt ändert?

  • Haben Sie die Belohnung vor dem Training auf Schwachstellen (Bugs, simulatorspezifisches Verhalten, Randbedingungen) überprüft? Haben Sie die trainierte Strategie anhand eines von der Belohnung unabhängigen Kriteriums evaluiert (erscheint sie für einen Menschen plausibel, erfüllt sie die Aufgabe erfolgreich)?

  • Haben Sie für Aufgaben, bei denen die Formulierung einer guten Belohnung selbst schwierig ist, Alternativen wie IRL oder Imitationslernen in Betracht gezogen?

  • Wird ein Ziel, das „niemals verletzt werden darf“, wie z. B. Sicherheit, in dieselbe gewichtete Summe wie die Aufgabenbelohnung einbezogen? Können Sie es mithilfe eines anderen Kriteriums separat berechnen? Constrained-RL-Formulierung oder Sicherheitsüberwachung außerhalb des Lernenden?

  • Haben Sie unabhängig vom Training Evaluierungsdaten unter Bedingungen erstellt, die sich von der Trainingsumgebung unterscheiden (Anfangszustand, Störungen, unbekannte Szenarien)?

Zusammenfassung

Bei Reinforcement-Learning-Implementierungen nimmt die Belohnungsgestaltung oft mehr Zeit in Anspruch als die Algorithmusauswahl. Eine spärliche Belohnung ist zwar ehrlich, führt aber zu langsamem Lernen; eine dichte Belohnung beschleunigt das Lernen, neigt aber dazu, Abkürzungen zu schaffen, die vom eigentlichen Ziel abweichen. Potenzialbasierte Belohnungsgestaltung ist eine der wenigen Möglichkeiten, diese dichte Belohnung mit der Garantie hinzuzufügen, dass sie die optimale Strategie nicht verändert. Trotzdem kommt es tatsächlich zu Belohnungsmanipulationen – wie Fälle wie CoastRunners zeigen, kann ein Agent die festgelegte Belohnung zwar wortwörtlich maximieren, aber auf eine Weise, die weit vom eigentlichen Ziel entfernt ist. Inverses Reinforcement Learning, das die Belohnung aus Demonstrationen ableitet, anstatt sie von einem Menschen festlegen zu lassen, und Constrained RL, das die Sicherheits- von der Belohnungsgewichtung trennt, sind beides Optionen, die aus derselben Erkenntnis entstanden sind: Man sollte nicht alles einer einzigen Belohnung anvertrauen.

Überprüfen Sie Ihr Verständnis
Was kann eine Belohnung für schnelles Ankommen auslassen?

Sie kann Kollisionen, abrupte Bewegungen oder Energieverbrauch auslassen. Überprüfen Sie Schlupflöcher und Einschränkungen, die unabhängig von der Belohnung gelten müssen.