Bestärkendes Lernen — Lernleitfaden
Bestärkendes Lernen — Ein strukturierter Lernweg durch Robotik, Regelung, kontrollierte Landwirtschaft, Energie- und Leistungselektronik.
Ein strukturierter Lernweg durch Robotik, Regelung, kontrollierte Landwirtschaft, Energie- und Leistungselektronik.
- Fundamentals · 6 Min. Lesezeit
Grundlagen des bestärkenden Lernens – MDPs, Bellman-Gleichungen und Exploration für Roboter
Reinforcement Learning ist ein geschlossener Kreislauf, in dem ein Agent auf Basis von Beobachtungen Aktionen auswählt und verzögerte Belohnungen maximiert. Diese Einführung erklärt Markov-Entscheidungsprozesse (MDPs), Wertfunktionen, Strategien, Bellman-Gleichungen, Exploration versus Exploitation, Belohnungsdesign und den Weg von der Simulation zum realen Roboter.
- Fundamentals · 5 Min. Lesezeit
Q-Learning und DQN – Von einer Q-Tabelle zu Deep Reinforcement Learning
Q-Learning aktualisiert Aktionswerte anhand des Bellman-Optimalitätsziels. Diese Einführung beschreibt den Weg von einer tabellarischen Q-Tabelle zu einem Deep Q-Netzwerk und erklärt Experience Replay, Zielnetzwerke, Überschätzung und sichere Platzierung in einem Roboterstapel.
- Fundamentals · 5 Min. Lesezeit
Policy Gradients, PPO und SAC – Stabile kontinuierliche Regelung für Roboter
Policy-Gradienten aktualisieren eine Policy direkt, sodass Lenkung, Schub und Gelenkmoment kontinuierlich bleiben. Dieser Artikel verknüpft Actor-Critic, PPO und SAC und behandelt anschließend Clipping, Entropieregularisierung, Evaluierung und die Sicherheitsgrenze für den Sim-to-Real-Transfer.
- Fundamentals · 9 Min. Lesezeit
Einführung in das Belohnungsdesign – Warum die Frage „Was soll maximiert werden?“ der schwierigste Teil des RL ist
Bei Implementierungen von Reinforcement Learning bestimmt die Gestaltung der Belohnungsfunktion häufiger das Ergebnis als der Algorithmus selbst. Dieser Artikel behandelt spärliche vs. dichte Belohnungsstrukturen, die Policy-Invarianz von potenzialbasierter Belohnungsgestaltung, reale Fälle von Reward Hacking, inverses Reinforcement Learning und Constrained Reinforcement Learning.
- Fundamentals · 4 Min. Lesezeit
Modellbasiertes Reinforcement Learning und Sim-to-Real
Weltmodelle, Vorhersagefehler, MPC, Domänenrandomisierung, Systemidentifikation und Sicherheitsüberwachung für reale Maschinen.
- Fundamentals · 5 Min. Lesezeit
Einführung in das Reinforcement Learning: Imitationslernen und inverses Reinforcement Learning
Verhaltensklonierung, DAgger und inverses Reinforcement Learning nutzen Demonstrationen, wenn Belohnungen schwer zu formulieren sind. Diese Einführung behandelt Kovariatenverschiebung, Belohnungsinferenz, VLA-Verbindungen, Evaluierung, Sicherheit und Datenherkunft.
- Fundamentals · 10 Min. Lesezeit
π0 erklärt – Wie Flow Matching die VLA-Aktionsgenerierung verändert hat
„Ein quellcodebasierter technischer Leitfaden zu Physical Intelligences π0: dem PaliGemma VLM und dem zugehörigen Action Expert, der kontinuierlichen Aktionsgenerierung mit bedingtem Flow-Matching, dem Cross-Embodiment-Training über sieben Robotertypen hinweg und dem Unterschied zu autoregressiven VLA-Modellen wie RT-2 und OpenVLA.“
- Fundamentals · 8 Min. Lesezeit
Einführung in das Multi-Agent Reinforcement Learning – Optimierung in einer Welt, in der auch die Gegenseite lernt
Wenn mehrere Agenten gleichzeitig lernen, ist ein Einzelagenten-MDP nicht mehr anwendbar. Dieser Artikel behandelt Nichtstationarität, kooperative/kompetitive/gemischte Umgebungen, CTDE, das Kreditvergabeproblem sowie MADDPG und QMIX anhand von Gleichungen und Diagrammen.