Artikel
Technik bauen, testen und untersuchen. Experimente, Umsetzung und Recherche zeigen, warum sie funktioniert.
← Zurück · Maschinelles Lernen
8

Bestärkendes Lernen

Bestärkendes Lernen — Ein strukturierter Lernweg durch Robotik, Regelung, kontrollierte Landwirtschaft, Energie- und Leistungselektronik.

Bestärkendes Lernen September 4, 2026

Einführung in das Multi-Agent Reinforcement Learning – Optimierung in einer Welt, in der auch die Gegenseite lernt

Wenn mehrere Agenten gleichzeitig lernen, ist ein Einzelagenten-MDP nicht mehr anwendbar. Dieser Artikel behandelt Nichtstationarität, kooperative/kompetitive/gemischte Umgebungen, CTDE, das Kreditvergabeproblem sowie MADDPG und QMIX anhand von Gleichungen und Diagrammen.

Fundamentals · 8 Min. Lesezeit
Bestärkendes Lernen September 4, 2026

π0 erklärt – Wie Flow Matching die VLA-Aktionsgenerierung verändert hat

„Ein quellcodebasierter technischer Leitfaden zu Physical Intelligences π0: dem PaliGemma VLM und dem zugehörigen Action Expert, der kontinuierlichen Aktionsgenerierung mit bedingtem Flow-Matching, dem Cross-Embodiment-Training über sieben Robotertypen hinweg und dem Unterschied zu autoregressiven VLA-Modellen wie RT-2 und OpenVLA.“

Fundamentals · 10 Min. Lesezeit
Bestärkendes Lernen September 4, 2026

Einführung in das Belohnungsdesign – Warum die Frage „Was soll maximiert werden?“ der schwierigste Teil des RL ist

Bei Implementierungen von Reinforcement Learning bestimmt die Gestaltung der Belohnungsfunktion häufiger das Ergebnis als der Algorithmus selbst. Dieser Artikel behandelt spärliche vs. dichte Belohnungsstrukturen, die Policy-Invarianz von potenzialbasierter Belohnungsgestaltung, reale Fälle von Reward Hacking, inverses Reinforcement Learning und Constrained Reinforcement Learning.

Fundamentals · 9 Min. Lesezeit
Bestärkendes Lernen September 3, 2026

Einführung in das Reinforcement Learning: Imitationslernen und inverses Reinforcement Learning

Verhaltensklonierung, DAgger und inverses Reinforcement Learning nutzen Demonstrationen, wenn Belohnungen schwer zu formulieren sind. Diese Einführung behandelt Kovariatenverschiebung, Belohnungsinferenz, VLA-Verbindungen, Evaluierung, Sicherheit und Datenherkunft.

Fundamentals · 5 Min. Lesezeit
Bestärkendes Lernen September 3, 2026

Grundlagen des bestärkenden Lernens – MDPs, Bellman-Gleichungen und Exploration für Roboter

Reinforcement Learning ist ein geschlossener Kreislauf, in dem ein Agent auf Basis von Beobachtungen Aktionen auswählt und verzögerte Belohnungen maximiert. Diese Einführung erklärt Markov-Entscheidungsprozesse (MDPs), Wertfunktionen, Strategien, Bellman-Gleichungen, Exploration versus Exploitation, Belohnungsdesign und den Weg von der Simulation zum realen Roboter.

Fundamentals · 6 Min. Lesezeit
Bestärkendes Lernen September 3, 2026

Modellbasiertes Reinforcement Learning und Sim-to-Real

Weltmodelle, Vorhersagefehler, MPC, Domänenrandomisierung, Systemidentifikation und Sicherheitsüberwachung für reale Maschinen.

Fundamentals · 4 Min. Lesezeit
Bestärkendes Lernen September 3, 2026

Policy Gradients, PPO und SAC – Stabile kontinuierliche Regelung für Roboter

Policy-Gradienten aktualisieren eine Policy direkt, sodass Lenkung, Schub und Gelenkmoment kontinuierlich bleiben. Dieser Artikel verknüpft Actor-Critic, PPO und SAC und behandelt anschließend Clipping, Entropieregularisierung, Evaluierung und die Sicherheitsgrenze für den Sim-to-Real-Transfer.

Fundamentals · 5 Min. Lesezeit
Bestärkendes Lernen September 3, 2026

Q-Learning und DQN – Von einer Q-Tabelle zu Deep Reinforcement Learning

Q-Learning aktualisiert Aktionswerte anhand des Bellman-Optimalitätsziels. Diese Einführung beschreibt den Weg von einer tabellarischen Q-Tabelle zu einem Deep Q-Netzwerk und erklärt Experience Replay, Zielnetzwerke, Überschätzung und sichere Platzierung in einem Roboterstapel.

Fundamentals · 5 Min. Lesezeit