#Sim-to-Real
Grundlagen des bestärkenden Lernens – MDPs, Bellman-Gleichungen und Exploration für Roboter
Reinforcement Learning ist ein geschlossener Kreislauf, in dem ein Agent auf Basis von Beobachtungen Aktionen auswählt und verzögerte Belohnungen maximiert. Diese Einführung erklärt Markov-Entscheidungsprozesse (MDPs), Wertfunktionen, Strategien, Bellman-Gleichungen, Exploration versus Exploitation, Belohnungsdesign und den Weg von der Simulation zum realen Roboter.
Fundamentals · 6 Min. Lesezeit Bestärkendes Lernen September 3, 2026Modellbasiertes Reinforcement Learning und Sim-to-Real
Weltmodelle, Vorhersagefehler, MPC, Domänenrandomisierung, Systemidentifikation und Sicherheitsüberwachung für reale Maschinen.
Fundamentals · 4 Min. LesezeitPolicy Gradients, PPO und SAC – Stabile kontinuierliche Regelung für Roboter
Policy-Gradienten aktualisieren eine Policy direkt, sodass Lenkung, Schub und Gelenkmoment kontinuierlich bleiben. Dieser Artikel verknüpft Actor-Critic, PPO und SAC und behandelt anschließend Clipping, Entropieregularisierung, Evaluierung und die Sicherheitsgrenze für den Sim-to-Real-Transfer.
Fundamentals · 5 Min. Lesezeit