Artikel
Technik bauen, testen und untersuchen. Experimente, Umsetzung und Recherche zeigen, warum sie funktioniert.
← Lernleitfaden

Bestärkendes Lernen — Lernleitfaden

Bestärkendes Lernen — Ein strukturierter Lernweg durch Robotik, Regelung, kontrollierte Landwirtschaft, Energie- und Leistungselektronik.

Ein strukturierter Lernweg durch Robotik, Regelung, kontrollierte Landwirtschaft, Energie- und Leistungselektronik.

  1. Fundamentals · 6 Min. Lesezeit

    Grundlagen des bestärkenden Lernens – MDPs, Bellman-Gleichungen und Exploration für Roboter

    Reinforcement Learning ist ein geschlossener Kreislauf, in dem ein Agent auf Basis von Beobachtungen Aktionen auswählt und verzögerte Belohnungen maximiert. Diese Einführung erklärt Markov-Entscheidungsprozesse (MDPs), Wertfunktionen, Strategien, Bellman-Gleichungen, Exploration versus Exploitation, Belohnungsdesign und den Weg von der Simulation zum realen Roboter.

  2. Fundamentals · 5 Min. Lesezeit

    Q-Learning und DQN – Von einer Q-Tabelle zu Deep Reinforcement Learning

    Q-Learning aktualisiert Aktionswerte anhand des Bellman-Optimalitätsziels. Diese Einführung beschreibt den Weg von einer tabellarischen Q-Tabelle zu einem Deep Q-Netzwerk und erklärt Experience Replay, Zielnetzwerke, Überschätzung und sichere Platzierung in einem Roboterstapel.

  3. Fundamentals · 5 Min. Lesezeit

    Policy Gradients, PPO und SAC – Stabile kontinuierliche Regelung für Roboter

    Policy-Gradienten aktualisieren eine Policy direkt, sodass Lenkung, Schub und Gelenkmoment kontinuierlich bleiben. Dieser Artikel verknüpft Actor-Critic, PPO und SAC und behandelt anschließend Clipping, Entropieregularisierung, Evaluierung und die Sicherheitsgrenze für den Sim-to-Real-Transfer.

  4. Fundamentals · 9 Min. Lesezeit

    Einführung in das Belohnungsdesign – Warum die Frage „Was soll maximiert werden?“ der schwierigste Teil des RL ist

    Bei Implementierungen von Reinforcement Learning bestimmt die Gestaltung der Belohnungsfunktion häufiger das Ergebnis als der Algorithmus selbst. Dieser Artikel behandelt spärliche vs. dichte Belohnungsstrukturen, die Policy-Invarianz von potenzialbasierter Belohnungsgestaltung, reale Fälle von Reward Hacking, inverses Reinforcement Learning und Constrained Reinforcement Learning.

  5. Fundamentals · 4 Min. Lesezeit

    Modellbasiertes Reinforcement Learning und Sim-to-Real

    Weltmodelle, Vorhersagefehler, MPC, Domänenrandomisierung, Systemidentifikation und Sicherheitsüberwachung für reale Maschinen.

  6. Fundamentals · 5 Min. Lesezeit

    Einführung in das Reinforcement Learning: Imitationslernen und inverses Reinforcement Learning

    Verhaltensklonierung, DAgger und inverses Reinforcement Learning nutzen Demonstrationen, wenn Belohnungen schwer zu formulieren sind. Diese Einführung behandelt Kovariatenverschiebung, Belohnungsinferenz, VLA-Verbindungen, Evaluierung, Sicherheit und Datenherkunft.

  7. Fundamentals · 10 Min. Lesezeit

    π0 erklärt – Wie Flow Matching die VLA-Aktionsgenerierung verändert hat

    „Ein quellcodebasierter technischer Leitfaden zu Physical Intelligences π0: dem PaliGemma VLM und dem zugehörigen Action Expert, der kontinuierlichen Aktionsgenerierung mit bedingtem Flow-Matching, dem Cross-Embodiment-Training über sieben Robotertypen hinweg und dem Unterschied zu autoregressiven VLA-Modellen wie RT-2 und OpenVLA.“

  8. Fundamentals · 8 Min. Lesezeit

    Einführung in das Multi-Agent Reinforcement Learning – Optimierung in einer Welt, in der auch die Gegenseite lernt

    Wenn mehrere Agenten gleichzeitig lernen, ist ein Einzelagenten-MDP nicht mehr anwendbar. Dieser Artikel behandelt Nichtstationarität, kooperative/kompetitive/gemischte Umgebungen, CTDE, das Kreditvergabeproblem sowie MADDPG und QMIX anhand von Gleichungen und Diagrammen.

Search this field →