Bestärkendes Lernen
September 3, 2026
Policy Gradients, PPO und SAC – Stabile kontinuierliche Regelung für Roboter
Policy-Gradienten aktualisieren eine Policy direkt, sodass Lenkung, Schub und Gelenkmoment kontinuierlich bleiben. Dieser Artikel verknüpft Actor-Critic, PPO und SAC und behandelt anschließend Clipping, Entropieregularisierung, Evaluierung und die Sicherheitsgrenze für den Sim-to-Real-Transfer.
Fundamentals · 5 Min. Lesezeit