Apprendimento per rinforzo
September 3, 2026
Gradienti di policy, PPO e SAC: controllo continuo stabile per robot
I gradienti di policy aggiornano direttamente una policy in modo che sterzo, spinta e coppia articolare possano rimanere continui. Questo articolo collega Actor-Critic, PPO e SAC, quindi tratta il clipping, la regolarizzazione dell'entropia, la valutazione e il confine di sicurezza per il trasferimento Sim-Real.
Fundamentals · 6 min di lettura