Apprendimento per rinforzo
September 3, 2026
Nozioni di base sull'apprendimento per rinforzo: MDP, equazioni di Bellman ed esplorazione per i robot
L'apprendimento per rinforzo è un ciclo chiuso in cui un agente sceglie le azioni in base alle osservazioni e massimizza le ricompense ritardate. Questa introduzione spiega i processi decisionali di Markov (MDP), le funzioni di valore, le politiche, le equazioni di Bellman, la differenza tra esplorazione e sfruttamento, la progettazione delle ricompense e il percorso dalla simulazione a un robot reale.
Fundamentals · 7 min di lettura