Apprendimento per rinforzo
September 4, 2026
Guida introduttiva alla progettazione delle ricompense: perché "cosa massimizzare" è la parte più difficile dell'apprendimento per rinforzo.
Nelle implementazioni dell'apprendimento per rinforzo, la progettazione della funzione di ricompensa determina più spesso il risultato rispetto all'algoritmo. Questo articolo analizza la differenza tra ricompensa sparsa e densa, l'invarianza di policy della modellazione della ricompensa basata sul potenziale, casi reali di manipolazione della ricompensa, l'apprendimento per rinforzo inverso e l'apprendimento per rinforzo vincolato.
Fundamentals · 9 min di lettura