Apprendimento per rinforzo
September 3, 2026
Q-Learning e DQN: dalla tabella Q all'apprendimento per rinforzo profondo.
L'apprendimento Q aggiorna i valori delle azioni con l'obiettivo di ottimalità di Bellman. Questa introduzione illustra il percorso da una tabella Q tabellare a una rete Q profonda, spiegando la riproduzione dell'esperienza, le reti target, la sovrastima e il posizionamento sicuro in una pila di robot.
Fundamentals · 6 min di lettura