Contents — find the section you need

L'apprentissage par renforcement Q (Q-learning) est une méthode hors stratégie qui met à jour une valeur pour chaque paire état-action : « Quel sera le gain de ce choix à long terme ? » Un petit labyrinthe peut être résolu avec une table, mais l'image d'une caméra et les nombreuses articulations rendent cette table irréalisable. Un réseau de neurones profond Q (DQN) remplace la table par un réseau de neurones et utilise la relecture d'expérience et un réseau cible pour réduire la corrélation des données et l'instabilité autoréférentielle.

Résumé en 30 secondes

  • Q(s,a) représente le gain futur attendu après l'action a dans l'état s. Choisir la valeur Q la plus élevée correspond à une stratégie gloutonne.

  • L'apprentissage par renforcement Q utilise la valeur Q maximale dans l'état suivant, même si la stratégie comportementale a exploré une autre action. C'est sa propriété hors stratégie. - Le DQN associe une observation de grande dimension, telle qu'une image, à des valeurs Q pour un ensemble fini d'actions discrètes. Le couple continu nécessite une discrétisation ou une méthode acteur-critique.

  • La relecture d'expérience permute les transitions précédentes, tandis qu'un réseau cible maintient la cible d'apprentissage quasiment fixe pendant plusieurs mises à jour.

  • Un robot doit exclure de son apprentissage les limites de vitesse, de force, de courant et d'arrêt d'urgence. Une récompense élevée n'est pas une preuve de la sécurité du matériel.

1. Stocker les valeurs Q dans un tableau

Dans le MDP du guide des bases de l'apprentissage par renforcement, choisir l'action a dans l'état s génère la récompense r et l'état suivant s'. L'apprentissage par renforcement (Q-learning) ne conserve aucun modèle explicite P de l'environnement inconnu. La valeur Q est mise à jour uniquement à partir de l'expérience (s,a,r,s') :

Q(s_t,a_t)\leftarrow Q(s_t,a_t)+\alpha\left[r_{t+1}+\gamma\max_{a'}Q(s_{t+1},a')-Q(s_t,a_t)\right]

L'erreur entre parenthèses représente l'erreur de différence temporelle (TD). Une erreur positive augmente la valeur de l'action ; une erreur négative la diminue. \alpha correspond au taux d'apprentissage et \gamma au facteur d'actualisation. À l'état terminal, la valeur de l'état suivant est nulle.

Diagram 1 · Use the button to switch views
Q-learning : mise à jour du tableau à partir d'une transition

Figure 1 — Le Q-learning déplace légèrement la valeur précédente vers une cible construite à partir de la récompense observée et de la valeur maximale de l'état suivant.

Un labyrinthe 5×5 ne comporte que 25 états et quatre actions ; 100 entrées dans le tableau suffisent donc. Avec l'exploration ε-gloutonne, les expériences propagent progressivement la valeur cible à rebours dans le labyrinthe. Fixer le taux d'apprentissage à 1 et se fier entièrement à une seule expérience la rend vulnérable au bruit environnemental ; c'est pourquoi une valeur comprise entre 0 et 1 est généralement utilisée pour faire la moyenne des expériences.

2. Apprentissage hors stratégie et exploration ε-gloutonne

La cible \max_{a'}Q(s',a') est la meilleure estimation de l'action, et non L'action réellement effectuée par la politique d'exploration est nécessairement celle décrite dans la section correspondante. L'apprentissage par renforcement Q peut donc apprendre une politique gloutonne tandis que l'approche ε-gloutonne collecte des données. Commencez avec un grand espace d'états (ε) pour couvrir l'espace des états et réduisez-le progressivement. Sur une machine physique, randomisez uniquement les commandes candidates validées et maintenez la surveillance des collisions à la priorité maximale.

3. Pourquoi le tableau est-il inadapté aux images et aux valeurs continues ?

Si un état correspond à chaque pixel d'une image de caméra et que chaque moteur possède 256 niveaux de vitesse, le tableau ne peut pas être stocké dans une mémoire pratique. Des images quasi identiques seraient également traitées comme des états non liés. Le réseau DQN approxime le tableau à l'aide d'un réseau de neurones (Q_\theta(s,a)).

Le réseau associe une image à une valeur Q par action discrète. Pour les actions haut/bas/gauche/droite, la sortie est ((Q(s,\mathrm{up}),Q(s,\mathrm{down}),Q(s,\mathrm{left}),Q(s,\mathrm{right}))). La fonction de perte est :

(

L(\theta)=\mathbb{E}_{(s,a,r,s')\sim D}\left[\left(y-Q_\theta(s,a)\right)^2\right],\qquad y=r+\gamma\max_{a'}Q_{\theta^-}(s',a')
)

où (D) représente le tampon de relecture. \theta^- appartient au réseau cible. Pour une transition terminale, y=r.

4. Relecture d'expérience : mélange des journaux corrélés

Les journaux du robot sont séquentiels : les trames à t et t+1 sont presque identiques. Un mini-lot composé de trames adjacentes produit un gradient biaisé. DQN stocke (s_t,a_t,r_{t+1},s_{t+1},done) dans une mémoire tampon de relecture et échantillonne des mini-lots aléatoires.

Conception de la mémoire tampon Avantage Coût
Échantillonnage uniforme Simple, affaiblit la corrélation temporelle Les défaillances rares sont moins échantillonnées
Relecture priorisée Se concentre sur les erreurs TD importantes Nécessite une correction d'importance et un suivi
FIFO de taille fixe S'adapte à un environnement changeant Les anciennes défaillances rares disparaissent
Stockage des épisodes Préserve le contexte de succès/échec Les lots peuvent redevenir corrélés

Ne pas écraser l'audit Suivi avec prétraitement d'apprentissage. Stockez les horodatages bruts des capteurs, les actions demandées et réellement limitées, ainsi que les indicateurs de collision, séparément des tenseurs d'entraînement normalisés.

5. Réseaux cibles : retarder le réseau enseignant

Si le même réseau en cours de mise à jour calcule simultanément la cible y et la prédiction Q_\theta, la cible se déplace à chaque itération. Une mise à jour visant à réduire l'erreur déplace également la cible suivante, ce qui entraîne une divergence ou une oscillation. Le DQN conserve une copie Q_{\theta^-} et la synchronise avec \theta^-\leftarrow\theta toutes les quelques centaines ou milliers de mises à jour.

Allonger l'intervalle de synchronisation stabilise la cible, mais la rend obsolète. La moyenne de Polyak est une alternative plus lisse :

\theta^-\leftarrow\tau\theta+(1-\tau)\theta^-

Enregistrez le choix, l'intervalle de synchronisation, la perte et la distribution des valeurs Q dans la configuration de l'expérience et les journaux.

6. Surestimation et Double DQN

Privilégier une estimation maximale par rapport à des estimations bruitées favorise une action qui semble par hasard correcte. Le DQN double sépare la sélection et l'évaluation des actions :

a^*=\arg\max_{a'}Q_\theta(s',a'),\qquad y=r+\gamma Q_{\theta^-}(s',a^*)

Cela ne supprime pas tous les biais, mais réduit souvent la croissance instable du Q. Un indicateur de terminal manquant, un masque d'action incorrect ou une échelle de récompense incohérente peuvent se ressembler ; il est donc important d'inspecter les données avant de modifier les algorithmes.

7. Où le DQN trouve sa place dans un robot

Le DQN suppose un ensemble d'actions fini. La discrétisation de l'angle de braquage ou du couple articulaire peut convenir pour une démonstration grossière, mais les grilles fines croissent rapidement et génèrent des commandes saccadées. DDPG, TD3 et SAC produisent directement des actions continues et sont souvent plus adaptés au contrôle du couple ou des vannes hydrauliques.

Le DQN reste utile pour les choix de haut niveau : voie gauche ou droite, candidat de préhension A/B/C ou mode de vitesse faible/moyenne/élevée. Transmettez la référence résultante à une couche PID ou MPC. Article PID et Article MPC article montre comment gérer les limites et les mécanismes de surveillance dans cette couche inférieure.

8. Tracer des courbes autres que la récompense

Enregistrer le taux de réussite, le taux de collision, la durée de l'épisode, la valeur Q moyenne et maximale, l'erreur TD et les fréquences d'action, ainsi que la récompense moyenne de l'épisode. Une augmentation de la récompense et du taux de collision indique généralement un bug lié à la récompense ou à la terminaison. Une valeur Q explosant avec une perte en baisse suggère un problème d'échelle, l'absence d'indicateur de terminaison ou une cible d'amorçage incorrecte.

Séparer les environnements d'évaluation et d'entraînement. Modifier l'éclairage, la friction du sol, la charge utile, la disposition des obstacles et le délai de communication. Une politique qui réussit dans un simulateur mais ignore l'exposition de la caméra, les zones mortes des moteurs ou la baisse de la batterie n'a pas démontré de performances DQN sur le matériel.

Liste de vérification pour l'implémentation

  1. Stocker l'état, l'action discrète, la récompense, l'indicateur de terminaison et l'horodatage comme une seule transition.

  2. Fixer et enregistrer ε, le taux d'apprentissage, la remise, la taille du tampon, la taille du lot et l'intervalle cible.

  3. Suivre la valeur Q Valeurs, erreurs TD, pertes, taux de succès/collision et fréquences d'action par ID d'expérience.

  4. Séparer le prétraitement de la relecture du journal d'audit brut.

  5. Tester unitairement les masques d'action, les états terminaux, les délais d'attente et les valeurs de capteurs invalides.

  6. Vérifier que les limites, les dispositifs de surveillance et les arrêts d'urgence restent au-dessus du DQN et fonctionnent malgré une coupure réseau.

  7. Exclure de l'entraînement les conditions et défaillances non observées.

Résumé

L'apprentissage par renforcement Q transforme l'équation d'optimalité de Bellman en une mise à jour de table sans nécessiter de modèle dynamique connu. Le DQN approxime cette table par un réseau, mais la relecture de l'expérience et un réseau cible sont essentiels pour éviter que la cible autoréférentielle n'amplifie le bruit. Le DQN est une couche de décision discrète utile ; le couple continu et la sécurité relèvent d'autres contrôleurs. Le suivi des erreurs TD, des collisions, des délais et des distributions Q (et pas seulement des récompenses) transforme un script de recherche en un système robotique auditable.

Vérifiez votre compréhension
Une valeur Q élevée garantit-elle une récompense importante ?

Q est une estimation du rendement attendu. Des états ou actions inhabituels peuvent engendrer d'importantes erreurs d'estimation.

Références

What to read next

Review the backgroundPrincipes fondamentaux de l'apprentissage par renforcement — Processus de décision markoviens, équations de Bellman et exploration pour les robotsContinue the seriesGradient de politique, PPO et SAC — Contrôle continu stable pour les robotsExplore another aspect of this fieldIntroduction à l'apprentissage par renforcement multi-agents — Optimisation dans un monde où l'autre camp apprend aussi