Contents — find the section you need
El aprendizaje Q es un método de aprendizaje por refuerzo fuera de política que actualiza un valor para cada par estado-acción: "¿cuánto resultará rentable esta elección a largo plazo?". Un laberinto pequeño se puede resolver con una mesa, pero una imagen de cámara y muchas articulaciones hacen que esa mesa sea imposible de resolver. Una Red Q Profunda (DQN) reemplaza la mesa con una red neuronal y utiliza la reproducción de experiencias y una red objetivo para reducir los datos correlacionados y la inestabilidad autorreferencial.
Resumen de 30 segundos
-
Q(s,a) es el retorno futuro esperado tras realizar la acción a en el estado s. Elegir el valor Q más alto da como resultado una política voraz.
-
El aprendizaje Q utiliza el valor Q máximo en el siguiente estado, incluso cuando la política de comportamiento exploró otra acción. Esta es la propiedad fuera de política.
-
La DQN mapea una observación de alta dimensión, como una imagen, a valores Q para un conjunto finito de acciones discretas. El par continuo requiere discretización o un método Actor-Crítico.
-
La reproducción de experiencias reorganiza las transiciones antiguas, mientras que una red objetivo mantiene el objetivo de aprendizaje prácticamente fijo durante varias actualizaciones.
-
Un robot debe establecer límites de velocidad, fuerza, corriente y parada de emergencia fuera del sistema de aprendizaje. Una recompensa alta no es prueba de seguridad del hardware.
1. Colocar los valores Q en una tabla
En el MDP del Introducción a los fundamentos del aprendizaje por refuerzo, elegir la acción a en el estado s produce la recompensa r y el siguiente estado s'. El aprendizaje Q no mantiene un modelo explícito P del entorno desconocido; actualiza el valor Q únicamente a partir de la experiencia (s,a,r,s'):
El corchete representa el error de diferencia temporal (TD). Un error positivo aumenta el valor de la acción; uno negativo lo disminuye. \alpha es la tasa de aprendizaje y \gamma el factor de descuento. En un estado terminal, el valor del siguiente estado es cero.
Figura 1: El aprendizaje Q desplaza el valor anterior ligeramente hacia un objetivo formado a partir de la recompensa observada y el valor máximo del siguiente estado.
Un laberinto de 5×5 tiene solo 25 estados y cuatro acciones, por lo que 100 entradas en la tabla son suficientes. Con la exploración ε-greedy, las experiencias propagan gradualmente el valor objetivo hacia atrás a través del laberinto. Establecer la tasa de aprendizaje en 1 y confiar plenamente en una sola experiencia la hace vulnerable al ruido ambiental, por lo que normalmente se utiliza un valor entre 0 y 1 para promediar las experiencias.
2. Aprendizaje fuera de política y exploración ε-greedy
El objetivo \max_{a'}Q(s',a') es la acción mejor estimada, no necesariamente la acción que la política de comportamiento de exploración adoptó realmente. Por lo tanto, el aprendizaje Q puede aprender una política voraz mientras que la política ε-voraz recopila datos. Comience con un ε grande para cubrir el espacio de estados y redúzcalo lentamente. En una máquina física, aleatorice solo dentro de los comandos candidatos validados y mantenga la monitorización de colisiones con la máxima prioridad.
3. Por qué falla la tabla para imágenes y valores continuos
Si un estado es cada píxel de una imagen de cámara y cada motor tiene 256 niveles de velocidad, la tabla no cabe en la memoria práctica. Las imágenes casi idénticas también se tratarían como estados no relacionados. DQN aproxima la tabla con una red neuronal Q_\theta(s,a).
La red asigna una imagen a un valor Q por acción discreta. Para arriba/abajo/izquierda/derecha, la salida es (Q(s,\mathrm{up}),Q(s,\mathrm{down}),Q(s,\mathrm{left}),Q(s,\mathrm{right})). La pérdida es:
donde D es el búfer de reproducción y \theta^- pertenece a la red objetivo. Para una transición terminal, y=r.
4. Reproducción de la experiencia: mezcla de registros correlacionados
Los registros del robot son secuenciales: los fotogramas en t y t+1 son casi idénticos. Un minilote compuesto por fotogramas adyacentes produce un gradiente sesgado. DQN almacena (s_t,a_t,r_{t+1},s_{t+1},done) en un búfer de reproducción y muestrea minilotes aleatorios.
| Diseño del búfer | Beneficio | Costo |
|---|---|---|
| Muestreo uniforme | simple, debilita la correlación temporal | los fallos poco frecuentes se muestrean menos |
| Reproducción priorizada | se centra en errores TD grandes | requiere corrección de importancia y gestión de datos |
| FIFO de tamaño fijo | se adapta a un entorno cambiante | los fallos poco frecuentes antiguos desaparecen |
| Almacenamiento de episodios | conserva el contexto de éxito/fracaso | los lotes pueden volver a correlacionarse |
No Sobrescribe el registro de auditoría con el preprocesamiento de aprendizaje. Almacena las marcas de tiempo sin procesar del sensor, las acciones solicitadas y realmente limitadas, y los indicadores de colisión por separado de los tensores de entrenamiento normalizados.
5. Redes objetivo: retrasar el maestro
Si la misma red que se está actualizando calcula simultáneamente el objetivo y y la predicción Q_\theta, el objetivo cambia cada vez. Una actualización destinada a reducir el error también mueve el siguiente objetivo, lo que provoca divergencia u oscilación. DQN mantiene una copia Q_{\theta^-} y la sincroniza como \theta^-\leftarrow\theta cada pocos cientos o miles de actualizaciones.
Alargar el intervalo de sincronización estabiliza el objetivo, pero lo vuelve obsoleto. El promedio de Polyak es una alternativa más suave:
Registra la elección, el intervalo de sincronización, la pérdida y la distribución del valor Q en la configuración del experimento y los registros.
6. Sobreestimación y doble DQN
Tomar el máximo sobre estimaciones ruidosas favorece una acción que parece alta. El DQN doble separa la selección y la evaluación de acciones:
Esto no elimina todo el sesgo, pero a menudo reduce el crecimiento inestable de Q. Una bandera terminal faltante, una máscara de acción incorrecta o una escala de recompensa inconsistente pueden parecer similares, por lo que conviene inspeccionar los datos antes de cambiar los algoritmos.
7. Dónde encaja el DQN en un robot
El DQN asume un conjunto finito de acciones. Discretizar el ángulo de dirección o el par de las articulaciones puede funcionar para una demostración básica, pero las cuadrículas finas crecen rápidamente y generan comandos bruscos. DDPG, TD3 y SAC generan acciones continuas directamente y suelen ser más adecuados para el control de par o válvulas hidráulicas.
El DQN sigue siendo útil para decisiones de alto nivel: carril izquierdo o derecho, candidato de agarre A/B/C o modo de velocidad baja/media/alta. Entregue la referencia resultante a una capa PID o MPC. El [PID] Artículo y Artículo MPC muestran cómo mantener los límites y los mecanismos de supervisión en esa capa inferior.
8. Dibujar curvas distintas a la de recompensa
Registrar la tasa de éxito, la tasa de colisión, la duración del episodio, la Q media y máxima, el error de TD y las frecuencias de acción junto con la recompensa media del episodio. Una recompensa creciente con una tasa de colisión creciente suele indicar un error de recompensa o de terminación. Un valor Q que se dispara con una pérdida decreciente sugiere una discrepancia de escala, la ausencia de un indicador de terminal o un objetivo de arranque incorrecto.
Mantener los entornos de evaluación separados del entrenamiento. Modificar la iluminación, la fricción del suelo, la carga útil, la disposición de los obstáculos y el retardo de comunicación. Una política que funciona en un simulador pero ignora la exposición de la cámara, las zonas muertas del motor o la caída de la batería no ha demostrado un rendimiento DQN en hardware.
Lista de verificación de implementación
-
Almacenar el estado, la acción discreta, la recompensa, el indicador de terminal y la marca de tiempo como una sola transición.
-
Corregir y registrar. ε, tasa de aprendizaje, descuento, tamaño del búfer, tamaño del lote e intervalo objetivo.
-
Seguimiento de los valores Q, errores TD, pérdida, tasas de éxito/colisión y frecuencias de acción por ID de experimento.
-
Mantener el preprocesamiento de reproducción separado del registro de auditoría sin procesar.
-
Pruebas unitarias de las máscaras de acción, estados terminales, tiempos de espera y valores de sensor no válidos.
-
Verificar que los límites, los temporizadores de vigilancia y las paradas de emergencia se mantengan por encima de DQN y funcionen incluso en caso de una caída de red.
-
Excluir del entrenamiento las condiciones y fallos no vistos.
Resumen
El aprendizaje Q convierte la ecuación de optimalidad de Bellman en una actualización de tabla sin necesidad de un modelo dinámico conocido. DQN aproxima esa tabla con una red, pero la reproducción de la experiencia y una red objetivo son esenciales para evitar que el objetivo autorreferencial amplifique el ruido. DQN es una capa de decisión discreta útil; el par continuo y la seguridad pertenecen a otros controladores. El seguimiento de los errores TD, las colisiones, los retrasos y las distribuciones Q (no solo la recompensa) convierte Un script de investigación sobre un sistema robótico auditable.
¿Un valor Q elevado garantiza una recompensa elevada?
Q es una estimación del retorno esperado. Los estados o acciones desconocidos pueden producir grandes errores de estimación.
Referencias
- Watkins y Dayan, Q-learning (Machine Learning, 1992)
- Mnih et al., Control a nivel humano mediante aprendizaje profundo por refuerzo (Nature, 2015)
- Hessel et al., Rainbow: Combinando mejoras en el aprendizaje profundo por refuerzo (AAAI, 2018)
- OpenAI Spinning Up — Antecedentes de DQN - Conceptos básicos del aprendizaje por refuerzo
Comentarios
Inicia sesión para continuar.
Todavía no hay datos.