Contents — find the section you need
Muchos modelos de Visión-Lenguaje-Acción (VLA) representan imágenes, lenguaje y acciones como una secuencia de tokens y predicen el siguiente token de uno en uno. Anunciado por Physical Intelligence en 2024, π0 (pi-cero) modifica el mecanismo de generación de acciones: en lugar de tokenizar las acciones de forma autorregresiva, genera un fragmento de acción continuo con coincidencia de flujo condicional. Este artículo examina paso a paso el diseño descrito en el artículo «π0: Un modelo de flujo de Visión-Lenguaje-Acción para el control general de robots» (Black, Brown, Driess et al., Physical Intelligence, arXiv:2410.24164).
Este artículo se basa en las descripciones del artículo original (arXiv:2410.24164) y del artículo de PaliGemma (arXiv:2407.07726).
0. Lo que aprenderá
- Qué cambia π0 en comparación con los modelos VLA autorregresivos como RT-2 y OpenVLA
- Cómo funcionan conjuntamente la arquitectura VLM de PaliGemma y el "Action Expert" dedicado
- Cómo la coincidencia de flujo condicional genera acciones, incluyendo la integración de Euler en tiempo de inferencia
- Cómo se gestiona el entrenamiento heterogéneo entre diferentes tipos de robots
- Por qué el preentrenamiento y el postentrenamiento se dividen en dos etapas
1. Primero la conclusión: ¿qué es π0?
π0 es un modelo de control robótico de propósito general que combina un modelo de lenguaje-visión preentrenado (PaliGemma) con un experto en acciones dedicado que genera secuencias de acciones continuas mediante coincidencia de flujo condicional. Un único modelo recibe imágenes de la cámara, una instrucción en lenguaje natural y el estado de las articulaciones del robot, y luego genera una secuencia de acciones que abarca hasta 50 pasos futuros a la vez. Fue preentrenado con datos de siete plataformas robóticas diferentes, puede realizar algunas tareas sin entrenamiento previo y está diseñado para adaptarse a nuevas tareas mediante ajuste fino con relativamente pocos datos.
2. ¿Por qué generar acciones con coincidencia de flujo?
Los primeros modelos de lenguaje-visión-lenguaje, como RT-2 y OpenVLA, discretizan los valores de acción continuos (ángulos articulares, velocidades, etc.) en intervalos predefinidos y los asignan a tokens del vocabulario del modelo de lenguaje que de otro modo no se utilizarían. Esto permite que las imágenes, el lenguaje y las acciones se manejen como una sola secuencia de tokens. El enfoque es sencillo de implementar, pero tiene dos limitaciones. En primer lugar, dado que las acciones se generan token a token, la producción de secuencias de acciones de alta frecuencia y alta dimensionalidad puede ser lenta. En segundo lugar, la discretización es una aproximación burda del espacio de acciones, lo que dificulta la representación de movimientos suaves y precisos, como doblar tela o verter líquido, donde la deformación y el contacto son importantes.
π0 aborda ambos problemas evitando la tokenización de acciones y utilizando la coincidencia de flujo, una familia de modelos de difusión, para generar un fragmento de acción continuo de 50 pasos en una sola pasada por la representación de la acción. El artículo presenta explícitamente este diseño como una forma de manejar tareas y fragmentos de acción de alta destreza a frecuencias de hasta 50 Hz.
3. ¿Qué se incluye?
π0 recibe tres tipos de entrada:
- Imágenes o_t: imágenes RGB de múltiples vistas de cámara (hasta tres vistas, según la configuración).
- Instrucciones en lenguaje natural: una descripción de la tarea en lenguaje natural, como «doblar la camisa».
- Propiocepción q_t: un vector de estado, como los ángulos de las articulaciones del robot.
Estas entradas se procesan conjuntamente como una observación o_t = [I_t^1, \dots, I_t^n, \ell_t, q_t]. El número de cámaras y los grados de libertad de las articulaciones varían según la configuración del robot, por lo que se requiere relleno y enmascaramiento para alinear las dimensiones, como se describe a continuación.
4. ¿Qué se predice?
La salida es un fragmento de acción A_t = [a_t, a_{t+1}, \dots, a_{t+H-1}] que contiene las acciones H=50 desde el momento actual en adelante. A diferencia de un modelo autorregresivo que produce un token de acción a la vez, π0 genera el fragmento completo de una sola vez. Generar este fragmento mediante la coincidencia de flujo es la idea central de π0.
5. Arquitectura básica
π0 ejecuta un VLM preentrenado (PaliGemma) junto con un pequeño "Action Expert" especializado en la generación de acciones. Los dos Transformers operan en paralelo dentro de las mismas capas.
Figura 1: PaliGemma (imagen e idioma) y Action Expert (estado y acción con ruido) utilizan conjuntos de parámetros separados, aunque comparten las mismas capas Transformer mediante atención causal por bloques. El campo vectorial del Experto en Acciones se acumula mediante 10 pasos de integración de Euler para generar un fragmento de acción de 50 pasos.
6. Detalles técnicos de los componentes
Estructura base de PaliGemma y Experto en Acciones
La estructura base del VLM se inicializa a partir de PaliGemma, anunciado por Google en 2024. PaliGemma combina un codificador de visión SigLIP-So400m con un modelo de lenguaje Gemma-2B en un VLM de 3B parámetros. El objetivo es transferir el conocimiento visual y lingüístico aprendido mediante el preentrenamiento a escala de internet a la generación de acciones robóticas.
Además de PaliGemma (con aproximadamente 3 mil millones de parámetros), π0 incorpora un Action Expert de unos 300 millones de parámetros: un Transformer más pequeño con un ancho de 1024 y una dimensión MLP de 4096. En el caso de PaliGemma, las cifras correspondientes son un ancho de 2048, una profundidad de 18 capas y una dimensión MLP de 16384. Por lo tanto, el modelo π0 completo tiene aproximadamente 3300 millones de parámetros.
Es importante destacar que no se trata de dos redes completamente independientes que funcionan en paralelo. Utilizan conjuntos de parámetros diferentes para distintos tipos de tokens, aunque comparten las mismas capas Transformer. PaliGemma gestiona los tokens de imagen y lenguaje, mientras que el Action Expert gestiona los tokens de estado y de acción con ruido; la información se transmite entre ellos mediante atención causal por bloques en las capas compartidas. Los tokens de acción pueden interactuar bidireccionalmente entre sí dentro de su bloque, pero la restricción de entrenamiento les impide anticipar información futura. Esto se asemeja a una idea de mezcla de expertos y permite que un modelo combine la salida discreta del lenguaje (entrenada con entropía cruzada) y la salida continua de la acción (entrenada con una pérdida de coincidencia de flujo).
Generación de acciones con coincidencia de flujo condicional
π0 genera acciones con coincidencia de flujo condicional, que pertenece a la familia de métodos generativos basados en difusión. Durante el entrenamiento, el fragmento de acción real A_t y el ruido gaussiano \epsilon \sim \mathcal{N}(0, I) se mezclan linealmente a lo largo de un parámetro de tiempo \tau \in [0,1] para crear la acción ruidosa A_t^\tau.
La dirección objetivo a seguir para mover A_t^\tau hacia la acción real A_t se define de la siguiente manera.
El Experto en Acción se entrena como una red v_\theta(A_t^\tau, o_t) que predice este campo vectorial objetivo a partir de la observación o_t y la acción con ruido A_t^\tau. La pérdida es el error cuadrático entre los campos vectoriales predicho y objetivo.
En el momento de la inferencia, el muestreo comienza con ruido puro A_t^{\tau=0} = \epsilon. Un método de Euler hacia adelante integra el campo vectorial predicho desde \tau=0 hasta \tau=1, ensamblando el fragmento de acción final.
El artículo utiliza \delta = 0.1, o 10 pasos de integración, para pasar de \tau=0 a \tau=1. Mientras que la generación de tokens autorregresiva en RT-2/OpenVLA repite la decodificación secuencial durante la longitud del fragmento de acción, π0 refina todo el fragmento en 10 pasos de actualización. Por lo tanto, el número de actualizaciones no aumenta con la longitud del fragmento, lo que constituye la principal razón de su ventaja en velocidad.
Aprendizaje entre diferentes plataformas robóticas: entrenamiento de un modelo en distintos robots
Los datos de entrenamiento de π0 abarcan siete plataformas robóticas diferentes: UR5e, UR5e bimanual, Franka, Trossen bimanual, ARX y AgileX bimanuales, Trossen y ARX móviles, y Fibocom móvil. El número de cámaras es de 2 a 3, mientras que el número de grados de libertad varía de 7 a 17, según el robot.
Para representar estos datos heterogéneos en un modelo, π0 aplica la siguiente normalización:
-
El vector de estado q_t y el vector de acción a_t se rellenan hasta alcanzar el máximo grado de libertad en los datos de entrenamiento (18 dimensiones). Los robots con menos grados de libertad utilizan relleno de ceros para las entradas no utilizadas.
-
Para robots con menos de tres cámaras, las ranuras de imagen faltantes se enmascaran para que el mecanismo de atención ignore esas posiciones.
-
Dado que el número de muestras varía sustancialmente según la tarea y la combinación de robot, el muestreo se pondera mediante n^{0.43} para una combinación con n muestras. Esto reduce el predominio de las tareas con gran cantidad de datos.
El conjunto de entrenamiento completo contiene aproximadamente 900 millones de pasos de tiempo, o unas 10 000 horas: datos propios de Physical Intelligence de 68 tareas y siete robots, combinados con conjuntos de datos públicos como Open X-Embodiment (OXE), Bridge v2 y DROID.
Receta de entrenamiento en dos etapas: preentrenamiento y postentrenamiento
El entrenamiento de π0 se divide en dos etapas principales. El preentrenamiento utiliza el conjunto de datos completo, amplio y diverso. Emplea nombres de tareas y anotaciones de segmentos que dividen las ejecuciones en unidades de varios segundos para construir una base de conocimiento amplia. El postentrenamiento utiliza datos de alta calidad y seleccionados, centrados en una tarea posterior específica, para transformar esa base en el comportamiento deseado.
El artículo ofrece una razón específica para esta división: «Si solo entrenáramos con datos de alta calidad, el modelo no aprendería a recuperarse de los fallos». Los datos de ejecución variados del preentrenamiento, que no siempre son perfectos, proporcionan al modelo experiencia en la recuperación ante errores. Los datos de alta calidad del postentrenamiento perfeccionan la capacidad de realizar la tarea objetivo con la precisión deseada.
¿Por qué la coincidencia de flujo en lugar de un modelo de difusión convencional?
Los modelos de difusión estándar, como DDPM (Modelos Probabilísticos de Difusión para la Eliminación de Ruido), asumen una trayectoria no lineal que añade y elimina ruido gradualmente, y a menudo requieren decenas o cientos de pasos iterativos. En cambio, el ajuste de flujo condicional en π0 utiliza una trayectoria de probabilidad lineal-gaussiana que conecta el ruido \epsilon y la acción real A_t con una línea recta (A_t^\tau = \tau A_t + (1-\tau)\epsilon). Dado que la trayectoria es recta, el campo vectorial que se debe aprender es más simple, y un pequeño número de pasos de integración (10 en π0) puede alcanzar la acción objetivo con una precisión útil. El artículo presenta este método como una opción práctica para generar fragmentos de acción de alta frecuencia y alta dimensión a una velocidad cercana al tiempo real.
7. Diferencias entre π0 y otros métodos de generación de acciones VLA
La generación de acciones VLA se puede agrupar en tres grandes familias.
| Aspecto | Tokenización autorregresiva (RT-2, OpenVLA) | Cabezal de difusión (como Octo) | Coincidencia de flujo (π0) |
|---|---|---|---|
| Representación de acciones | Valores de acción discretizados predichos como tokens uno a uno | Valores continuos generados mediante un proceso de difusión, condicionado a la salida del Transformer | Valores continuos generados mediante coincidencia de flujo |
| Número de iteraciones de generación | Escala con la longitud del fragmento; los fragmentos más largos son más lentos | Depende del número de pasos de difusión | Un número reducido de pasos de integración; π0 utiliza 10 |
| Idoneidad para movimientos diestros de alta frecuencia | La discretización puede convertirse en un cuello de botella | Es posible una salida fluida, pero las múltiples etapas añaden latencia | Genera fragmentos de alta frecuencia (hasta 50 Hz) con relativa rapidez |
| Simplicidad de implementación | Sencillo: extender el vocabulario del modelo de lenguaje | Requiere un cabezal de difusión dedicado | Requiere un Experto de Acción dedicado y un diseño de campo vectorial |
| Coste computacional | Gran sobrecarga de decodificación secuencial | Moderado a alto según los pasos de difusión | Relativamente ligero debido a que utiliza pocos pasos |
Dificultad de implementación | Relativamente baja; la infraestructura LLM existente es reutilizable | Moderada | Alta; el diseño de compartición de parámetros y pérdida abarca dos tipos de salida |
La tokenización autorregresiva es sencilla de implementar, pero la decodificación secuencial aumenta la latencia a medida que crece el fragmento de acción. Un cabezal de difusión produce valores continuos suaves, pero requiere un proceso de generación en varias etapas. π0 se sitúa entre estos enfoques: maneja valores continuos mientras genera todo el fragmento de acción en un número fijo y pequeño de pasos de integración. Desde la perspectiva del aprendizaje por imitación, BC (Clonación de Comportamiento) y DAgger describen cómo aprender una correspondencia entre observación y acción, mientras que π0 es una implementación de dicha correspondencia utilizando un VLM grande y un cabezal generativo dedicado. Consulte «Aprendizaje por imitación y aprendizaje por refuerzo inverso» para conocer los fundamentos.
8. Dificultades / Entornos difíciles
Las evaluaciones presentadas en el artículo muestran tendencias generales, no una garantía universal. En varias tareas reales (doblar camisas, recoger una mesa, embolsar la compra y sacar pan de una tostadora), el modelo base preentrenado, sin ajuste fino, muestra tasas de éxito sustancialmente superiores a las de los modelos de referencia existentes, como OpenVLA y Octo. π0 se acerca especialmente a la fiabilidad en tareas como doblar camisas, donde OpenVLA y Octo se quedan muy atrás. Sin embargo, la diferencia también refleja la escala y la diversidad de los datos de preentrenamiento, por lo que resulta difícil aislar una ventaja que se deba únicamente a la coincidencia de flujo.
El artículo también identifica una limitación directa: cuanto más se acerque una tarea a las representadas en el preentrenamiento, mayor será el beneficio; las tareas que se alejan mucho de esa distribución dependen en mayor medida de la calidad y la cantidad de los datos posteriores al entrenamiento. Para tareas largas y complejas, como ensamblar una caja o empacar huevos, el éxito reportado puede ser relativamente alto, pero algunas áreas aún no alcanzan las tasas casi perfectas observadas en tareas más simples de una sola acción.
En términos generales, el relleno de ceros para el aprendizaje entre diferentes modelos no se extiende automáticamente a un robot con una configuración de grados de libertad completamente nueva que no se incluyó en el entrenamiento. Además, el número de pasos de integración de coincidencia de flujo (10) es fijo, lo que limita la precisión con la que los usuarios pueden ajustar el equilibrio entre velocidad y precisión durante la inferencia.
9. Cómo elegirlo en la práctica
Para un robot de manipulación de propósito general que debe realizar muchas tareas con un solo modelo, π0 es un excelente punto de partida: su diseño admite cierto comportamiento de aprendizaje sin ejemplos y un ajuste fino con una cantidad relativamente pequeña de datos. Physical Intelligence ha publicado los pesos y el código fuente en el repositorio openpi, lo que facilita la experimentación con un robot personalizado.
Para tareas como doblar tela o verter líquido, donde el contacto y las trayectorias suaves son cruciales, un modelo de coincidencia de flujo (o un modelo de cabezal de difusión como Octo) puede ser más adecuado que un VLA autorregresivo que se basa en tokens de acción discretos.
Si el objetivo es simplemente ejecutar tareas sencillas de recogida y colocación con baja latencia, los 3300 millones de parámetros de π0 pueden resultar excesivos. Un modelo de imitación ligero y específico para la tarea, como una pequeña red basada en BC, puede ofrecer un mejor equilibrio entre el coste de implementación y el coste operativo.
Si un robot específico va a ejecutar un conjunto fijo de tareas, entrenar un modelo más reducido con datos específicos de la tarea puede ser más eficiente que usar un modelo preentrenado grande como π0. La elección entre un modelo general y uno especializado depende de la diversidad de las tareas objetivo y de la cantidad de datos que se puedan recopilar.
Para versiones más recientes como π0.5, π0.6 y π0.7, el panorama general de VLA y la competencia en el benchmark LIBERO, consulte «Tendencias tecnológicas de VLA». Para conocer los fundamentos del aprendizaje por imitación, el aprendizaje por refuerzo inverso y el problema del cambio de covariables en BC/DAgger, consulte «Aprendizaje por imitación y aprendizaje por refuerzo inverso».
10. Resumen en tres líneas
- π0 ejecuta un VLM de PaliGemma (3B) y un Experto de Acción dedicado (300M) en las mismas capas Transformer, generando fragmentos de acción continuos con coincidencia de flujo condicional.
-
Predice el campo vectorial objetivo u = \epsilon - A_t a partir de A_t^\tau = \tau A_t + (1-\tau)\epsilon y, a continuación, utiliza 10 pasos de integración de Euler para generar un fragmento de acción de 50 pasos durante la inferencia. Esta es la principal diferencia con la tokenización autorregresiva, cuya decodificación se ralentiza a medida que crece el fragmento.
-
Entrena con siete tipos de robots utilizando relleno de ceros y muestreo ponderado, y luego separa los datos de preentrenamiento diversos de los datos de postentrenamiento de alta calidad para equilibrar la generalidad y el rendimiento específico de la tarea.
Referencias
- π0: Un modelo de flujo de visión, lenguaje y acción para el control general de robots (arXiv:2410.24164)
- Artículo sobre π0, texto completo en ar5iv
- PDF oficial de π0 (Inteligencia Física)
- Blog oficial de π0: Inteligencia Física
- PaliGemma: Un modelo de flujo de visión 3B versátil para transferencia (arXiv:2407.07726)
- Repositorio OpenPI de Inteligencia Física en GitHub
¿Puede un modelo que genera acciones operar un robot desconocido sin adaptación?
La configuración de las articulaciones, la representación de las acciones, las observaciones y la interfaz de los datos de entrenamiento deben coincidir. Ser un modelo base no implica compatibilidad sin ajustes.
Comentarios
Inicia sesión para continuar.
Todavía no hay datos.