Contents — find the section you need

Viele Vision-Language-Action (VLA)-Modelle repräsentieren Bilder, Sprache und Aktionen als eine Tokensequenz und sagen jeweils das nächste Token voraus. π0 (Pi-Null), das 2024 von Physical Intelligence angekündigt wurde, verändert den Mechanismus der Aktionsgenerierung grundlegend: Anstatt Aktionen autoregressiv zu tokenisieren, generiert es einen kontinuierlichen Aktionsblock mit bedingtem Flow-Matching. Dieser Artikel untersucht das im Paper „π0: A Vision-Language-Action Flow Model for General Robot Control“ (Black, Brown, Driess et al., Physical Intelligence, arXiv:2410.24164) beschriebene Design Schritt für Schritt.

Das 2024 von Physical Intelligence angekündigte Modell π0 (Pi-Null) verändert den Mechanismus der Aktionsgenerierung grundlegend: Anstatt Aktionen autoregressiv zu tokenisieren, generiert es einen kontinuierlichen Aktionsblock mit bedingtem Flow-Matching.

Dieser Artikel basiert auf den Beschreibungen im Originalartikel (arXiv:2410.24164) und dem PaliGemma-Paper (arXiv:2407.07726).

0. Lerninhalte

  • Welche Änderungen π0 im Vergleich zu autoregressiven VLA-Modellen wie RT-2 und OpenVLA aufweist
  • Wie das PaliGemma-VLM-Backbone und der dedizierte „Action Expert“ zusammenarbeiten
  • Wie bedingter Flow-Matching Aktionen generiert, einschließlich der Euler-Integration zur Inferenzzeit
  • Wie heterogenes Cross-Embodiment-Training für sieben Robotertypen gehandhabt wird
  • Warum Vor- und Nachtraining in einem zweistufigen Verfahren durchgeführt werden

1. Zunächst die Schlussfolgerung: Was ist π0?

π0 ist ein universelles Robotersteuerungsmodell, das ein vortrainiertes Bildverarbeitungs- und Sprachmodell (PaliGemma) mit einem dedizierten Aktionsexperten kombiniert. Dieser generiert durch bedingtes Flow-Matching kontinuierliche Aktionsblöcke. Ein einzelnes Modell empfängt Kamerabilder, eine natürlichsprachliche Anweisung und den Gelenkzustand des Roboters und gibt anschließend eine Aktionssequenz aus, die bis zu 50 zukünftige Schritte umfasst. Es wurde mit Daten von sieben verschiedenen Roboterplattformen vortrainiert, kann einige Aufgaben ohne vorheriges Training ausführen und ist so konzipiert, dass es sich durch Feinabstimmung mit relativ wenigen Daten an neue Aufgaben anpasst.

2. Warum Aktionen mit Flow-Matching generieren?

Frühe Bildverarbeitungs- und Sprachmodelle wie RT-2 und OpenVLA diskretisieren kontinuierliche Aktionswerte (Gelenkwinkel, Geschwindigkeiten usw.) in vordefinierte Kategorien und ordnen sie ansonsten ungenutzten Vokabular-Token des Sprachmodells zu. Dadurch können Bilder, Sprache und Aktionen als eine Token-Sequenz verarbeitet werden. Der Ansatz ist einfach zu implementieren, hat aber zwei Einschränkungen. Erstens, da Aktionen tokenweise generiert werden, kann die Erzeugung hochfrequenter, hochdimensionaler Aktionssequenzen langsam sein. Zweitens stellt die Diskretisierung eine grobe Annäherung an den Aktionsraum dar, wodurch die Darstellung flüssiger, präziser Bewegungen wie Falten von Stoff oder Ausgießen von Flüssigkeit erschwert wird, bei denen Deformation und Kontakt eine Rolle spielen.

π0 begegnet beiden Problemen, indem es die Tokenisierung von Aktionen vermeidet und Flow Matching, eine Familie von Diffusionsmodellen, verwendet, um einen kontinuierlichen Aktionsblock mit 50 Schritten in einem Durchlauf durch die Aktionsdarstellung zu generieren. Die Arbeit stellt diesen Ansatz explizit als Möglichkeit vor, hochkomplexe Aufgaben und Aktionsblöcke mit Frequenzen von bis zu 50 Hz zu verarbeiten.

3. Was gehört hinein?

π0 empfängt drei Arten von Eingaben:

  • Bilder o_t: RGB-Bilder aus mehreren Kameraansichten (bis zu drei Ansichten, abhängig von der Konfiguration)
  • Sprachanweisung: eine natürlichsprachliche Aufgabenbeschreibung wie „Hemd falten“
  • Propriozeption q_t: ein Zustandsvektor, z. B. die Gelenkwinkel des Roboters

Diese werden zusammen als Beobachtung o_t = [I_t^1, \dots, I_t^n, \ell_t, q_t] verarbeitet. Kameraanzahl und Gelenkfreiheitsgrade variieren je nach Roboterkonfiguration. Daher sind Padding und Maskierung erforderlich, um die Dimensionen anzupassen (siehe unten).

4. Was wird vorhergesagt?

Die Ausgabe ist ein Aktionsblock A_t = [a_t, a_{t+1}, \dots, a_{t+H-1}], der H=50 Aktionen ab dem aktuellen Zeitpunkt enthält. Im Gegensatz zu einem autoregressiven Modell, das jeweils nur ein Aktionstoken erzeugt, generiert π0 den gesamten Block auf einmal. Die Generierung dieses Blocks durch Flow-Matching ist die zentrale Idee von π0.

5. Grundlegende Architektur

π0 verwendet ein vortrainiertes VLM (PaliGemma) zusammen mit einem kleinen „Action Expert“, der auf die Aktionsgenerierung spezialisiert ist. Die beiden Transformer arbeiten parallel in denselben Schichten.

Diagram 1 · Use the button to switch views
π0 basic pipeline Multiple camera views, a language instruction, and joint state are processed by the PaliGemma VLM (SigLIP image encoder plus Gemma-2B language model). A separate Action Expert repeatedly updates the state and noisy action to produce an action chunk. Images (multi-view) Language instruction Joint state q_t Noisy action A_t^τ (iterated over τ) PaliGemma VLM (3B) SigLIP image encoder + Gemma-2B language model Processes image/language tokens Action Expert (300M) Separate parameter set Processes state q_t and noisy action Blocks in the same Transformer layers Shared through causal attention v_θ(A_t^τ, o_t) Outputs a vector field 10 Euler integration steps (τ: 0→1) Action chunk A_t (H=50) Up to 50 Hz

Abbildung 1 – PaliGemma (Bild und Sprache) und der Action Expert (Zustand und verrauschte Aktion) verwenden separate Parametersätze, teilen sich aber dieselben Transformer-Layer durch blockweise kausale Aufmerksamkeit. Das Vektorfeld des Action Experts wird mit 10 Euler-Integrationsschritten akkumuliert, um einen 50-stufigen Aktionsblock zu generieren.

6. Technische Details der Komponenten

PaliGemma-Backbone und Action Expert

Das VLM-Backbone wird mit PaliGemma initialisiert, das 2024 von Google angekündigt wurde. PaliGemma kombiniert einen SigLIP-So400m-Vision-Encoder mit einem Gemma-2B-Sprachmodell zu einem 3B-Parameter-VLM. Ziel ist es, visuelles und sprachliches Wissen, das durch großflächiges Pretraining erlernt wurde, in die Generierung von Roboteraktionen zu übertragen.

Zusätzlich zu PaliGemma (ca. 3 Milliarden Parameter) verwendet π0 einen Action Expert mit etwa 300 Millionen Parametern: einen kleineren Transformer mit einer Breite von 1024 und einer MLP-Dimension von 4096. Bei PaliGemma sind die entsprechenden Werte 2048 Breite, 18 Schichten Tiefe und 16384 MLP-Dimension. Das vollständige π0-Modell hat somit ca. 3,3 Milliarden Parameter.

Wichtig ist, dass es sich nicht um zwei völlig unabhängige, parallel laufende Netzwerke handelt. Sie verwenden unterschiedliche Parametersätze für verschiedene Token-Typen, nutzen aber dieselben Transformer-Schichten. PaliGemma verarbeitet Bild- und Sprach-Token, während der Action Expert Zustands- und verrauschte Aktions-Token verarbeitet. Der Informationsaustausch zwischen ihnen erfolgt über blockweise kausale Aufmerksamkeit in den gemeinsamen Schichten. Aktions-Token können innerhalb ihres Blocks bidirektional aufeinander reagieren, jedoch verhindert die Trainingsbeschränkung, dass sie zukünftige Informationen vorausschauen. Dies ähnelt dem Mixture-of-Experts-Ansatz und ermöglicht es einem Modell, diskrete Sprachausgabe (trainiert mit Kreuzentropie) und kontinuierliche Aktionsausgabe (trainiert mit einem Flow-Matching-Verlust) zu kombinieren.

Aktionsgenerierung mit bedingtem Flow-Matching

π0 generiert Aktionen mit bedingtem Flow-Matching und gehört zur Familie der diffusionsbasierten generativen Methoden. Während des Trainings werden der reale Aktionsabschnitt A_t und Gaußsches Rauschen \epsilon \sim \mathcal{N}(0, I) linear über einen Zeitparameter \tau \in [0,1] gemischt, um die verrauschte Aktion A_t^\tau zu erzeugen.

A_t^\tau = \tau A_t + (1-\tau)\epsilon

Die Zielrichtung, der gefolgt werden soll, um A_t^\tau in Richtung der realen Aktion A_t zu bewegen, ist wie folgt definiert.

u(A_t^\tau \mid A_t) = \epsilon - A_t

Der Action Expert wird als Netzwerk v_\theta(A_t^\tau, o_t) trainiert, das dieses Zielvektorfeld aus der Beobachtung o_t und der verrauschten Aktion A_t^\tau vorhersagt. Der Verlust ist der quadratische Fehler zwischen dem vorhergesagten und dem Zielvektorfeld.

\mathcal{L}^\tau(\theta) = \mathbb{E}_{p(A_t \mid o_t),\, q(A_t^\tau \mid A_t)} \left\| v_\theta(A_t^\tau, o_t) - u(A_t^\tau \mid A_t) \right\|^2

Zur Inferenzzeit beginnt das Sampling mit reinem Rauschen A_t^{\tau=0} = \epsilon. Ein Euler-Verfahren integriert das vorhergesagte Vektorfeld von \tau=0 nach \tau=1 und setzt so den finalen Aktionsabschnitt zusammen.

A_t^{\tau+\delta} = A_t^{\tau} + \delta\, v_\theta(A_t^{\tau}, o_t)

Die Arbeit verwendet \delta = 0.1, also 10 Integrationsschritte, um von \tau=0 nach \tau=1 zu gelangen. Während die autoregressive Token-Generierung in RT-2/OpenVLA die sequentielle Dekodierung für die Länge des Aktions-Chunks wiederholt, verfeinert π0 den gesamten Chunk in 10 Aktualisierungsschritten. Die Anzahl der Aktualisierungen wächst daher nicht mit der Chunk-Länge, was die praktische Grundlage für den Geschwindigkeitsvorteil bildet.

Cross-Embodiment-Lernen – Training eines Modells auf verschiedenen Robotern

Die Trainingsdaten von π0 umfassen sieben verschiedene Roboterplattformen: UR5e, bimanualer UR5e, Franka, bimanualer Trossen, bimanualer ARX und AgileX, mobiler Trossen und mobiler ARX sowie mobiler Fibocom. Die Anzahl der Kameras beträgt 2–3, während die Anzahl der Freiheitsgrade je nach Roboter zwischen 7 und 17 variiert.

Um diese heterogenen Daten in einem Modell abzubilden, wendet π0 die folgende Normalisierung an:

  • Der Zustandsvektor q_t und der Aktionsvektor a_t werden auf den maximalen Freiheitsgrad der Trainingsdaten (18 Dimensionen) aufgefüllt. Roboter mit weniger Freiheitsgraden verwenden Null-Auffüllung für die nicht benötigten Einträge.

  • Bei Robotern mit weniger als drei Kameras werden fehlende Bildplätze maskiert, sodass der Aufmerksamkeitsmechanismus diese Positionen ignoriert.

  • Da die Anzahl der Stichproben je nach Aufgabe und Roboterkombination stark variiert, wird die Stichprobenentnahme für eine Kombination mit n Stichproben mit n^{0.43} gewichtet. Dies reduziert die Dominanz datenreicher Aufgaben.

Der vollständige Trainingsdatensatz umfasst etwa 900 Millionen Zeitschritte bzw. rund 10.000 Stunden: Eigene Daten von Physical Intelligence aus 68 Aufgaben und sieben Robotern, kombiniert mit öffentlichen Datensätzen wie Open X-Embodiment (OXE), Bridge v2 und DROID.

Zweistufiges Trainingsverfahren – Vor- und Nachtraining

Das π0-Training lässt sich grob in zwei Phasen unterteilen. Vortraining nutzt den vollständigen, umfangreichen und vielfältigen Datensatz. Mithilfe von Aufgabennamen und Segmentannotationen werden Ausführungen in Einheiten von mehreren Sekunden unterteilt, um ein breites Grundlagenwissen aufzubauen. Nachtraining verwendet hochwertige, kuratierte Daten, die auf eine bestimmte nachgelagerte Aufgabe fokussiert sind, um dieses Grundlagenwissen in das gewünschte Verhalten umzusetzen.

Die Veröffentlichung nennt einen konkreten Grund für diese Aufteilung: „Würden wir nur mit hochwertigen Daten trainieren, würde das Modell nicht lernen, wie es sich von Fehlern erholt.“ Die vielfältigen Ausführungsdaten im Vortraining, die nicht immer perfekt sind, geben dem Modell Erfahrung im Umgang mit Fehlern. Die hochwertigen Daten im Nachtraining verfeinern dann die Fähigkeit, die Zielaufgabe mit der beabsichtigten Präzision auszuführen.

Warum Flow Matching anstelle eines herkömmlichen Diffusionsmodells?

Standard-Diffusionsmodelle wie DDPM (Denoising Diffusion Probabilistic Models) gehen von einem nichtlinearen Pfad aus, der Rauschen schrittweise hinzufügt und entfernt, und benötigen oft Dutzende oder Hunderte von Iterationsschritten. Conditional Flow Matching in π0 verwendet hingegen einen linear-Gaußschen Wahrscheinlichkeitspfad, der das Rauschen \epsilon und die tatsächliche Aktion A_t durch eine Gerade ( A_t^\tau = \tau A_t + (1-\tau)\epsilon ) verbindet. Da der Pfad geradlinig ist, ist das zu lernende Vektorfeld einfacher, und eine geringe Anzahl von Integrationsschritten (10 in π0) kann die Zielaktion mit ausreichender Genauigkeit erreichen. Die Arbeit stellt dies als praktische Option für die Generierung hochfrequenter, hochdimensionaler Aktionsblöcke nahezu in Echtzeit dar.

7. Wie sich π0 von anderen VLA-Aktionsgenerierungsmethoden unterscheidet

Die VLA-Aktionsgenerierung lässt sich in drei große Gruppen einteilen:

| Aspekt | Autoregressive Tokenisierung (RT-2, OpenVLA) | Diffusionskopf (z. B. Octo) | Flow-Matching (π0) | |---|---|---|

Aktionsdarstellung | Diskretisierte Aktionswerte werden als Token einzeln vorhergesagt | Kontinuierliche Werte werden durch einen Diffusionsprozess generiert, abhängig von der Transformer-Ausgabe | Kontinuierliche Werte werden durch Flow-Matching generiert |

Anzahl der Generierungsiterationen | Skaliert mit der Chunk-Länge; längere Chunks sind langsamer | Abhängig von der Anzahl der Diffusionsschritte | Wenige Integrationsschritte; π0 verwendet 10 |

Eignung für hochfrequente, präzise Bewegungen | Diskretisierung kann zum Flaschenhals werden | Glatte Ausgabe ist möglich, aber mehrere Stufen erhöhen die Latenz | Generiert hochfrequente Chunks (bis zu 50 Hz) relativ schnell |

Einfache Implementierung | Einfach: Erweiterung des Sprachmodellvokabulars | Benötigt einen dedizierten Diffusionskopf | Benötigt einen dedizierten Aktionsexperten und Vektorfelddesign |

Rechenaufwand | Hoher Aufwand für sequentielle Dekodierung | Mittel bis hoch, abhängig von den Diffusionsschritten | Relativ gering, da wenige Schritte benötigt werden |

Implementierungsaufwand | Relativ gering; bestehende LLM-Infrastruktur ist wiederverwendbar | Mittel | Hoch; Parameterteilung und Verlustfunktionsdesign umfassen zwei Ausgabetypen |

Autoregressive Tokenisierung ist einfach zu implementieren, aber die sequentielle Dekodierung erhöht die Latenz mit zunehmender Größe des Aktionsblocks. Ein Diffusionskopf erzeugt glatte, kontinuierliche Werte, erfordert jedoch einen mehrstufigen Generierungsprozess. π0 liegt zwischen diesen Ansätzen: Es verarbeitet kontinuierliche Werte und generiert den gesamten Aktionsblock in einer festen, geringen Anzahl von Integrationsschritten. Aus der Perspektive des Imitationslernens beschreiben BC (Behavior Cloning) und DAgger, wie eine Abbildung von Beobachtung zu Aktion erlernt wird, während π0 eine Implementierung dieser Abbildung mithilfe eines großen VLM und eines dedizierten generativen Kopfes darstellt. Siehe „Imitationslernen und inverses Reinforcement Learning“ für die Grundlagen.

8. Schwierigkeiten in schwierigen Umgebungen

Die in der Studie dargestellten Evaluierungen zeigen allgemeine Trends auf, aber keine universelle Garantie. Bei mehreren realen Aufgaben (Hemden falten, Tisch abräumen, Einkäufe einpacken und Brot aus dem Toaster nehmen) erzielt das vortrainierte Basismodell ohne Feinabstimmung deutlich höhere Erfolgsraten als bestehende Vergleichsmodelle wie OpenVLA und Octo. π0 ist insbesondere bei Aufgaben wie dem Hemdenfalten nahezu zuverlässig, während OpenVLA und Octo hier deutlich hinterherhinken. Der Unterschied spiegelt jedoch auch den Umfang und die Vielfalt der Trainingsdaten wider, sodass sich kein Vorteil allein durch das Flow-Matching herausstellen lässt.

Die Studie identifiziert zudem eine direkte Einschränkung: Je näher eine Aufgabe den im Vortraining repräsentierten Aufgaben kommt, desto größer ist der Nutzen; Aufgaben, die weit außerhalb dieser Verteilung liegen, hängen stärker von der Qualität und Quantität der Trainingsdaten ab. Bei langen, mehrstufigen Aufgaben wie dem Zusammenbau eines Kartons oder dem Verpacken von Eiern ist der berichtete Erfolg relativ hoch, jedoch werden in einigen Bereichen die nahezu perfekten Ergebnisse, die bei einfacheren Aufgaben mit einer einzigen Aktion erzielt werden, noch nicht erreicht.

Generell lässt sich Zero-Padding für Cross-Embodiment-Learning nicht automatisch auf einen Roboter mit einer völlig neuen Freiheitsgradkonfiguration übertragen, die im Training nicht berücksichtigt wurde. Darüber hinaus ist die Anzahl der Flow-Matching-Integrationsschritte (10) festgelegt, was die Feinabstimmung des Geschwindigkeits-Genauigkeits-Kompromisses durch die Nutzer während der Inferenzzeit einschränkt.

9. Praktische Auswahl

Für einen universellen Manipulationsroboter, der viele Aufgaben mit einem Modell bewältigen muss, ist π0 ein guter Ausgangspunkt: Sein Design unterstützt Zero-Shot-Verhalten und Feinabstimmung mit relativ wenigen Daten. Physical Intelligence hat die Gewichte und den Code über das OpenPi-Repository als Open Source veröffentlicht und damit die Hürde für Experimente mit einem benutzerdefinierten Roboter gesenkt.

Für Aufgaben wie das Falten von Stoff oder das Ausgießen von Flüssigkeiten, bei denen Kontakt und gleichmäßige Bewegungsabläufe wichtig sind, eignet sich ein Flow-Matching-Modell (oder ein Diffusionskopfmodell wie Octo) möglicherweise besser als ein autoregressives VLA, das auf diskreten Aktions-Tokens basiert.

Wenn es lediglich darum geht, einfache Pick-and-Place-Aufgaben mit geringer Latenz auszuführen, könnten die 3,3 Milliarden Parameter von π0 überdimensioniert sein. Ein ressourcenschonendes, aufgabenspezifisches Imitationsmodell, wie beispielsweise ein kleines BC-basiertes Netzwerk, bietet möglicherweise ein besseres Verhältnis zwischen Implementierungs- und Betriebskosten.

Wenn ein bestimmter Roboter einen festen Satz von Aufgaben ausführen soll, kann das Training eines spezialisierten Modells mit aufgabenspezifischen Daten effizienter sein als die Verwendung eines großen vortrainierten Modells wie π0. Die Wahl zwischen einem allgemeinen und einem spezialisierten Modell hängt von der Vielfalt der Zielaufgaben und der Menge der verfügbaren Daten ab.

Neuere Versionen wie π0.5, π0.6 und π0.7, die gesamte VLA-Landschaft sowie Wettbewerbe im LIBERO-Benchmark finden Sie unter „VLA Technology Trends“. Grundlagen des Imitationslernens, des inversen Reinforcement Learning und des Kovariatenverschiebungsproblems in BC/DAgger werden unter „Imitation Learning and Inverse Reinforcement Learning“ erläutert.

10. Zusammenfassung in drei Zeilen

  • π0 verwendet ein PaliGemma VLM (3B) und einen dedizierten Action Expert (300M) in denselben Transformer-Schichten und generiert kontinuierliche Aktionsblöcke mit bedingtem Ablaufabgleich.

  • Es sagt das Zielvektorfeld u = \epsilon - A_t aus A_t^\tau = \tau A_t + (1-\tau)\epsilon voraus und generiert anschließend mithilfe von 10 Euler-Integrationsschritten einen 50-stufigen Aktionsblock zur Inferenzzeit. Dies ist der Hauptunterschied zur autoregressiven Tokenisierung, deren Dekodierung mit zunehmender Blockgröße langsamer wird.

Es trainiert mit sieben Robotertypen unter Verwendung von Zero-Padding und gewichteter Stichprobenziehung und trennt anschließend diverse Vortrainingsdaten von hochwertigen Nachtrainingsdaten, um ein Gleichgewicht zwischen Allgemeingültigkeit und aufgabenspezifischer Leistung zu erzielen.

Referenzen

Überprüfen Sie Ihr Verständnis
Kann ein Modell, das Aktionen generiert, einen unbekannten Roboter ohne Anpassung steuern?

Die Gelenkkonfiguration, die Aktionsdarstellung, die Beobachtungen und die Schnittstelle zu den Trainingsdaten müssen übereinstimmen. Ein Basismodell zu sein bedeutet nicht automatisch Kompatibilität ohne Anpassung.

Kann ein Modell, das Aktionen generiert, einen unbekannten Roboter ohne Anpassung steuern?

What to read next

Review the backgroundEinführung in das Reinforcement Learning: Imitationslernen und inverses Reinforcement LearningContinue the seriesEinführung in das Multi-Agent Reinforcement Learning – Optimierung in einer Welt, in der auch die Gegenseite lerntExplore another aspect of this fieldEinführung in das Belohnungsdesign – Warum die Frage „Was soll maximiert werden?“ der schwierigste Teil des RL ist