Contents — find the section you need

Banyak model Vision-Language-Action (VLA) merepresentasikan gambar, bahasa, dan aksi sebagai satu rangkaian token dan memprediksi token berikutnya satu per satu. Diumumkan oleh Physical Intelligence pada tahun 2024, π0 (pi-zero) mengubah mekanisme pembangkitan aksi itu sendiri: alih-alih tokenisasi aksi secara autoregresif, ia menghasilkan potongan aksi kontinu dengan pencocokan aliran bersyarat. Artikel ini mengkaji desain yang dijelaskan dalam makalah “π0: A Vision-Language-Action Flow Model for General Robot Control” (Black, Brown, Driess et al., Physical Intelligence, arXiv:2410.24164) langkah demi langkah.

Artikel ini didasarkan pada deskripsi dalam makalah asli (arXiv:2410.24164) dan makalah PaliGemma (arXiv:2407.07726).

0. Apa yang akan Anda pelajari

  • Apa yang berubah pada π0 dibandingkan dengan model VLA autoregresif seperti RT-2 dan OpenVLA
  • Bagaimana kerangka kerja VLM PaliGemma dan "Action Expert" khusus berjalan bersama
  • Bagaimana pencocokan aliran bersyarat menghasilkan tindakan, termasuk integrasi Euler pada waktu inferensi
  • Bagaimana pelatihan lintas perwujudan heterogen di tujuh jenis robot ditangani
  • Mengapa pra-pelatihan dan pasca-pelatihan dipisahkan menjadi resep dua tahap

1. Kesimpulan terlebih dahulu: apa itu π0?

π0 adalah model kontrol robot serbaguna yang menggabungkan Model Bahasa-Visual (PaliGemma) yang telah dilatih sebelumnya dengan Pakar Aksi khusus yang menghasilkan potongan aksi kontinu melalui pencocokan aliran bersyarat. Sebuah model tunggal menerima gambar kamera, instruksi bahasa alami, dan keadaan sendi robot, kemudian menghasilkan urutan aksi yang mencakup hingga 50 langkah ke depan sekaligus. Model ini telah dilatih sebelumnya pada data dari tujuh platform robot yang berbeda, dapat melakukan beberapa tugas tanpa pelatihan tambahan (zero-shot), dan dirancang untuk beradaptasi dengan tugas-tugas baru melalui penyempurnaan (fine-tuning) dengan data yang relatif sedikit.

2. Mengapa menghasilkan aksi dengan pencocokan aliran?

VLA awal seperti RT-2 dan OpenVLA mendiskretisasi nilai aksi kontinu (sudut sendi, kecepatan, dan sebagainya) ke dalam bin yang telah ditentukan sebelumnya dan menetapkannya ke token kosakata model bahasa yang tidak digunakan. Ini memungkinkan gambar, bahasa, dan aksi ditangani sebagai satu urutan token. Pendekatan ini mudah diimplementasikan, tetapi memiliki dua keterbatasan. Pertama, karena aksi dihasilkan satu token pada satu waktu, urutan aksi berfrekuensi tinggi dan berdimensi tinggi dapat lambat untuk dihasilkan. Kedua, diskretisasi adalah perkiraan kasar dari ruang aksi, sehingga lebih sulit untuk merepresentasikan gerakan halus dan presisi seperti melipat kain atau menuangkan cairan, di mana deformasi dan kontak penting.

π0 mengatasi kedua poin tersebut dengan menghindari tokenisasi aksi dan menggunakan pencocokan aliran, sebuah keluarga model difusi, untuk menghasilkan potongan aksi kontinu 50 langkah dalam satu kali proses melalui representasi aksi. Makalah ini secara eksplisit menyajikan desain ini sebagai cara untuk menangani tugas dan potongan aksi yang sangat lincah pada frekuensi hingga 50 Hz.

3. Apa yang masuk?

π0 menerima tiga jenis input:

  • Gambar o_t : Gambar RGB dari beberapa tampilan kamera (hingga tiga tampilan, tergantung pada konfigurasi)
  • Instruksi bahasa : Deskripsi tugas dalam bahasa alami seperti “lipat kemeja”
  • Propriosepsi q_t : Vektor keadaan seperti sudut sendi robot

Semua ini diperlakukan bersama sebagai observasi o_t = [I_t^1, \dots, I_t^n, \ell_t, q_t]. Jumlah kamera dan derajat kebebasan sendi berbeda di setiap konfigurasi robot, sehingga padding dan masking diperlukan untuk menyelaraskan dimensi, seperti yang dijelaskan di bawah ini.

4. Apa yang diprediksi?

Outputnya adalah potongan aksi A_t = [a_t, a_{t+1}, \dots, a_{t+H-1}] yang berisi H=50 aksi dari waktu saat ini dan seterusnya. Tidak seperti model autoregresif yang menghasilkan satu token aksi pada satu waktu, π0 menghasilkan seluruh potongan secara bersamaan. Menghasilkan potongan ini melalui pencocokan aliran adalah ide utama dari π0.

5. Arsitektur Dasar

π0 menjalankan VLM yang telah dilatih sebelumnya (PaliGemma) bersama dengan "Action Expert" kecil yang khusus untuk pembangkitan aksi. Kedua Transformer beroperasi secara paralel dalam lapisan yang sama.

Diagram 1 · Use the button to switch views
π0 basic pipeline Multiple camera views, a language instruction, and joint state are processed by the PaliGemma VLM (SigLIP image encoder plus Gemma-2B language model). A separate Action Expert repeatedly updates the state and noisy action to produce an action chunk. Images (multi-view) Language instruction Joint state q_t Noisy action A_t^τ (iterated over τ) PaliGemma VLM (3B) SigLIP image encoder + Gemma-2B language model Processes image/language tokens Action Expert (300M) Separate parameter set Processes state q_t and noisy action Blocks in the same Transformer layers Shared through causal attention v_θ(A_t^τ, o_t) Outputs a vector field 10 Euler integration steps (τ: 0→1) Action chunk A_t (H=50) Up to 50 Hz

Gambar 1 — PaliGemma (gambar dan bahasa) dan Action Expert (keadaan dan aksi bising) menggunakan set parameter terpisah sambil berbagi lapisan Transformer yang sama melalui perhatian kausal blokwise. Medan vektor Action Expert diakumulasikan dengan 10 langkah integrasi Euler untuk menghasilkan potongan aksi 50 langkah.

6. Detail teknis komponen

Kerangka PaliGemma dan Action Expert

Kerangka VLM diinisialisasi dari PaliGemma, yang diumumkan oleh Google pada tahun 2024. PaliGemma menggabungkan encoder visi SigLIP-So400m dengan model bahasa Gemma-2B menjadi VLM 3B parameter. Tujuannya adalah untuk mentransfer pengetahuan visual dan bahasa yang dipelajari dari pelatihan awal skala internet ke dalam pembangkitan aksi robot.

Selain PaliGemma (sekitar 3 miliar parameter), π0 menambahkan Action Expert dengan sekitar 300 juta parameter: sebuah Transformer yang lebih kecil dengan lebar 1024 dan dimensi MLP 4096. Di sisi PaliGemma, angka yang sesuai adalah lebar 2048, kedalaman 18 lapisan, dan dimensi MLP 16384. Oleh karena itu, model π0 lengkap memiliki sekitar 3,3 miliar parameter.

Poin pentingnya adalah bahwa ini bukanlah dua jaringan yang sepenuhnya independen yang berjalan berdampingan. Mereka menggunakan set parameter yang berbeda untuk jenis token yang berbeda sambil berbagi lapisan Transformer yang sama. PaliGemma menangani token gambar dan bahasa, sementara Action Expert menangani token status dan token aksi bising; informasi berpindah di antara mereka melalui perhatian kausal blok demi blok di lapisan bersama. Token aksi dapat saling memperhatikan secara dua arah di dalam blok mereka, tetapi batasan pelatihan mencegah mereka untuk melihat ke depan ke informasi masa depan. Ini menyerupai ide campuran ahli dan memungkinkan satu model untuk menggabungkan keluaran bahasa diskrit (dilatih dengan entropi silang) dan keluaran aksi kontinu (dilatih dengan kerugian pencocokan aliran).

Generasi aksi dengan pencocokan aliran bersyarat

π0 menghasilkan aksi dengan pencocokan aliran bersyarat, yang termasuk dalam keluarga metode generatif berbasis difusi. Selama pelatihan, potongan aksi nyata A_t dan derau Gaussian \epsilon \sim \mathcal{N}(0, I) dicampur secara linier sepanjang parameter waktu \tau \in [0,1] untuk menciptakan aksi bising A_t^\tau.

A_t^\tau = \tau A_t + (1-\tau)\epsilon

Arah target yang harus diikuti untuk bergerak A_t^\tau menuju aksi nyata A_t didefinisikan sebagai berikut.

u(A_t^\tau \mid A_t) = \epsilon - A_t

Action Expert dilatih sebagai jaringan v_\theta(A_t^\tau, o_t) yang memprediksi medan vektor target ini dari observasi o_t dan aksi bising A_t^\tau. Kerugiannya adalah kuadrat kesalahan antara medan vektor yang diprediksi dan target.

\mathcal{L}^\tau(\theta) = \mathbb{E}_{p(A_t \mid o_t),\, q(A_t^\tau \mid A_t)} \left\| v_\theta(A_t^\tau, o_t) - u(A_t^\tau \mid A_t) \right\|^2

Pada saat inferensi, pengambilan sampel dimulai dari noise murni A_t^{\tau=0} = \epsilon. Metode Euler maju mengintegrasikan medan vektor yang diprediksi dari \tau=0 ke \tau=1, menyusun potongan aksi akhir.

A_t^{\tau+\delta} = A_t^{\tau} + \delta\, v_\theta(A_t^{\tau}, o_t)

Makalah ini menggunakan \delta = 0.1, atau 10 langkah integrasi, untuk beralih dari \tau=0 ke \tau=1. Sedangkan pembangkitan token autoregresif di RT-2/OpenVLA mengulang decoding sekuensial sepanjang potongan aksi, π0 menyempurnakan seluruh potongan selama 10 langkah pembaruan. Oleh karena itu, jumlah pembaruan tidak bertambah seiring dengan panjang potongan, yang merupakan sumber praktis dari keunggulan kecepatannya.

Pembelajaran lintas-wujud — melatih satu model di berbagai robot

Data pelatihan π0 mencakup tujuh platform robot yang berbeda: UR5e, UR5e bimanual, Franka, Trossen bimanual, ARX dan AgileX bimanual, Trossen dan ARX mobile, dan Fibocom mobile. Jumlah kamera adalah 2–3, sedangkan jumlah derajat kebebasan berkisar dari 7 hingga 17 tergantung pada robot.

Untuk merepresentasikan data heterogen ini dalam satu model, π0 menerapkan normalisasi berikut:

  • Vektor keadaan q_t dan vektor aksi a_t diisi dengan padding hingga derajat kebebasan maksimum dalam data pelatihan (18 dimensi). Robot dengan derajat kebebasan yang lebih sedikit menggunakan padding nol untuk entri yang tidak digunakan.
  • Untuk robot dengan kurang dari tiga kamera, slot gambar yang hilang ditutupi sehingga mekanisme perhatian mengabaikan posisi tersebut.
  • Karena jumlah sampel sangat bervariasi berdasarkan kombinasi tugas dan robot, pengambilan sampel diberi bobot n^{0.43} untuk kombinasi dengan n sampel. Ini mengurangi dominasi tugas yang kaya data.

Kumpulan data pelatihan lengkap berisi sekitar 900 juta langkah waktu, atau sekitar 10.000 jam: data milik Physical Intelligence sendiri dari 68 tugas dan tujuh robot, dikombinasikan dengan kumpulan data publik termasuk Open X-Embodiment (OXE), Bridge v2, dan DROID.

Resep pelatihan dua tahap — pra-pelatihan dan pasca-pelatihan

Pelatihan π0 secara umum dibagi menjadi dua tahap. Pra-pelatihan menggunakan dataset lengkap, besar, dan beragam. Ia menggunakan nama tugas dan anotasi segmen yang membagi eksekusi menjadi unit beberapa detik untuk membangun pengetahuan dasar yang luas. Pasca-pelatihan menggunakan data berkualitas tinggi dan terkurasi yang berfokus pada tugas hilir tertentu untuk mengubah dasar tersebut menjadi perilaku yang diinginkan.

Makalah ini memberikan alasan spesifik untuk pembagian ini: “Jika kita hanya melatih pada data berkualitas tinggi, model tidak akan belajar bagaimana pulih dari kegagalan.” Data eksekusi yang beragam dalam pra-pelatihan, yang tidak selalu sempurna, memberi model pengalaman dalam memulihkan diri ketika terjadi kesalahan. Data berkualitas tinggi dalam pasca-pelatihan kemudian menyempurnakan kemampuan untuk melakukan tugas target dengan presisi yang diinginkan.

Mengapa pencocokan aliran (flow matching) daripada model difusi konvensional?

Model difusi standar seperti DDPM (Denoising Diffusion Probabilistic Models) mengasumsikan jalur nonlinier yang secara bertahap menambahkan dan menghilangkan noise, dan seringkali membutuhkan puluhan atau ratusan langkah iteratif. Pencocokan aliran bersyarat di π0 malah menggunakan jalur probabilitas linier-Gaussian yang menghubungkan noise \epsilon dan aksi nyata A_t dengan garis lurus (A_t^\tau = \tau A_t + (1-\tau)\epsilon). Karena jalurnya lurus, medan vektor yang akan dipelajari lebih sederhana, dan sejumlah kecil langkah integrasi (10 di π0) dapat mencapai aksi target dengan akurasi yang berguna. Makalah ini memposisikan hal ini sebagai pilihan praktis untuk menghasilkan potongan aksi frekuensi tinggi dan dimensi tinggi dengan kecepatan mendekati waktu nyata.

7. Bagaimana π0 berbeda dari metode pembangkitan aksi VLA lainnya

Pembangkitan aksi VLA dapat dikelompokkan menjadi tiga keluarga besar.

Aspek Tokenisasi autoregresif (RT-2, OpenVLA) Head difusi (seperti Octo) Pencocokan aliran (π0)
Representasi aksi Nilai aksi diskrit diprediksi sebagai token satu per satu Nilai kontinu dihasilkan melalui proses difusi, dikondisikan pada output Transformer Nilai kontinu dihasilkan melalui pencocokan aliran
Jumlah iterasi generasi Skala dengan panjang chunk; chunk yang lebih panjang lebih lambat Bergantung pada jumlah langkah difusi Sejumlah kecil langkah integrasi; π0 menggunakan 10
Kesesuaian untuk gerakan frekuensi tinggi dan lincah Diskritisasi dapat menjadi hambatan Output yang halus dimungkinkan, tetapi beberapa tahap menambah latensi Menghasilkan chunk frekuensi tinggi (hingga 50 Hz) relatif cepat
Kesederhanaan implementasi Sederhana: perluas kosakata model bahasa Membutuhkan kepala difusi khusus Membutuhkan Pakar Aksi khusus dan desain medan vektor
Biaya komputasi Overhead decoding sekuensial yang besar Sedang hingga tinggi tergantung pada langkah difusi Relatif ringan karena menggunakan sedikit langkah
Kesulitan implementasi Relatif rendah; infrastruktur LLM yang ada dapat digunakan kembali Sedang Tinggi; pembagian parameter dan desain kerugian mencakup dua jenis keluaran

Tokenisasi autoregresif mudah diimplementasikan, tetapi decoding sekuensial meningkatkan latensi seiring bertambahnya ukuran potongan aksi. Kepala difusi menghasilkan nilai kontinu yang halus, tetapi membutuhkan proses pembangkitan multi-tahap. π0 berada di antara pendekatan ini: ia menangani nilai kontinu sambil menghasilkan seluruh potongan aksi dalam jumlah langkah integrasi yang tetap dan kecil. Dari perspektif pembelajaran imitasi, BC (Behavior Cloning) dan DAgger menjelaskan cara mempelajari pemetaan dari observasi ke aksi, sementara π0 adalah salah satu implementasi pemetaan tersebut menggunakan VLM besar dan kepala generatif khusus. Lihat “Pembelajaran Imitasi dan Pembelajaran Penguatan Terbalik” untuk dasar-dasarnya.

8. Apa yang menjadi kendala / lingkungan yang sulit

Evaluasi yang dilaporkan dalam makalah menunjukkan tren umum daripada jaminan universal. Pada beberapa tugas nyata (melipat kemeja, membersihkan meja, mengemas belanjaan, dan mengambil roti dari pemanggang roti), model dasar pra-terlatih tanpa penyempurnaan menunjukkan tingkat keberhasilan yang jauh lebih tinggi daripada model dasar yang ada seperti OpenVLA dan Octo. π0 sangat mendekati keandalan pada tugas-tugas seperti melipat kemeja, di mana OpenVLA dan Octo jauh tertinggal. Namun, perbedaan tersebut juga mencerminkan skala dan keragaman data pra-pelatihan, sehingga sulit untuk mengisolasi keunggulan yang hanya dimiliki oleh pencocokan aliran.

Makalah ini juga mengidentifikasi keterbatasan langsung: semakin dekat suatu tugas dengan tugas-tugas yang diwakili dalam pra-pelatihan, semakin besar manfaatnya; Tugas-tugas yang jauh di luar distribusi tersebut lebih bergantung pada kualitas dan kuantitas data pasca-pelatihan. Untuk tugas-tugas panjang dan bertahap seperti merakit kotak atau mengemas telur, tingkat keberhasilan yang dilaporkan bisa relatif tinggi, tetapi beberapa area masih jauh dari tingkat keberhasilan yang hampir sempurna seperti yang terlihat pada tugas-tugas aksi tunggal yang lebih sederhana.

Secara umum, zero-padding untuk pembelajaran lintas perwujudan tidak secara otomatis meluas ke robot dengan konfigurasi derajat kebebasan yang sepenuhnya baru yang tidak ada dalam pelatihan. Selain itu, jumlah langkah integrasi pencocokan aliran (10) tetap, membatasi seberapa halus pengguna pada waktu inferensi dapat menyesuaikan trade-off kecepatan-akurasi.

9. Bagaimana memilihnya dalam praktik

Untuk robot manipulasi serbaguna yang harus menangani banyak tugas dengan satu model, π0 adalah titik awal yang kuat: desainnya mendukung beberapa perilaku zero-shot dan fine-tuning dengan jumlah data yang relatif kecil. Physical Intelligence telah membuka kode dan bobot melalui repositori openpi, menurunkan hambatan untuk bereksperimen dengan robot kustom.

Untuk tugas-tugas seperti melipat kain atau menuangkan cairan, di mana kontak dan lintasan yang mulus penting, model pencocokan aliran (atau model kepala difusi seperti Octo) mungkin lebih cocok daripada VLA autoregresif yang bergantung pada token aksi diskrit.

Jika tujuannya hanya untuk menjalankan tugas pengambilan dan penempatan sederhana dengan latensi rendah, 3,3 miliar parameter π0 mungkin berlebihan. Model imitasi spesifik tugas yang ringan, seperti jaringan berbasis BC kecil, mungkin menawarkan keseimbangan yang lebih baik antara implementasi dan biaya operasional.

Jika satu robot spesifik akan menjalankan serangkaian tugas tetap, melatih model yang lebih sempit pada data spesifik tugas dapat lebih efisien daripada menggunakan model pra-terlatih besar seperti π0. Pilihan antara model umum dan model khusus bergantung pada keragaman tugas target dan jumlah data yang dapat dikumpulkan.

Untuk versi yang lebih baru seperti π0.5, π0.6, dan π0.7, lanskap VLA yang lebih luas, dan kompetisi pada benchmark LIBERO, lihat “Tren Teknologi VLA”. Untuk dasar-dasar pembelajaran imitasi, pembelajaran penguatan terbalik, dan masalah pergeseran kovariat di BC/DAgger, lihat “Pembelajaran Imitasi dan Pembelajaran Penguatan Terbalik”.

10. Ringkasan dalam tiga baris

  • π0 menjalankan PaliGemma VLM (3B) dan Pakar Aksi khusus (300M) dalam lapisan Transformer yang sama, menghasilkan potongan aksi kontinu dengan pencocokan aliran bersyarat.

  • Algoritma ini memprediksi vektor medan target u = \epsilon - A_t dari A_t^\tau = \tau A_t + (1-\tau)\epsilon, kemudian menggunakan 10 langkah integrasi Euler untuk menghasilkan potongan aksi 50 langkah pada saat inferensi. Ini adalah perbedaan utama dari tokenisasi autoregresif, yang proses decoding-nya menjadi lebih lambat seiring bertambahnya ukuran potongan.

  • Algoritma ini dilatih pada tujuh jenis robot dengan penambahan nol (zero padding) dan pengambilan sampel berbobot (weighted sampling), kemudian memisahkan data pra-pelatihan yang beragam dari data pasca-pelatihan berkualitas tinggi untuk menyeimbangkan generalitas dan kinerja spesifik tugas.

Referensi

Periksa pemahaman Anda
class="learning-check">Bisakah model yang menghasilkan aksi mengoperasikan robot yang tidak dikenal tanpa adaptasi?

Konfigurasi sendi, representasi aksi, observasi, dan antarmuka data pelatihan harus sesuai. Menjadi model dasar tidak berarti kompatibilitas tanpa penyesuaian.

What to read next

Review the backgroundPengantar Pembelajaran Penguatan: Pembelajaran Imitasi dan Pembelajaran Penguatan TerbalikContinue the seriesPengantar Pembelajaran Penguatan Multi-Agen — Optimasi di Dunia di Mana Pihak Lain Juga BelajarExplore another aspect of this fieldPengantar Desain Imbalan — Mengapa "Apa yang Harus Dimaksimalkan" Adalah Bagian Tersulit dari RL