Contents — find the section you need

Birçok Görsel-Dil-Eylem (VLA) modeli, görüntüleri, dili ve eylemleri tek bir belirteç dizisi olarak temsil eder ve birer birer bir sonraki belirteci tahmin eder. 2024 yılında Physical Intelligence tarafından duyurulan π0 (pi-sıfır), eylem oluşturma mekanizmasını kendisi değiştirir: eylemleri otomatik olarak belirteçlere ayırmak yerine, koşullu akış eşleştirmesi ile sürekli bir eylem öbeği oluşturur. Bu makale, “π0: Genel Robot Kontrolü için Bir Görsel-Dil-Eylem Akış Modeli” (Black, Brown, Driess vd., Physical Intelligence, arXiv:2410.24164) makalesinde açıklanan tasarımı adım adım incelemektedir.

Bu makale, orijinal makaledeki (arXiv:2410.24164) ve PaliGemma makalesindeki (arXiv:2407.07726) açıklamalara dayanmaktadır.

0. Neler öğreneceksiniz

  • π0'ın RT-2 ve OpenVLA gibi otoregresif VLA modellerine kıyasla ne gibi değişiklikler gösterdiği
  • PaliGemma VLM omurgasının ve özel "Eylem Uzmanı"nın nasıl birlikte çalıştığı
  • Koşullu akış eşleştirmesinin, çıkarım zamanında Euler entegrasyonu da dahil olmak üzere eylemleri nasıl ürettiği
  • Yedi robot tipi arasında heterojen çapraz vücutlama eğitiminin nasıl ele alındığı
  • Ön eğitim ve son eğitimin neden iki aşamalı bir tarife ayrıldığı

1. Önce sonuç: π0 nedir?

π0, önceden eğitilmiş bir Görsel-Dil Modeli (PaliGemma) ile koşullu akış eşleştirmesi yoluyla sürekli eylem parçaları üreten özel bir Eylem Uzmanı'nı birleştiren genel amaçlı bir robot kontrol modelidir. Tek bir model, kamera görüntülerini, doğal dil talimatını ve robotun eklem durumunu alır ve ardından aynı anda 50'ye kadar gelecekteki adımı kapsayan bir eylem dizisi üretir. Yedi farklı robot platformundan gelen veriler üzerinde önceden eğitilmiştir, bazı görevleri sıfır atışla gerçekleştirebilir ve nispeten az veriyle ince ayar yaparak yeni görevlere uyum sağlamak üzere tasarlanmıştır.

2. Eylemleri akış eşleştirmesiyle neden üretiyoruz?

RT-2 ve OpenVLA gibi erken dönem VLA'lar, sürekli eylem değerlerini (eklem açıları, hızlar vb.) önceden tanımlanmış bölmelere ayırır ve bunları aksi takdirde kullanılmayan dil modeli sözcük dağarcığı belirteçlerine atar. Bu, görüntülerin, dilin ve eylemlerin tek bir belirteç dizisi olarak ele alınmasını sağlar. Yaklaşım uygulaması basittir, ancak iki sınırlaması vardır. Birincisi, eylemler tek tek belirteçler halinde üretildiği için, yüksek frekanslı, yüksek boyutlu eylem dizilerinin üretimi yavaş olabilir. İkincisi, ayrıştırma, eylem alanının kaba bir yaklaşımıdır ve bu da deformasyon ve temasın önemli olduğu kumaş katlama veya sıvı dökme gibi pürüzsüz, hassas hareketleri temsil etmeyi zorlaştırır.

π0, eylem belirteçleştirmesinden kaçınarak ve eylem temsili üzerinden tek geçişte 50 adımlı sürekli bir eylem öbeği oluşturmak için bir difüzyon modeli ailesi olan akış eşleştirmeyi kullanarak her iki noktayı da ele almaktadır. Makale, bu tasarımı, 50 Hz'ye kadar frekanslarda son derece becerikli görevleri ve eylem öbeklerini ele almanın bir yolu olarak açıkça sunmaktadır.

3. İçeriye ne giriyor?

π0 üç tür girdi alır:

  • Görüntüler o_t : Birden fazla kamera görüntüsünden (konfigürasyona bağlı olarak en fazla üç görüntü) RGB görüntüler
  • Dilsel talimat: “gömleği katla” gibi doğal dilde bir görev açıklaması
  • Propriosepsiyon q_t : Robotun eklem açıları gibi bir durum vektörü

Bunlar birlikte bir gözlem o_t = [I_t^1, \dots, I_t^n, \ell_t, q_t] olarak ele alınır. Kamera sayısı ve eklem serbestlik dereceleri robot konfigürasyonlarında farklılık gösterdiğinden, boyutları hizalamak için aşağıda açıklandığı gibi dolgu ve maskeleme gereklidir.

4. Ne tahmin ediliyor?

Çıktı, mevcut zamandan itibaren H=50 eylem içeren bir eylem öbeği A_t = [a_t, a_{t+1}, \dots, a_{t+H-1}]'tür. Tek seferde bir eylem belirteci üreten otoregresif bir modelin aksine, π0 tüm öbeği birlikte oluşturur. Bu bloğu akış eşleştirme yoluyla oluşturmak, π0'ın temel fikridir.

5. Temel mimari

π0, önceden eğitilmiş bir VLM (PaliGemma) ile eylem üretimi için özel olarak tasarlanmış küçük bir "Eylem Uzmanı"nı birlikte çalıştırır. İki Transformer aynı katmanlarda paralel olarak çalışır.

Diagram 1 · Use the button to switch views
π0 basic pipeline Multiple camera views, a language instruction, and joint state are processed by the PaliGemma VLM (SigLIP image encoder plus Gemma-2B language model). A separate Action Expert repeatedly updates the state and noisy action to produce an action chunk. Images (multi-view) Language instruction Joint state q_t Noisy action A_t^τ (iterated over τ) PaliGemma VLM (3B) SigLIP image encoder + Gemma-2B language model Processes image/language tokens Action Expert (300M) Separate parameter set Processes state q_t and noisy action Blocks in the same Transformer layers Shared through causal attention v_θ(A_t^τ, o_t) Outputs a vector field 10 Euler integration steps (τ: 0→1) Action chunk A_t (H=50) Up to 50 Hz

Şekil 1 — PaliGemma (görüntü ve dil) ve Eylem Uzmanı (durum ve gürültülü eylem), aynı parametre setlerini paylaşırken ayrı parametre setleri kullanır. Blok bazlı nedensel dikkat mekanizması aracılığıyla transformatör katmanları. Eylem Uzmanı'nın vektör alanı, 50 adımlık bir eylem bloğu oluşturmak için 10 Euler entegrasyon adımıyla biriktirilir.

6. Bileşenlerin Teknik Detayları

PaliGemma omurgası ve Eylem Uzmanı

VLM omurgası, Google tarafından 2024 yılında duyurulan PaliGemma'dan başlatılır. PaliGemma, bir SigLIP-So400m görüntü kodlayıcısını bir Gemma-2B dil modeliyle birleştirerek 3B parametreli bir VLM oluşturur. Amaç, internet ölçeğinde ön eğitimden öğrenilen görsel ve dil bilgisini robot eylem üretimine aktarmaktır.

π0, PaliGemma'ya (yaklaşık 3 milyar parametre) ek olarak, yaklaşık 300 milyon parametreli bir Eylem Uzmanı ekler: 1024 genişliğinde ve 4096 MLP boyutuna sahip daha küçük bir Transformer. PaliGemma tarafında ise karşılık gelen rakamlar 2048 genişlik, 18 katman derinliği ve 16384 MLP boyutudur. Dolayısıyla, tam π0 modeli yaklaşık 3,3 milyar parametreye sahiptir.

Önemli olan nokta, bunların yan yana çalışan tamamen bağımsız iki ağ olmamasıdır. Farklı token türleri için farklı parametre setleri kullanırken aynı Transformer katmanlarını paylaşırlar. PaliGemma görüntü ve dil token'larını işlerken, Eylem Uzmanı durum ve gürültülü eylem token'larını işler; bilgi, paylaşılan katmanlardaki blok bazlı nedensel dikkat mekanizması aracılığıyla aralarında geçer. Eylem token'ları kendi blokları içinde birbirlerine çift yönlü olarak dikkat edebilir, ancak eğitim kısıtlaması gelecekteki bilgilere bakmalarını engeller. Bu, farklı uzmanların bir araya getirilmesi fikrine benziyor ve bir modelin ayrık dil çıktısını (çapraz entropi ile eğitilmiş) ve sürekli eylem çıktısını (akış eşleştirme kaybı ile eğitilmiş) birleştirmesine olanak tanıyor.

Koşullu akış eşleştirme ile eylem üretimi

π0, difüzyon tabanlı üretken yöntemler ailesine ait olan koşullu akış eşleştirme ile eylemler üretir. Eğitim sırasında, gerçek eylem parçası A_t ve Gauss gürültüsü \epsilon \sim \mathcal{N}(0, I), gürültülü eylem A_t^\tau'i oluşturmak için bir zaman parametresi \tau \in [0,1] boyunca doğrusal olarak karıştırılır.

A_t^\tau = \tau A_t + (1-\tau)\epsilon

A_t^\tau'u gerçek eylem A_t'e doğru hareket ettirmek için izlenecek hedef yön aşağıdaki gibi tanımlanır.

u(A_t^\tau \mid A_t) = \epsilon - A_t

Eylem Uzmanı, gözlem o_t ve gürültülü eylem A_t^\tau'ten bu hedef vektör alanını tahmin eden bir ağ v_\theta(A_t^\tau, o_t) olarak eğitilir. Kayıp, tahmin edilen ve hedef vektör alanları arasındaki karesel hatadır.

\mathcal{L}^\tau(\theta) = \mathbb{E}_{p(A_t \mid o_t),\, q(A_t^\tau \mid A_t)} \left\| v_\theta(A_t^\tau, o_t) - u(A_t^\tau \mid A_t) \right\|^2

Çıkarım zamanında, örnekleme saf gürültüden A_t^{\tau=0} = \epsilon başlar. İleri Euler yöntemi, tahmin edilen vektör alanını \tau=0'den \tau=1'a entegre ederek nihai eylem parçasını oluşturur.

A_t^{\tau+\delta} = A_t^{\tau} + \delta\, v_\theta(A_t^{\tau}, o_t)

Makale, \tau=0'den \tau=1'e geçmek için \delta = 0.1 veya 10 entegrasyon adımı kullanır. RT-2/OpenVLA'daki otoregresif token üretimi, eylem bloğunun uzunluğu boyunca ardışık kod çözmeyi tekrarlarken, π0 tüm bloğu 10 güncelleme adımı boyunca iyileştirir. Bu nedenle güncelleme sayısı blok uzunluğuyla artmaz, bu da hız avantajının pratik kaynağıdır.

Çapraz somutlaştırma öğrenimi — farklı robotlarda tek bir modelin eğitilmesi

π0'ın eğitim verileri yedi farklı robot platformunu kapsar: UR5e, çift elli UR5e, Franka, çift elli Trossen, çift elli ARX ve AgileX, mobil Trossen ve mobil ARX ve mobil Fibocom. Kamera sayısı 2-3 iken, serbestlik derecesi sayısı robota bağlı olarak 7 ile 17 arasında değişmektedir.

Bu heterojen verileri tek bir modelde temsil etmek için π0 aşağıdaki normalizasyonu uygular:

  • Durum vektörü q_t ve eylem vektörü a_t, eğitim verilerindeki maksimum serbestlik derecesine (18 boyut) kadar doldurulur. Daha az serbestlik derecesine sahip robotlar, kullanılmayan girişler için sıfır doldurma kullanır.

  • Üçten az kameraya sahip robotlar için, dikkat mekanizmasının bu konumları yok sayması için eksik görüntü yuvaları maskelenir.

  • Örnek sayıları görev ve robot kombinasyonuna göre önemli ölçüde değiştiğinden, n örnek içeren bir kombinasyon için örnekleme n^{0.43} ile ağırlıklandırılır. Bu, veri açısından zengin görevlerin baskınlığını azaltır.

Tam eğitim seti yaklaşık 900 milyon zaman adımı veya yaklaşık 10.000 saat içerir: Fiziksel Zeka'nın 68 görev ve yedi robottan elde ettiği kendi verileri, Open X-Embodiment (OXE), Bridge v2 ve DROID dahil olmak üzere kamuya açık veri setleriyle birleştirilmiştir.

İki Aşamalı Eğitim Yöntemi — Ön Eğitim ve Son Eğitim

π0 eğitimi genel olarak iki aşamaya ayrılır. Ön eğitim, tam, büyük ve çeşitli veri setini kullanır. Geniş bir temel bilgi oluşturmak için yürütmeleri birkaç saniyelik birimlere bölen görev adlarını ve segment açıklamalarını kullanır. Son eğitim, bu temeli istenen davranışa dönüştürmek için belirli bir sonraki göreve odaklanan yüksek kaliteli, derlenmiş verileri kullanır.

Makale bu ayrım için özel bir neden sunuyor: “Sadece yüksek kaliteli veriler üzerinde eğitim yapsaydık, model arızalardan nasıl kurtulacağını öğrenemezdi.” Her zaman mükemmel olmayan ön eğitimdeki çeşitli yürütme verileri, modele işler ters gittiğinde nasıl kurtulacağı konusunda deneyim kazandırır. Eğitim sonrası aşamada elde edilen yüksek kaliteli veriler, hedef görevi amaçlanan hassasiyetle gerçekleştirme yeteneğini geliştirir.

Neden geleneksel bir difüzyon modeli yerine akış eşleştirme?

DDPM (Denoising Diffusion Probabilistic Models) gibi standart difüzyon modelleri, gürültüyü kademeli olarak ekleyen ve kaldıran doğrusal olmayan bir yol varsayar ve genellikle onlarca veya yüzlerce yinelemeli adım gerektirir. π0'daki koşullu akış eşleştirme ise bunun yerine gürültü \epsilon ve gerçek eylem A_t'u düz bir çizgiyle ( A_t^\tau = \tau A_t + (1-\tau)\epsilon ) bağlayan doğrusal-Gauss olasılık yolunu kullanır. Yol düz olduğu için öğrenilecek vektör alanı daha basittir ve az sayıda entegrasyon adımı (π0'da 10) hedef eyleme kullanışlı bir doğrulukla ulaşabilir. Makale bunu, gerçek zamanlıya yakın hızda yüksek frekanslı, yüksek boyutlu eylem parçaları üretmek için pratik bir seçim olarak konumlandırıyor.

7. π0'ın Diğer VLA Eylem Üretim Yöntemlerinden Farkı

VLA eylem üretimi üç geniş aileye ayrılabilir.

Yön Otoregresif tokenizasyon (RT-2, OpenVLA) Difüzyon başlığı (Octo gibi) Akış eşleştirme (π0)
Eylem gösterimi Ayrıklaştırılmış eylem değerleri, tek tek token olarak tahmin edilir Transformer çıktısına bağlı olarak bir difüzyon süreciyle üretilen sürekli değerler Akış eşleştirme yoluyla üretilen sürekli değerler
Üretim yineleme sayısı Parça uzunluğuyla ölçeklenir; daha uzun parçalar daha yavaştır Difüzyon adımlarının sayısına bağlıdır Az sayıda entegrasyon adımı; π0 10 kullanır
Yüksek frekanslı, çevik hareket için uygunluk Ayrıklaştırma bir darboğaz haline gelebilir Pürüzsüz çıktı mümkündür, ancak birden fazla aşama gecikme ekler Nispeten hızlı bir şekilde yüksek frekanslı öbekler (50 Hz'ye kadar) üretir

Uygulama kolaylığı | Basit: dil modeli sözlüğünü genişletin | Özel bir difüzyon başlığı gerektirir | Özel bir Eylem Uzmanı ve vektör alanı tasarımı gerektirir |

Hesaplama maliyeti | Büyük sıralı kod çözme yükü | Difüzyon adımlarına bağlı olarak orta ila yüksek | Az sayıda adım kullandığı için nispeten hafif |

Uygulama zorluğu | Nispeten düşük; mevcut LLM altyapısı yeniden kullanılabilir | Orta | Yüksek; parametre paylaşımı ve kayıp tasarımı iki çıktı türünü kapsar |

Otoregresif tokenizasyonun uygulanması basittir, ancak sıralı kod çözme, eylem öbeği büyüdükçe gecikmeyi artırır. Bir difüzyon başlığı düzgün sürekli değerler üretir, ancak çok aşamalı bir üretim süreci gerektirir. π0 bu yaklaşımlar arasında yer alır: tüm eylem öbeğini sabit, az sayıda entegrasyon adımında üretirken sürekli değerleri ele alır. Taklit öğrenme perspektifinden bakıldığında, BC (Davranış Klonlama) ve DAgger, gözlemden eyleme bir eşlemeyi nasıl öğrenileceğini açıklarken, π0, büyük bir VLM ve özel bir üretken başlık kullanarak bu eşlemenin bir uygulamasını sunmaktadır. Temeller için “Taklit Öğrenme ve Ters Takviyeli Öğrenme” bölümüne bakınız.

8. Zorlandığı noktalar / zorlu ortamlar

Makalede bildirilen değerlendirmeler, evrensel bir garanti yerine genel eğilimleri göstermektedir. Birkaç gerçek görevde (gömlek katlama, masa temizleme, market poşetleme ve tost makinesinden ekmek alma), ince ayar yapılmamış önceden eğitilmiş temel model, OpenVLA ve Octo gibi mevcut temel modellere göre önemli ölçüde daha yüksek başarı oranları göstermektedir. π0, özellikle OpenVLA ve Octo'nun çok daha geride kaldığı gömlek katlama gibi görevlerde güvenilirliğe çok yakındır. Ancak, bu fark aynı zamanda ön eğitim verilerinin ölçeğini ve çeşitliliğini de yansıtmaktadır; bu nedenle, yalnızca akış eşleştirmeye ait bir avantajı izole etmek zordur.

Makale ayrıca doğrudan bir sınırlamayı da ortaya koymaktadır: Bir görev, ön eğitimde temsil edilenlere ne kadar yakınsa, fayda o kadar büyük olur; bu dağılımın çok dışında kalan görevler, eğitim sonrası verilerin kalitesine ve miktarına daha fazla bağlıdır. Bir kutuyu monte etmek veya yumurta paketlemek gibi uzun, çok aşamalı görevler için bildirilen başarı nispeten yüksek olabilir, ancak bazı alanlar yine de daha basit tek eylemli görevlerde görülen neredeyse mükemmel oranların gerisinde kalmaktadır.

Daha genel olarak, çapraz vücutlama öğrenimi için sıfır dolgu, eğitimde bulunmayan tamamen yeni bir serbestlik derecesi konfigürasyonuna sahip bir robota otomatik olarak genişletilemez. Ek olarak, akış eşleştirme entegrasyon adımlarının sayısı (10) sabittir, bu da çıkarım zamanı kullanıcılarının hız-doğruluk dengesini ne kadar ince ayarlayabileceklerini sınırlandırmaktadır.

9. Pratikte Nasıl Seçilir

Tek bir modelle birçok görevi yerine getirmesi gereken genel amaçlı bir manipülasyon robotu için π0 güçlü bir başlangıç noktasıdır: tasarımı, sıfır atış davranışını ve nispeten az miktarda veriyle ince ayarı destekler. Physical Intelligence, ağırlıkları ve kodu openpi deposu aracılığıyla açık kaynaklı hale getirerek, özel bir robotla deneme yapmanın önündeki engeli düşürmüştür.

Kumaş katlama veya sıvı dökme gibi, temasın ve düzgün yörüngelerin önemli olduğu görevler için, ayrık eylem belirteçlerine dayanan otoregresif bir VLA'dan ziyade akış eşleştirme modeli (veya Octo gibi bir difüzyon-başlık modeli) daha uygun olabilir.

Amaç yalnızca düşük gecikmeyle basit alma ve yerleştirme görevlerini çalıştırmaksa, π0'ın 3,3 milyar parametresi aşırı olabilir. Küçük bir BC tabanlı ağ gibi hafif, göreve özgü bir taklit modeli, uygulama ve işletme maliyeti arasında daha iyi bir denge sunabilir.

Eğer belirli bir robot sabit bir görev kümesini yerine getirecekse, göreve özgü veriler üzerinde daha dar bir model eğitmek, π0 gibi büyük bir önceden eğitilmiş model kullanmaktan daha verimli olabilir. Genel bir model ile özel bir model arasındaki seçim, hedef görevlerin çeşitliliğine ve toplanabilecek veri miktarına bağlıdır.

π0.5, π0.6 ve π0.7 gibi daha yeni sürümler, daha geniş VLA ortamı ve LIBERO kıyaslama testindeki rekabet için “VLA Teknoloji Trendleri” bölümüne bakın. Taklit öğrenme, ters pekiştirme öğrenmesi ve BC/DAgger'daki kovaryat kaydırma probleminin temelleri için “Taklit Öğrenme ve Ters Pekiştirme Öğrenmesi” bölümüne bakın.

10. Üç satırda özet

  • π0, aynı Transformer katmanlarında bir PaliGemma VLM (3B) ve özel bir Eylem Uzmanı (300M) çalıştırarak, koşullu akış eşleştirmesiyle sürekli eylem parçaları üretir.

  • Hedef vektör alanı u = \epsilon - A_t'i A_t^\tau = \tau A_t + (1-\tau)\epsilon'den tahmin eder, ardından çıkarım zamanında 50 adımlık bir eylem parçası oluşturmak için 10 Euler entegrasyon adımı kullanır. Bu, parça büyüdükçe kod çözme hızı yavaşlayan otoregresif tokenizasyondan temel farktır.

  • Sıfır dolgu ve ağırlıklı örnekleme ile yedi robot türü üzerinde eğitim yapar, ardından genellik ve göreve özgü performansı dengelemek için çeşitli ön eğitim verilerini yüksek kaliteli son eğitim verilerinden ayırır.

Referanslar

Anlayışınızı kontrol edin
Özet>Eylemler üreten bir model, uyarlama gerektirmeden bilinmeyen bir robotu çalıştırabilir mi?

Eklem konfigürasyonu, eylem temsili, gözlemler ve eğitim verisi arayüzü eşleşmelidir. Temel model olmak, ayarlama gerektirmeden uyumluluk anlamına gelmez.

What to read next

Review the backgroundPekiştirmeli Öğrenmeye Giriş: Taklit Öğrenme ve Ters Pekiştirmeli ÖğrenmeContinue the seriesÇoklu Ajanlı Takviyeli Öğrenmeye Giriş — Karşı Tarafın da Öğrendiği Bir Dünyada OptimizasyonExplore another aspect of this fieldÖdül Tasarımına Giriş — RL'de "Neyi En Üst Düzeye Çıkarmalı" Sorusu Neden En Zor Kısım?