Contents — find the section you need

Bir robota bir bardağı güvenli bir şekilde yerleştirmeyi, dar bir koridorda bir kişiden kaçınmayı veya karmaşık bir aleti kullanmayı öğretmek, ödülün belirlenmesi zor olduğu için genellikle göründüğünden daha zordur. Hedefe olan mesafeyi ödüllendirmek, nesneleri kenara itmeyi teşvik edebilir; yalnızca nihai başarıyı ödüllendirmek ise keşfe hiçbir yararlı sinyal vermeyebilir. Taklit öğrenme, gözlemlerden eylemleri öğrenmek için insanlardan, teleoperatörlerden veya mevcut bir politikadan gelen gösterileri kullanır. Ters pekiştirme öğrenmesi (IRL) ise bunun yerine, gösterilen davranışı mantıklı kılan amacı—veya ödülü—çıkarım yapmaya çalışır ve ardından bu amaç için bir politika türetir.

Her iki yöntem de yalnızca insan verilerini kullandığı için güvenli hale gelmez. Merkezi sorular, bir politikanın gösterilerin olmadığı durumlarda ne yaptığı, etiketlerin nasıl zamanlandığı ve atfedildiği, başarısızlıkların nasıl toplandığı ve fiziksel bir eylemi bağımsız olarak neyin sınırladığıdır. Bu makale, Davranış Klonlama (BC), kovaryat kayması, DAgger, IRL, Görsel-Dil-Eylem modelleri, değerlendirme, güvenlik ve veri kaynağı arasında bağlantı kurmaktadır. İlgili kavramlar için Takviyeli Öğrenme Temelleri, PPO ve SAC ve VLA Temelleri bölümlerine bakınız.

Pratik Sonuç

  • BC, gösterilen durum s'dan uzman eylemi a'e kadar denetimli öğrenmedir. Başlaması hızlıdır, ancak küçük bir erken hata, politikayı hiç görmediği bir durum dağılımına taşıyabilir.

  • DAgger, mevcut politikayı kontrollü bir ortamda çalıştırır, politikanın gerçekten ziyaret ettiği durumlarda uzmandan eylem ister, bu etiketleri toplar ve yeniden eğitir. Başarısızlık modlarını veriye dönüştürür, ancak güvenli yürütme ve güvenilir uzman müdahalesi gerektirir.

  • IRL, gösterimlerden r_\theta(s,a) ödülünü tahmin eder ve ardından bunun için bir politika optimize eder. Ödül benzersiz bir şekilde tanımlanmamıştır; onu makul görünen bir ısı haritasına göre değil, tutulan koşullardaki davranışa ve açık güvenlik kısıtlamalarına göre değerlendirin.

  • Bir VLA, büyük bir koşullu taklit politikası olabilir, ancak dil ve görüntü ölçeği fiziksel sınırları, zamanlamayı, temas güvenliğini veya güvenli bir durma yolunu ortadan kaldırmaz.

Gösterimler sadece videolar değil, operasyonel kayıtlardır

Kullanılabilir bir gösterim, gözlemleri (görüntüler, derinlik, kuvvet, eklem durumu), eylemleri (eklem komutu, hız, tutucu, durdurma), zaman damgalarını, kareleri, görev talimatını, başarı/başarısızlığı, operatörü, çevre koşullarını ve müdahale olaylarını bir araya getirir. Kaydedilen komut, operatörün amaçladığı şey yerine taşıma gecikmesinden sonra robota ulaşan şey ise, gecikme veri kümesine aittir. 100 ms'lik görüntü-kol ofseti, doğru davranışı tutarsız eğitim çiftlerine dönüştürür.

Veri kaynağı, toplayıcının onayı, kayıt ortamı için izin, gizlilik, üçüncü taraf çalışmaları, robot güvenliği sorumluluğu ve bir örneğin kaynağına kadar izlenebilme yeteneğini içerir. Kamuya açık bir veri kümesinin karıştırılması, lisans, ticari kullanım koşulları, yeniden dağıtım, kişiler ve ses ve amaçlanan kullanım için kalibrasyonun kontrol edilmesini gerektirir. "İnternette bulundu" veri kaynağı anlamına gelmez; izlenebilir onay ve koşulların yokluğudur.

Diagram 1 · Use the button to switch views
Gösterilerden öğrenin

Diyagram: Duskcoil, kavramsal. Bir uygulama gerçek veri toplama işlemidir; diyagram, güvenlik izleme, durdurma mantığı veya operatör müdahalesinin atlanabileceği anlamına gelmez.

Davranış Klonlama ve Kovaryat Kayması

Uzman çiftleri D=\{(s_i,a_i^*)\}_{i=1}^N verildiğinde, sürekli eylem BC en aza indirebilir

\min_\theta\;\mathcal L_{BC}(\theta)=\frac1N\sum_{i=1}^N\lVert\pi_\theta(s_i)-a_i^*\rVert_2^2

Ayrık eylemler çapraz entropi kullanır. Birden fazla eylem geçerliyse, tek bir karesel hata tahmini "sola geç" ve "sağa geç"i güvensiz bir orta eyleme ortalayabilir; koşullu dağılımlar, karışım modelleri veya difüzyon tarzı politikalar birden fazla modu temsil edebilir. Bağlam, operatör stili ve görev talimatı önemlidir.

BC, ödül tasarımı veya keşiften önce çevrimdışı olarak eğitilebildiği için çekicidir. Temel zayıflığı, gösterimlerin uzman durum dağılımından d_{\pi^*}(s) gelmesi, dağıtımın ise üretmesidir. d_{\pi_\theta}(s). Küçük hatalar bir sonraki gözlemi değiştirir ve birikerek büyüyebilir. Basitleştirilmiş analizlerde, tek adımlı hata \epsilon, ardışık bir ufukta T boyunca O(T^2\epsilon) mertebesine kadar büyüyebilir; kesin sınır varsayımlara bağlıdır, ancak nedensel nokta kalıcıdır: bir politika kendi gelecekteki girdilerini yaratır.

DAgger: Öğrenicinin gittiği yerde etiketleri birleştirir

Veri Kümesi Birleştirme, öğrenilen politikayı kontrollü koşullar altında çalıştırır, gerçekten ziyaret edilen s durumunda istenen uzman eylemini a^* talep eder, çifti D'e ekler ve yeniden eğitir. Yinelemeler sırasında politika karışımları kullanılabilir. Bu yöntem, eğitim dağılımını dağıtım dağılımına yaklaştırır.

DAgger, bir robotun halka açık alanda başarısız olmasına izin veren genel bir izin değildir. Simülasyon, düşük hız, fiziksel korumalar, uzaktan acil durdurma, anında uzman devralma ve bir eylem güvenlik filtresi ile başlayın. Etiketler eylemler olabilir. Uzman, "Burada ne olması gerekirdi?" sorusuna fiziksel olarak gerçekleştirilmiş veya varsayımsal yanıtlar verdi. İkincisi değerli olabilir ancak uzman iş yükünü, gecikmeyi ve öznel varyasyonu artırır. Toplamayı yalnızca satır sayısına değil, ortaya çıkarılmamış hata modlarına göre planlayın.

IRL: Eylemi kopyalamak yerine hedefi çıkarın

IRL, uzman politikası \pi_E'dan r_\theta(s,a) veya r_\theta(s,a,s') ödülünü tahmin eder. Maksimum entropi sezgisi, uzman yörüngelerinin benzer derecede iyi yörüngeler arasında gereksiz yere deterministik olmadan yüksek ödülü tercih etmesidir. Kavramsal olarak, \tau yörüngesinin olasılığı şöyledir:

p_\theta(\tau)\propto\exp\left(\sum_t r_\theta(s_t,a_t)\right)

Uzman yörünge olasılığını artırmak için \theta'u güncellemek, RL veya optimal kontrol ile eşleştirilebilen bir ödül sağlar. Bu, hedef yeniden optimize edilebildiği için, yeni başlangıç durumlarına veya kısıtlamalara doğrudan BC'den daha iyi uyum sağlayabilir.

Ancak birçok ödül aynı gösterimleri açıklayabilir; gözlemlenmeyen kısıtlamalar ve operatör alışkanlıkları Öğrenilen bir ödüle dahil edilebilir. Eğitim yörüngelerini açıklayan bir ödül tehlikeli bir şekilde genelleştirilebilir. GAIL tarzı yöntemler bunun yerine uzman ve öğrenci doluluk dağılımlarını bir ayırıcı aracılığıyla eşleştirir. Her iki formülasyon da bir yasağı (çarpışma, sıkıştırma kuvveti, insan dışlama bölgesi) yalnızca çıkarım yoluyla öğrenmeyi haklı çıkarmaz. Açık güvenlik kuralları açık kalır.

VLA ile Bağlantı

Bir Görsel-Dil-Eylem modeli, bir sonraki eylemi veya bir eylem parçasını görüntülere, dile ve robot durumuna göre koşullandırır. Geniş anlamda bu, büyük ölçekli koşullu taklittir. Nesne ve dil aralığı, yeni aydınlatma, sürtünme, kamera yerleşimi, belirsiz talimatlar veya temas kuvveti sınırlarına ekstrapolasyonu garanti etmez. "Bardağı rafa koy"u yorumlayan bir VLA, kendi başına kuvveti, çarpışma mesafesini, eklem aralığını veya durma mesafesini onaylamaz; bkz. VLA Temel Bilgileri.

Bir eylem bir aktüatöre ulaşmadan önce koordinat çerçevesini, birimleri, hızı, ivmeyi ve tazeliği doğrulayın. Bunu şu şekilde yönlendirin: Kinematik, çarpışma kontrolü ve empedans veya konum/hız kontrolcüsü. Belirsiz dil, açıklama, reddetme veya düşük hız modunu tetiklemelidir; bozulmuş algılama, yürütmeyi durdurmalıdır. Veri ölçeği, fiziksel güvenlik sınırının yerini tutmaz.

Değerlendirme, güvenlik ve kaynak

Yalnızca çevrimdışı işlem hatasına dayanarak bir politikayı onaylamayın. Başlangıç pozisyonu, nesneler, aydınlatma, arka planlar, sürtünme, gecikme, talimat metni ve bozulma üzerinde ayrı değerlendirmeler oluşturun. Başarı, çarpışma, durdurma, müdahale sayısı, tepe kuvveti, tamamlama süresi ve gözlemlenen en kötü durumları raporlayın. Yüksek ortalama başarı, nadir insan veya ekipman riskini absorbe etmez. Her DAgger yinelemesini, kaynak gösterimini, etiketleyiciyi, bölmeyi, modeli, eşikleri, hataları ve geri alma yolunu izleyin.

Katman Doğrula Başarısızlığa yanıt
Veri onay, lisans, zaman, çerçeve, başarı/başarısızlık kaynağı karantina, yeniden etiketleme, kullanımı durdurma
Politika ayrı durumlar, kaydırma, işlem belirsizliği yavaş, uzman sorgusu, hatırlamak
Çalıştırma limitler, oran, çarpışma, kuvvet, iletişim güvenlik filtresi, durdurma, acil durdurma
Operasyonlar denetleyici, kurtarma, kayıtlar, değişiklik kontrolü geri alma ve kök neden incelemesi
Anlayışınızı kontrol edin
Taklit, göstericinin nedenlerini geri getiriyor mu?

Davranışı yeniden üretmek ve ödülü çıkarımlamak farklı görevlerdir. Birden fazla ödül aynı davranışı açıklayabilir, bu nedenle gerçek hayattaki varsayımları inceleyin.

Referanslar

What to read next

Review the backgroundModel Tabanlı Takviyeli Öğrenme ve Simülasyondan GerçeğeContinue the seriesπ0 Açıklaması — Akış Eşleştirme, VLA Eylem Üretimini Nasıl Değiştirdi?Explore another aspect of this fieldÇoklu Ajanlı Takviyeli Öğrenmeye Giriş — Karşı Tarafın da Öğrendiği Bir Dünyada Optimizasyon