Contents — find the section you need
Bir robota bir bardağı güvenli bir şekilde yerleştirmeyi, dar bir koridorda bir kişiden kaçınmayı veya karmaşık bir aleti kullanmayı öğretmek, ödülün belirlenmesi zor olduğu için genellikle göründüğünden daha zordur. Hedefe olan mesafeyi ödüllendirmek, nesneleri kenara itmeyi teşvik edebilir; yalnızca nihai başarıyı ödüllendirmek ise keşfe hiçbir yararlı sinyal vermeyebilir. Taklit öğrenme, gözlemlerden eylemleri öğrenmek için insanlardan, teleoperatörlerden veya mevcut bir politikadan gelen gösterileri kullanır. Ters pekiştirme öğrenmesi (IRL) ise bunun yerine, gösterilen davranışı mantıklı kılan amacı—veya ödülü—çıkarım yapmaya çalışır ve ardından bu amaç için bir politika türetir.
Her iki yöntem de yalnızca insan verilerini kullandığı için güvenli hale gelmez. Merkezi sorular, bir politikanın gösterilerin olmadığı durumlarda ne yaptığı, etiketlerin nasıl zamanlandığı ve atfedildiği, başarısızlıkların nasıl toplandığı ve fiziksel bir eylemi bağımsız olarak neyin sınırladığıdır. Bu makale, Davranış Klonlama (BC), kovaryat kayması, DAgger, IRL, Görsel-Dil-Eylem modelleri, değerlendirme, güvenlik ve veri kaynağı arasında bağlantı kurmaktadır. İlgili kavramlar için Takviyeli Öğrenme Temelleri, PPO ve SAC ve VLA Temelleri bölümlerine bakınız.
Pratik Sonuç
-
BC, gösterilen durum s'dan uzman eylemi a'e kadar denetimli öğrenmedir. Başlaması hızlıdır, ancak küçük bir erken hata, politikayı hiç görmediği bir durum dağılımına taşıyabilir.
-
DAgger, mevcut politikayı kontrollü bir ortamda çalıştırır, politikanın gerçekten ziyaret ettiği durumlarda uzmandan eylem ister, bu etiketleri toplar ve yeniden eğitir. Başarısızlık modlarını veriye dönüştürür, ancak güvenli yürütme ve güvenilir uzman müdahalesi gerektirir.
-
IRL, gösterimlerden r_\theta(s,a) ödülünü tahmin eder ve ardından bunun için bir politika optimize eder. Ödül benzersiz bir şekilde tanımlanmamıştır; onu makul görünen bir ısı haritasına göre değil, tutulan koşullardaki davranışa ve açık güvenlik kısıtlamalarına göre değerlendirin.
-
Bir VLA, büyük bir koşullu taklit politikası olabilir, ancak dil ve görüntü ölçeği fiziksel sınırları, zamanlamayı, temas güvenliğini veya güvenli bir durma yolunu ortadan kaldırmaz.
Gösterimler sadece videolar değil, operasyonel kayıtlardır
Kullanılabilir bir gösterim, gözlemleri (görüntüler, derinlik, kuvvet, eklem durumu), eylemleri (eklem komutu, hız, tutucu, durdurma), zaman damgalarını, kareleri, görev talimatını, başarı/başarısızlığı, operatörü, çevre koşullarını ve müdahale olaylarını bir araya getirir. Kaydedilen komut, operatörün amaçladığı şey yerine taşıma gecikmesinden sonra robota ulaşan şey ise, gecikme veri kümesine aittir. 100 ms'lik görüntü-kol ofseti, doğru davranışı tutarsız eğitim çiftlerine dönüştürür.
Veri kaynağı, toplayıcının onayı, kayıt ortamı için izin, gizlilik, üçüncü taraf çalışmaları, robot güvenliği sorumluluğu ve bir örneğin kaynağına kadar izlenebilme yeteneğini içerir. Kamuya açık bir veri kümesinin karıştırılması, lisans, ticari kullanım koşulları, yeniden dağıtım, kişiler ve ses ve amaçlanan kullanım için kalibrasyonun kontrol edilmesini gerektirir. "İnternette bulundu" veri kaynağı anlamına gelmez; izlenebilir onay ve koşulların yokluğudur.
Diyagram: Duskcoil, kavramsal. Bir uygulama gerçek veri toplama işlemidir; diyagram, güvenlik izleme, durdurma mantığı veya operatör müdahalesinin atlanabileceği anlamına gelmez.
Davranış Klonlama ve Kovaryat Kayması
Uzman çiftleri D=\{(s_i,a_i^*)\}_{i=1}^N verildiğinde, sürekli eylem BC en aza indirebilir
Ayrık eylemler çapraz entropi kullanır. Birden fazla eylem geçerliyse, tek bir karesel hata tahmini "sola geç" ve "sağa geç"i güvensiz bir orta eyleme ortalayabilir; koşullu dağılımlar, karışım modelleri veya difüzyon tarzı politikalar birden fazla modu temsil edebilir. Bağlam, operatör stili ve görev talimatı önemlidir.
BC, ödül tasarımı veya keşiften önce çevrimdışı olarak eğitilebildiği için çekicidir. Temel zayıflığı, gösterimlerin uzman durum dağılımından d_{\pi^*}(s) gelmesi, dağıtımın ise üretmesidir. d_{\pi_\theta}(s). Küçük hatalar bir sonraki gözlemi değiştirir ve birikerek büyüyebilir. Basitleştirilmiş analizlerde, tek adımlı hata \epsilon, ardışık bir ufukta T boyunca O(T^2\epsilon) mertebesine kadar büyüyebilir; kesin sınır varsayımlara bağlıdır, ancak nedensel nokta kalıcıdır: bir politika kendi gelecekteki girdilerini yaratır.
DAgger: Öğrenicinin gittiği yerde etiketleri birleştirir
Veri Kümesi Birleştirme, öğrenilen politikayı kontrollü koşullar altında çalıştırır, gerçekten ziyaret edilen s durumunda istenen uzman eylemini a^* talep eder, çifti D'e ekler ve yeniden eğitir. Yinelemeler sırasında politika karışımları kullanılabilir. Bu yöntem, eğitim dağılımını dağıtım dağılımına yaklaştırır.
DAgger, bir robotun halka açık alanda başarısız olmasına izin veren genel bir izin değildir. Simülasyon, düşük hız, fiziksel korumalar, uzaktan acil durdurma, anında uzman devralma ve bir eylem güvenlik filtresi ile başlayın. Etiketler eylemler olabilir. Uzman, "Burada ne olması gerekirdi?" sorusuna fiziksel olarak gerçekleştirilmiş veya varsayımsal yanıtlar verdi. İkincisi değerli olabilir ancak uzman iş yükünü, gecikmeyi ve öznel varyasyonu artırır. Toplamayı yalnızca satır sayısına değil, ortaya çıkarılmamış hata modlarına göre planlayın.
IRL: Eylemi kopyalamak yerine hedefi çıkarın
IRL, uzman politikası \pi_E'dan r_\theta(s,a) veya r_\theta(s,a,s') ödülünü tahmin eder. Maksimum entropi sezgisi, uzman yörüngelerinin benzer derecede iyi yörüngeler arasında gereksiz yere deterministik olmadan yüksek ödülü tercih etmesidir. Kavramsal olarak, \tau yörüngesinin olasılığı şöyledir:
Uzman yörünge olasılığını artırmak için \theta'u güncellemek, RL veya optimal kontrol ile eşleştirilebilen bir ödül sağlar. Bu, hedef yeniden optimize edilebildiği için, yeni başlangıç durumlarına veya kısıtlamalara doğrudan BC'den daha iyi uyum sağlayabilir.
Ancak birçok ödül aynı gösterimleri açıklayabilir; gözlemlenmeyen kısıtlamalar ve operatör alışkanlıkları Öğrenilen bir ödüle dahil edilebilir. Eğitim yörüngelerini açıklayan bir ödül tehlikeli bir şekilde genelleştirilebilir. GAIL tarzı yöntemler bunun yerine uzman ve öğrenci doluluk dağılımlarını bir ayırıcı aracılığıyla eşleştirir. Her iki formülasyon da bir yasağı (çarpışma, sıkıştırma kuvveti, insan dışlama bölgesi) yalnızca çıkarım yoluyla öğrenmeyi haklı çıkarmaz. Açık güvenlik kuralları açık kalır.
VLA ile Bağlantı
Bir Görsel-Dil-Eylem modeli, bir sonraki eylemi veya bir eylem parçasını görüntülere, dile ve robot durumuna göre koşullandırır. Geniş anlamda bu, büyük ölçekli koşullu taklittir. Nesne ve dil aralığı, yeni aydınlatma, sürtünme, kamera yerleşimi, belirsiz talimatlar veya temas kuvveti sınırlarına ekstrapolasyonu garanti etmez. "Bardağı rafa koy"u yorumlayan bir VLA, kendi başına kuvveti, çarpışma mesafesini, eklem aralığını veya durma mesafesini onaylamaz; bkz. VLA Temel Bilgileri.
Bir eylem bir aktüatöre ulaşmadan önce koordinat çerçevesini, birimleri, hızı, ivmeyi ve tazeliği doğrulayın. Bunu şu şekilde yönlendirin: Kinematik, çarpışma kontrolü ve empedans veya konum/hız kontrolcüsü. Belirsiz dil, açıklama, reddetme veya düşük hız modunu tetiklemelidir; bozulmuş algılama, yürütmeyi durdurmalıdır. Veri ölçeği, fiziksel güvenlik sınırının yerini tutmaz.
Değerlendirme, güvenlik ve kaynak
Yalnızca çevrimdışı işlem hatasına dayanarak bir politikayı onaylamayın. Başlangıç pozisyonu, nesneler, aydınlatma, arka planlar, sürtünme, gecikme, talimat metni ve bozulma üzerinde ayrı değerlendirmeler oluşturun. Başarı, çarpışma, durdurma, müdahale sayısı, tepe kuvveti, tamamlama süresi ve gözlemlenen en kötü durumları raporlayın. Yüksek ortalama başarı, nadir insan veya ekipman riskini absorbe etmez. Her DAgger yinelemesini, kaynak gösterimini, etiketleyiciyi, bölmeyi, modeli, eşikleri, hataları ve geri alma yolunu izleyin.
| Katman | Doğrula | Başarısızlığa yanıt |
|---|---|---|
| Veri | onay, lisans, zaman, çerçeve, başarı/başarısızlık kaynağı | karantina, yeniden etiketleme, kullanımı durdurma |
| Politika | ayrı durumlar, kaydırma, işlem belirsizliği | yavaş, uzman sorgusu, hatırlamak |
| Çalıştırma | limitler, oran, çarpışma, kuvvet, iletişim | güvenlik filtresi, durdurma, acil durdurma |
| Operasyonlar | denetleyici, kurtarma, kayıtlar, değişiklik kontrolü | geri alma ve kök neden incelemesi |
Taklit, göstericinin nedenlerini geri getiriyor mu?
Davranışı yeniden üretmek ve ödülü çıkarımlamak farklı görevlerdir. Birden fazla ödül aynı davranışı açıklayabilir, bu nedenle gerçek hayattaki varsayımları inceleyin.
Referanslar
- Pomerleau, 1989: ALVINN
- Ross vd., 2011: DAgger
- [Ziebart vd., 2008: Maximum Entropy IRL
- Takviyeli Öğrenmenin Temelleri, PPO ve SAC, VLA Temel Bilgileri
Yorumlar
Lütfen önce giriş yapın.
Henüz veri yok.