Contents — find the section you need
Özet
Model tabanlı takviyeli öğrenme (MBRL), durum ve eylemi tahmin edilen bir sonraki duruma eşleyen bir dünya modeli \hat f öğrenir, eylem dizilerini bunun içinde test eder ve donanıma yalnızca denetimli bir eylem uygular. Modelden bağımsız yöntemler, politikayı doğrudan ödülden öğrenir; MBRL daha veri verimli olabilir ve kısıtlamaları ifade edebilir, ancak model hatası yalnızca simülatörde başarı yaratabilir. RL temelleri, Q-öğrenme, PPO/SAC ve MPC konularına bakın.
Dünya Modelleri ve Planlama
Şekil 1 — Duskcoil tarafından oluşturulan kavramsal SVG, ölçülen sistem verileri değil.
\hat s_{t+1}=\hat f_\theta(s_t,a_t)'yi öğrenin ve geri çekilen ufuklu bir hedefi optimize edin:
Simülasyondan Gerçeğe, tanımlama ve güvenlik
Tek adımlı hatalar uzun süreli denemelerde birikerek artar. Topluluklar belirsizliği tahmin edebilir; planlamacılar yüksek varyanslı bölgelerden kaçınabilir ve kısa ufuklar kullanabilir. Alan rastgeleleştirmesi kütleyi, sürtünmeyi, gecikmeyi, sensör gürültüsünü, aydınlatmayı ve kamera pozisyonunu değiştirir. Sistem tanımlaması, atalet, sürtünme, motor sabitleri ve gecikmeyi ölçer, böylece bu aralıklar keyfi olmaktan ziyade savunulabilir olur.
Kayıttan, düşük hızlı gölge kontrolüne, sınırlı denetimli denemelere geçin. Acil durdurma, bağımsız hız/kuvvet/sıcaklık monitörleri, iletişim kaybı durdurma ve insan ayrımını öğrenilen politikanın dışında tutun. Yaygın hatalar arasında tekerlek kaymasına neden olan sabit sürtünme simülasyonları, aydınlatma aşırı uyumu, ödül hileleri yer alır. Titreşime ve modellenmemiş gecikmeye neden olarak istikrarsızlığa yol açar. Rapor ihlali sayısı, durma mesafesi, belirsizlik kaynaklı kaçınma ve en kötü durum davranışı – sadece ortalama ödül değil.
Modelden bağımsız ve model tabanlı roller
Modelden bağımsız RL, bir politikayı veya değeri doğrudan deneyimden günceller. Temas dinamiklerinin modellenmesi zor olduğunda ifade gücü yüksektir, ancak her iyileştirme gerçek denemeleri tüketebilir. MBRL, bir tahminleyiciyi eğitmek için her geçişi yeniden kullanır ve bu tahminleyicide birçok aday dizisini değerlendirir. Tahminleyicinin sistematik bir önyargısı varsa, planlayıcı yalnızca simülatörde çalışan bir kısayolu optimize eder.
| Yön | Modelden bağımsız | Model tabanlı |
|---|---|---|
| Donanım verileri | düşük ila orta verimlilik | modelin aralığı içinde orta ila yüksek |
| Çalışma süresi | genellikle hafif politika çıkarımı | her döngüde uygulama ve optimizasyon |
| Kısıtlamalar | genellikle dolaylı bir ödül/güvenlik katmanı | planlama problemine koymak doğal |
| Ana başarısızlık | seyrek verilerden zayıf ekstrapolasyon | Uzun Vadeli Model Hatası |
| Tipik Uyum | Karmaşık Temas ve Görsel Politikalar | Kısa Vadeli Hareket, Enerji ve Termal Planlama |
Hibrit yığınlar yaygındır: Öğrenilmiş bir politika adaylar önerir, öğrenilmiş bir model kısa bir ufuk öngörür ve MPC hız, kuvvet ve akım kısıtlamalarını uygular. Algoritmaları yedek olarak ele almak yerine, zamanlama ve güvenlik sorumluluklarını atamak için PPO/SAC makalesini ve MPC makalesini kullanın.
Belirsizliği Tek Bir Sayıya İndirgemeyin
Epistemik belirsizlik eksik eğitim verilerinden kaynaklanır; aleatorik belirsizlik ise indirgenemez sensör ve çevre varyasyonundan kaynaklanır. Bir topluluk varyansı ilki için yararlı bir sinyaldir, ancak bir topluluk yine de aynı önyargıyı paylaşabilir. Tahmin varyansı bir eşiği aştığında, ufku kısaltın, hızı azaltın, klasik bir kontrol cihazına geçin veya verileri toplayın. Planlamadan önce bir başka gözlem. Bu çekimserlik politikası, devreye alınmadan önce belirtilmelidir.
Tek adımlı artık e_t=s_{t+1}-\hat s_{t+1} için, ortalama kare hatasına ek olarak log kantilleri ve en kötü durumlar dikkate alınmalıdır. Düşük bir ortalama hata, temastan hemen önce büyük bir hatayı gizleyebilir. Olasılıksal bir tahmin aralığını asla bir güvenlik sertifikası olarak yorumlamayın; bağımsız çarpışma, kuvvet, sıcaklık ve akım monitörleri tutun.
Tasarım tanımlama deneyleri
Sistem tanımlama, tek bir kalibrasyon değil, bir deney tasarım problemidir. Bir motor için, statik sürtünmeyi, çeşitli hızlardaki ataleti, yüke bağlı torku ve iletişim gidiş-dönüş gecikmesini ayrı ayrı ölçün. Bir hidrolik aktüatör için, basıncı, akışı, silindir hızını, yağ sıcaklığını ve valf komutunu tek bir saatte zaman damgalayın. Verileri gün, kat, yük, aydınlatma ve sıcaklığa göre ayırın—rastgele komşu çerçevelere değil—böylece nihai set gerçekten görünmez olur.
Küçük bir sayısal sezgi
Hızı her T_s=0.1\,\mathrm{s}'te 0.1u kadar değişen 1 kg'lık bir arabayı düşünün. Sürtünmesiz model, beş adımda u=1 için 0.5\,\mathrm{m/s} hız artışı öngörüyor. Gerçek araba sürtünme nedeniyle her adımda 0.02\,\mathrm{m/s} kaybederse, beş adımlık hata 0.1\,\mathrm{m/s}'a ulaşır. Daha kısa bir ufuk, çevrimiçi tanımlama, hız kısıtlamasında marj ve ölçümden yeniden planlama, bu basit modeli kullanışlı kılıyor.
Yayınlanacak Kanıtlar
Denklemlerin yanı sıra, eğitim süresini, sensör oranını, gecikmeyi, rastgele tohumu, ortam parametrelerini, çözücü son tarihini ve geri dönüş politikasını saklayın. Tahmin artıklarını, kısıtlama ihlallerini, durma mesafesini ve belirsizlik kaynaklı çekimserliği, ödül ile aynı deney kimliğiyle çizin. Ham kayıtlar paylaşılamıyorsa, iddianın kapsamının kontrol edilebilir kalması için anonimleştirilmiş istatistikleri, simülasyon ayarlarını, birimleri ve bir referans tarihini yayınlayın.
Öğrenilmiş bir model güvenilir uzun süreli dağıtımları garanti ediyor mu?
Küçük model hataları tahminler boyunca birikir. Dağıtım uzunluğunu, alışılmadık durumları ve gerçek ortamdaki doğrulamayı kontrol edin.
Referanslar
Dünya modeli türleri ve planlayıcılar
Fiziksel modeller yorumlanabilir ancak temasla ilgili sorunlar yaşayabilir; latent ve topluluk modelleri verimli olabilir ancak gerçek alan güvenliğine karşı doğrulama gerektirir. Aday eylemler, bir son tarih yedeklemesiyle atış, CEM veya türevlenebilir MPC kullanabilir.
Veri kümesi hijyeni
Doymuş sensörleri, zaman hatalarını, sınırlayıcı müdahalelerini, enterpolasyonlu değerleri ve terminali işaretleyin. Nedenleri. Değerlendirme kümesini değiştirilemez tutun, böylece model güncellemesi bir gerilemeyi gizleyemez.
Kanıt sınırları
Tahmin doğruluğu, ödül ve güvenli donanım davranışı ayrı iddialardır. Her biri için ölçütü, test koşulunu ve sorumlu güvenlik katmanını yayınlayın.
Yorumlar
Lütfen önce giriş yapın.
Henüz veri yok.