Contents — find the section you need
Takviyeli öğrenme (RL), bir robotun çevresiyle etkileşim kurarak uzun vadede hangi eylemin daha verimli olduğunu öğrenmesinin bir yoludur. Giriş ve etiketin birlikte geldiği görüntü sınıflandırmasının aksine, robot dünyayı gözlemler, bir motoru hareket ettirir ve genellikle birkaç saniye sonra bir ödül alır. Temel döngü dene, sonucu gözlemle ve politikayı güncelle şeklindedir.
30 Saniyelik Özet
-
En küçük RL geçişi, t anında, durum (veya gözlem) s_t, eylem a_t, ödül r_{t+1} ve sonraki durum s_{t+1}'tür.
-
Bir Markov karar süreci (MDP), mevcut durum ve eylemin bir sonraki durumu ve ödülü nasıl ürettiğini modeller. Durum, tahmin için geçmişi yeterince iyi özetlemelidir.
-
Bir politika \pi(a\mid s) eylemleri seçer; V^\pi(s) değer fonksiyonu, bu politika izlendiğinde beklenen gelecekteki getiriyi ifade eder.
-
Getiri, gelecekteki ödülleri \gamma ile iskonto eder. Çok uzun bir ufuk, öğrenmeyi istikrarsızlaştırabilirken, çok kısa bir ufuk ise kısa görüşlü ve güvensiz bir robot üretir.
-
Keşif, belirsiz eylemleri dener; sömürü ise şu anda en iyi olduğuna inanılan eylemi seçer. Donanımda, güvenlik kısıtlamaları her ikisinin de üzerinde yer alır.
1. Robotu bir ajan olarak görün
Şekil 1 — Bir ajan hareket ettikten sonra, ortam değişir ve bir sonraki gözlemi ve ödülü döndürür. Gerçek bir robot bu döngüye iletişim gecikmesi, sensör gürültüsü ve aktüatör doygunluğu ekler.
Diferansiyel tahrikli bir robot için, ajan kamera, LiDAR ve kodlayıcı verilerini durum olarak kullanabilir ve sol ve sağ tekerlek hızlarını eylemler olarak çıktı verebilir. Ortam, araç dinamikleri, zemin sürtünmesi, engeller ve pil durumunu içerir. Bir hedefe doğru hareket etmek pozitif ödül getirebilirken, bir çarpışma veya ani bir direksiyon değişikliği cezalandırılabilir. Tek bir "+1 hedefe ulaştım" sinyali genellikle çok seyrektir; mesafe, hız, durma marjı ve enerji birlikte değerlendirilmelidir.
2. MDP: Problemi Bileşenlere Ayırma
Bir MDP, bir durum uzayı \mathcal{S}, eylem uzayı \mathcal{A}, geçiş olasılığı P(s'\mid s,a), ödül fonksiyonu R(s,a,s') ve iskonto faktörü \gamma ile tanımlanır:
Ajan, s_t durumunda a_t eylemini seçtiğinde, ortam P'ye göre bir sonraki s_{t+1} durumuna geçer ve r_{t+1}=R(s_t,a_t,s_{t+1}) ödülünü döndürür.
“Markov”, mevcut durum bilindiğinde, geçmişin artık geleceği tahmin etmek için gerekli bilgileri eklemediği anlamına gelir. Durumu yalnızca konum içeren bir mobil robot, durmuş bir robotu aynı konumdan kayan bir robottan ayırt edemez. Hız, açısal hız ve sensör güvenini dahil edin veya geçmişi koruyan tekrarlayan bir model kullanın.
Tam durum s_t doğrudan gözlemlenemediğinde, sorun kısmen gözlemlenebilir bir MDP'dir (POMDP). Engellemeler ve eksik LiDAR dönüşleri nedeniyle neredeyse her gerçek robot bir POMDP'dir. Bir durum tahmincisi—bir EKF, faktör grafiği veya öğrenilmiş model—gözlemleri o_t kullanışlı bir iç duruma dönüştürür. Sensör füzyonu makalesi bu sınırı açıklıyor ve ROS 2 Temel Kılavuzu bunu tekrarlanabilir bir yazılım bileşeni haline nasıl getireceğinizi gösteriyor.
3. Değer fonksiyonları ve dönüş
t zamanından itibaren ödüllerin iskonto edilmiş toplamı G_t dönüşüdür:
\pi politikası altında s durumunun değeri şöyledir:
ve durum-eylem değeri ilk eylemi de belirtir:
En büyük Q değerini seçmek değer tabanlı bir tasarımdır. Bir sinirsel politika \pi_\theta(a\mid s)'in parametrelerini \theta doğrudan güncellemek politika tabanlıdır. Sürekli direksiyon açıları ve eklem torkları genellikle politika-gradyan veya Aktör-Kritik yöntemlerini tercih eder, çünkü her olası eylemi listelemek imkansızdır.
4. Bellman denklemi uzun bir ufku tek bir adıma böler
Tüm geleceği bir kerede değerlendirmek yerine, onu anlık ödül artı bir adım sonraki değer olarak ikiye ayırın. Bellman beklenti denklemi şöyledir:
Optimal değer V^*(s), Bellman optimallik denklemine uyar:
Bu nedenle, bir değer hedefi, insan tarafından sağlanan bir etiket yerine diğer tahminlerden oluşturulabilir. Öz referans da bir istikrarsızlık kaynağıdır. Hedef ağlar, deneyim tekrarı ve ödül normalizasyonu, eski tahminleri mevcut güncellemeden ayırır ve zararlı korelasyonları azaltır.
5. Keşif ve sömürüyü dengelemek
Her zaman mevcut en yüksek tahmine sahip eylemi seçmek, ajanı şanslı bir yerel çözüme hapsedebilir. Keşif bilinmeyen eylemleri dener, ancak gerçek bir makinede rastgele hareket bir çarpışmaya neden olabilir. Yaygın seçimler şunlardır:
| Yöntem | Sezgi | Güç | Donanım endişesi |
|---|---|---|---|
| ε-açgözlü | ε olasılığıyla rastgele seçim yap | basit | ani değişiklikler sürekli tork için güvenli değildir |
| Boltzmann/softmax | değere orantılı örnekleme yap | umut vadeden seçenekleri tercih eder | sıcaklık ayarı gerektirir |
| UCB | yüksek belirsizlikle eylemleri dene | açık keşif mantığı | belirsizlik tahminlerine ihtiyaç duyar |
| Gürültülü politika | eylemlere veya ağırlıklara sürekli gürültü ekle | daha yumuşak keşif | yine de doygunluğa ve sınırlara ihtiyaç duyar |
Donanımda, keşfi doğrulanmış bir çalışma zarfıyla sınırlandırın. Hız sınırlarını, eklem yumuşak sınırlarını, kuvvet/akım sınırlarını, bir bekçi köpeğini ve acil durdurmayı öğrenme algoritmasının dışına koyun, böylece her politika çıktısı yakalanabilir. Bir simülatörde rastgeleleştirme faydalıdır; ancak bir makineye rastgele komutlar uygulama izni değildir.
6. Fikri küçük bir ızgara dünyasında kontrol edin
5×5'lik bir ızgara, öğrenme dinamiklerini görünür hale getirir. Bir hücreyi durum, yukarı/aşağı/sol/sağ hareketlerini eylemler, hedef ödülü +1, duvarı -0,1 ve her adımı -0,01 olarak kabul edelim. Q'yu sıfıra başlatın ve zamansal fark güncellemesini tekrarlayın:
Parantez içindeki terim, TD hatasıdır: tahmin ile tek adımlı hedef arasındaki fark. Eğer \alpha çok büyükse, yeni deneyimler baskın gelir; çok küçükse, politika değişen bir ortamı takip edemez. Başarı oranını, ortalama adımları, çarpışma oranını ve ziyaret edilmemiş durumların oranını kaydedin—sadece tek bir ödül eğrisi değil.
7. Ödülü bir şartname gibi yazın
Ödül tasarımı genellikle algoritmik bir ayrıntıdan daha önemlidir. Bir teslimat robotu şunları kullanabilir:
ilerlemeyi, çarpışmaları, girdi enerjisini ve düzgünlüğü birleştirmek için. Bir ağırlığı artırmak w her zaman davranışı iyileştirmez. Çarpışma cezası baskınsa, robot asla hareket etmeme gibi güvenli ancak işe yaramayan bir politikayı öğrenebilir. Her terimi ayrı ayrı kaydedin ve politikanın aslında hangi terimi optimize ettiğini denetleyin.
Ödül hileciliği başka bir başarısızlık modudur: hedef dedektöründeki bir hata, sensör kör noktası veya yalnızca simülatörde kullanılan bir temas kuralı, amaçlanan görevi gerçekleştirmeden yüksek bir puan üretebilir. İnsan tarafından okunabilir hedefler, fizik tabanlı kısıtlamalar ve bağımsız bir değerlendirme ortamı, bu kısayolların tespitini kolaylaştırır.
8. Araştırmanın Ürünle Buluştuğu Yer
Değer yöntemleri veri açısından verimlidir ancak genellikle ayrık durumlar ve eylemler varsayar. Politika gradyanları ve Aktör-Eleştirmen yöntemleri sürekli kontrolü ele alır; SAC bir entropi hedefi eklerken, model tabanlı RL, robotu hareket ettirmeden önce öğrenilmiş veya analitik bir dinamik modelle planlama yapar. Model tabanlı yöntemler gerçek dünya örneklerini azaltabilir, ancak model hatasına tolerans göstermelidirler.
Üretimde, RL, güvenlik izlemesinden motor akımına kadar her katmana mutlaka uygulanmaz. Klasik bir PID veya MPC, RL kavrama temasını, rota tercihini veya kazanç programını seçerken güvenlik zarfını sağlayabilir. VLA genel bakışı benzer bir sınırı tanımlar: bir görsel-dil modeli eylem parçaları önerebilirken, doğrulanmış düşük seviyeli bir kontrolör tork ve hızı sınırlar.
9. Donanıma geçmeden önce
-
Durum hız, gecikme ve sensör güvenini içeriyor mu, yoksa Markov varsayımı sessizce mi bozuldu?
-
Ödül terimleri, başarı oranına ek olarak çarpışma oranı, enerji, giriş düzgünlüğü ve durma mesafesi ile ayrı olarak kaydediliyor mu?
-
Eylem aralıkları, hız sınırları, bekçi köpekleri ve acil durdurmalar öğreniciden bağımsız mı?
-
Sürtünme, kütle, sensör gecikmesi, aydınlatma ve paket kaybı simülasyonda rastgeleleştirildi mi ve dağıtım boşluğu gerçek kayıtlarda ölçüldü mü?
-
Görülmemiş bir değerlendirme seti eğitim verilerinden ayrı tutuluyor mu? Başarısızlıklar filtrelenmek yerine dahil ediliyor mu?
-
Bir işlemin yeniden başlatılması güvenli bir duruma girer ve eski bir komutun tekrar oynatılmasını önler mi?
Özet
Takviyeli öğrenme, bir robotun "doğru hareketi" ezberlemesini sağlamaz. Durumları, eylemleri, geçişleri ve ödülleri bir MDP olarak tanımlar, ardından Bellman denklemleriyle uzun vadeli değeri adım adım tahmin eder. Öğrenilen bir politikanın simülasyondan çıkabilmesi için keşif, ödül manipülasyonu ve donanım güvenliği sistem tasarımının bir parçası olmalıdır. Bu serinin sonraki makalelerinde Q-öğrenme/DQN, politika gradyanları, PPO ve SAC, taklit öğrenme ve Sim-to-Real aynı çerçeve altında karşılaştırılacaktır.
En yüksek anlık ödüle sahip eylem her zaman en iyisi midir?
Gelecekteki ödüller ve geçişler cevabı değiştirebilir.
Anlık ödülü iskonto edilmiş getiriden ayırt edin.
Yorumlar
Lütfen önce giriş yapın.
Henüz veri yok.