Contents — find the section you need
Q-öğrenme ve DQN, sonlu bir eylem kümesinden seçim yapar. Ancak tekerlek hızı, drone itme kuvveti veya manipülatör torku süreklidir. Politika-gradyan yöntemleri, sürekli eylemler üzerinde bir dağılım üreten bir politika \pi_\theta'ı günceller. Aktör-Eleştirmen, bu eylemleri değerlendiren bir Eleştirmen ekler; PPO ve SAC, robot araştırmalarında yaygın olarak kullanılan pratik stabilizasyon ekler.
30 saniyelik özet
-
Politika gradyanları, beklenen getiriyi J(\theta) doğrudan artırır. Sürekli eylemleri doğal olarak ele alırlar, ancak tek yörünge tahminlerinin varyansı yüksektir.
-
Aktör-Eleştirmen, bir değer tahminini temel çizgi olarak kullanır. Avantaj, bir eylemin aynı durumdaki ortalama eylemden daha iyi olup olmadığını ölçer.
-
PPO, eski ve yeni politikalar arasındaki olasılık oranını kırparak bir güncellemenin çok fazla hareket etmesini engeller. Basittir, ancak politika verilerinin yeniden kullanımı zordur.
-
SAC, hem ödülü hem de politika entropisini maksimize eder. Bu, politika dışı bir yöntemdir, tekrar oynatma özelliğini kullanır ve sürekli kontrol için pratik bir çözümdür.
-
Her iki yöntem de güvenlik limitleri sağlamaz. Eylem sınırlarını, hız limitlerini, düşük seviyeli PID/MPC'yi ve acil durdurmaları öğrenme devresinin dışında tutun.
1. Bir politikayı doğrudan optimize etme
Şekil 1 — Aktör sürekli bir dağılım önerir ve Eleştirmen getiriyi değerlendirir. Donanımda, eylem doğrudan torka değil, doğrulanmış bir alt düzey denetleyiciye gider.
Stokastik bir politika \pi_\theta(a\mid s) için, beklenen getirinin gradyanı J(\theta)=\mathbb{E}_{\pi_\theta}[G_t], log olasılığının gradyanı kullanılarak yazılabilir:
Yüksek getiri üreten eylemler daha olası hale gelir. G_t gürültülü ve gecikmeli olduğundan, duruma bağlı bir temel çizgi çıkarılarak b(s_t) beklenen eğimi değiştirmeden varyansı azaltır:
2. Avantaj ve Aktör-Eleştirmen
Eleştirmen V_\phi(s)'u öğrenir ve bir eylemin durum ortalamasından daha iyi olup olmadığını A_t=Q(s_t,a_t)-V(s_t) ile tahmin eder. Tek adımlı bir TD yaklaşımı şöyledir:
Genelleştirilmiş Avantaj Tahmini (GAE), birkaç adımı bir sapma-varyans hiperparametresi \lambda ile birleştirir. \lambda bire yaklaştıkça daha uzun bir ufuk ve daha düşük sapma ancak daha yüksek varyans kullanır. Hızlı bir tutum döngüsü için, bir kıyaslama ayarını kopyalamak yerine görevin gerçek gecikmesini ve zaman ölçeğini kullanın.
Aktör kaybı şöyledir:
ve Eleştirmen karesel değer hatasını en aza indirir:
Bir görüntü kodlayıcı paylaşıldığında, tek bir gradyan her iki tahmini de değiştirir. Ayrı öğrenme oranları, gradyan kırpma ve sabit bir gözlem-normalleştirme kaydı, arızaların teşhisini kolaylaştırır.
3. PPO: Politikayı bir kerede çok fazla değiştirmeyin
Politika gradyanları, mevcut politikayla bir rollout toplar. Bunu çok fazla güncelleme için yeniden kullanmak, yeni politikayı veri dağılımından uzaklaştırır. PPO, eski politika \pi_{\theta_{old}} ile yeni politika arasında bir olasılık oranı oluşturur,
ve kırpılmış hedefi maksimize eder
Pozitif avantajlar olasılıklarını sınırsız olarak artıramaz ve negatif avantajlar olasılıklarını sınırsız olarak azaltamaz. Küçük bir \epsilon muhafazakardır; büyük bir \epsilon daha cesur güncellemelere izin verir. Kırpma bir güvenlik kısıtlaması değildir, bu nedenle eklem, hız ve kuvvet limitleri hala ayrıdır.
Bir uygulama, sabit bir rollout toplar, Advantage'ı normalleştirir ve birkaçını eğitir. Mini-batch dönemleri. Eski log olasılıklarını kaydedin, zaman aşımını gerçek bir terminal durumundan ayırt edin ve değerlendirme sırasında normalleştirme istatistiklerini dondurun. Aksi takdirde, aynı ağırlıklara sahip iki çalıştırma farklı davranabilir.
4. SAC: ödül artı entropi
Yumuşak Aktör-Eleştirmen (SAC), gelecekteki ödüle bir amaç olarak politika entropisi \mathcal{H}(\pi) ekler:
Entropi terimi, eşit derecede iyi eylemlerin çok erken bir şekilde tek bir eyleme çökmesini önler ve keşfi canlı tutan bir sıcaklık \alpha görevi görür. SAC, politika dışıdır ve bir tekrar oynatma arabelleği kullanır, böylece her gerçek dünya geçişi yeniden kullanılabilir. Bu, örnek verimliliğini artırır, ancak eski veriler, ödül ölçeği ve sıcaklık ayarlaması önemlidir.
Sürekli bir eylem için, Aktör bir Gauss dağılımının ortalamasını \mu_\theta(s) ve standart sapmasını \sigma_\theta(s) çıkarır, ardından bunu sınırlara eşler. tanh veya başka bir dönüşüm. Log olasılığı, bu dönüşümün Jacobian düzeltmesine ihtiyaç duyar. İkili Q ağları ve daha küçük Q tahmini, aşırı tahminleri azaltır. Dağıtımın deterministik ortalamayı mı kullanacağına yoksa keşif gürültüsünü mü koruyacağına karar verin.
5. PPO veya SAC Seçimi
| Yön | PPO | SAC |
|---|---|---|
| Veri | politika içi dağıtımlar | politika dışı tekrar oynatma |
| Keşif | politika dağılımı ve entropi bonusu | entropi hedefin bir parçasıdır |
| Örnek verimliliği | düşük ila orta | genellikle daha yüksek |
| Ana hatalar | log olasılığı, terminal bayrakları, kırpma | Q aşırı tahmini, ödül ölçeği, tanh düzeltmesi |
| Tipik uyum | birçok paralel simülatör | sürekli tork ve az donanım verisi |
PPO, birçok simüle edilmiş ortam paralel olarak çalıştırılabildiğinde genellikle kararlıdır. SAC, her gerçek geçiş pahalı olduğunda cazip olabilir. Her iki yöntem de sensör gecikmesini, motor ölü bölgelerini veya aktüatör doygunluğunu otomatik olarak modellemez.
6. Simülasyondan Gerçeğe Geçiş bir sınırdır, bir anahtar değil.
Simülasyon-gerçeklik arasındaki fark kütle ve sürtünme, geri tepme, maruz kalma ve sensör gürültüsü, ağ gecikmesi, pil düşüşü, zemin malzemesi ve aydınlatmadan kaynaklanır. Alan Rastgeleleştirmesi, politikanın tek bir ideal değere aşırı uyum sağlamaması için bu parametreleri örnekler. Aralık donanımdan ölçülmelidir; imkansız dünyaları rastgeleleştirmek yalnızca eğitimi zorlaştırır.
Aşamalı bir geçiş daha güvenlidir: (1) saf simülasyon, (2) hareket olmadan gerçek sensör kayıtlarının tekrar oynatılması, (3) tekerlekler kaldırılmış düşük güç testleri, (4) açık bir zeminde sınırlı hız ve kuvvet ve (5) görevin kendisi. İstenen eylemi, güvenlik sınırlayıcısının gerçekten geçtiği eylemden ayrı olarak kaydedin. Simülasyondan Gerçeğe Geçiş, tek bir devreye alma düğmesi değil, tanımlama ve değerlendirmenin yinelemeli bir döngüsüdür.
7. Güvenlik ve değerlendirme
PPO kırpma ve SAC entropisi çarpışmaları önlemez. Bağımsız monitörler hızı, ivmeyi, eklem açısını, temas kuvvetini, hidrolik basıncı, akımı ve sıcaklığı kontrol etmelidir. Geçersiz bir gözlemde, NaN, süresi dolmuş Zaman damgası veya iletişim kesintisi durumunda, monitör güvenli bir durdurma komutu vermelidir. Risk gerektiriyorsa, bunu ayrı bir işleme veya MCU'ya yerleştirin.
Ödülün yanı sıra, başarıyı, çarpışma oranını, maksimum sapmayı, durma mesafesini, enerjiyi, eylem düzgünlüğünü, çıkarım gecikmesini ve güvenlik sınırlayıcı müdahale oranını ölçün. Sık müdahale ile yüksek bir başarı oranı, politikanın sınırlayıcıya bağlı olduğu anlamına gelir. Birkaç rastgele tohumla tekrarlanan çalıştırmalar yapın ve yalnızca ortalamayı değil, varyansı ve en kötü durumları da raporlayın.
Uygulama kontrol listesi
-
Eylem birimlerini, sınırları, tanh/clip sıralamasını ve log olasılık düzeltmelerini test edin.
-
PPO için, eski log olasılıklarını, Advantage'ı ve terminale karşı zaman aşımı bayraklarını kaydedin.
-
SAC için, tekrar oynatma dağılımını, ikiz Q değerlerini, sıcaklığı \alpha ve ödül ölçeğini izleyin.
-
Ön işlemeyi, normalleştirmeyi, tohumları, ağırlıkları ve ortam parametrelerini deney kimliğine göre sabitleyin.
-
Düşük seviyeli PID/MPC, hız limitleri, bekçi köpeği ve acil durdurmayı saklayın. Öğrenen kişiden bağımsız.
-
Her geçişten önce pasif loglar, düşük güç ve normal çalışma için durdurma koşullarını tanımlayın.
-
Başarı, çarpışma, sınırlayıcı müdahalesi, gecikme, enerji ve maksimum sapmayı birlikte kaydedin.
Özet
Politika gradyanları, sürekli bir eylem dağılımını doğrudan optimize eder. Aktör-Kritik, varyansı azaltmak için Avantaj'ı kullanır; PPO güncellemeyi kırpar; SAC, keşif ve veri verimliliğini iyileştirmek için entropi ve tekrar oynatmayı kullanır. Bunların hiçbiri donanım belirsizliğini veya güvenliğini kendi başına çözmez. Öğrenilen bir politika simülasyondan ayrıldığında, doğrulanmış bir alt düzey denetleyici, bağımsız bir monitör, aşamalı aktarım ve en kötü durum değerlendirmesi algoritmanın bir parçasıdır.
PPO kırpması güvenli davranışı garanti eder mi?
Fiziksel güvenlik kısıtlamalarını değil, optimizasyon hedefini düzenler. Eğitim istikrarını ve eylem güvenliğini ayrı ayrı değerlendirin.
Yorumlar
Lütfen önce giriş yapın.
Henüz veri yok.