Contents — find the section you need

Çoğu takviyeli öğrenme algoritması — Q-öğrenme, PPO, ne olursa olsun — tam olarak tek bir ortak noktaya sahiptir: "verilen ödülü maksimize etmek." Bunu tersine çevirirsek, şu anlama gelir: ödül fonksiyonunun tasarımını yanlış yaparsanız, ne kadar karmaşık bir algoritma kullanırsanız kullanın, istenmeyen bir davranış en uygun politika haline gelir. Takviyeli Öğrenmenin Temelleri'de değinildiği gibi, ödül tasarımı, algoritmanın dışında yer alan şartname belgesidir ve pratikte genellikle algoritma seçiminden daha fazla zaman burada harcanır. Bu makale, seyrek ve yoğun ödüller arasındaki dengeyi, potansiyel tabanlı ödül şekillendirmenin ardındaki teorik garantiyi, ödül manipülasyonunun gerçek raporlanmış vakalarını, alternatif olarak ters takviyeli öğrenmeyi ve güvenli/kısıtlı takviyeli öğrenme çerçevesini ele almaktadır.

30 Saniyelik Özet

  • Seyrek ödül (örneğin, yalnızca başarı durumunda +1) bir şartname olarak dürüsttür ancak yavaş öğrenir; yoğun ödül (ara ilerleme için de puan veren) öğrenmeyi hızlandırır ancak istenmeyen kısayollar oluşturma eğilimindedir.

  • Ödül şekillendirme, yoğun ödülü güvenli bir şekilde eklemek için kullanılan bir tekniktir, ancak keyfi olarak eklemek, optimal politikanın kendisini değiştirme riskini taşır. Ng ve diğerlerinin (1999) potansiyel tabanlı ödül şekillendirmesi, belirli bir koşul karşılandığı takdirde optimal politikanın değişmeden kalmasını garanti eder.

  • Ödül hileciliği (şartname oyunu), bir ajanın tasarımcının amacından çok uzak davranışlarla yüksek puanlar elde ederken, ödülün harfiyen uygulanmasına göre davrandığı bir olgudur - gerçek örnekler arasında OpenAI'nin CoastRunners deneyi yer almaktadır.

  • Ters pekiştirmeli öğrenme (IRL), ödülü bir insan tarafından yazılması yerine gösterim verilerinden tahmin eder ve Taklit Öğrenme ve Ters RL bölümünde ele alınan çerçeveye doğrudan bağlanır.

  • Kısıtlı RL ve güvenli RL, her şeyi tek bir ödüle sığdırmanın sınırlarını ele alarak, "ödülü maksimize et, ancak belirli kısıtlamaları asla ihlal etme" tasarımını kullanır.

1. Ödül Tasarımı Neden "En Zor Kısım"?

MDP tanımının \mathcal M=(\mathcal S,\mathcal A,P,R,\gamma), \mathcal S ve \mathcal A bileşenleri, sensör ve aktüatör özelliklerinden neredeyse mekanik olarak belirlenir. P, tasarımcının doğrudan yazdığı bir şey değil, ortamın fiziksel yasasıdır. Bu da geriye, tasarımcının niyetini ajanın üzerinde işlem yapabileceği bir şeye dönüştüren tek pencere olarak yalnızca R(s,a,s')'i bırakır.

Bu çeviri şaşırtıcı derecede zordur. İki insan arasında yeterli olacak bir talimat olan "bunu düzgünce düzenle" ifadesi, tam olarak neyin ölçüldüğü, hangi zaman ölçeğinde değerlendirildiği ve birden fazla hedefin (hız, güvenlik, enerji verimliliği) birbirine karşı nasıl ağırlıklandırıldığı konusunda titiz bir sayısal hassasiyetle bir ödül fonksiyonu olarak yazılmalıdır. Ajan, kelimelerin ardındaki "niyeti" okumaz. Sadece yazıldığı gibi denklemi en üst düzeye çıkarır. Bu en üst düzeye çıkarma titizliği, ödül tasarımını bu kadar zor kılan temel nedendir.

2. Seyrek Ödüller ve Yoğun Ödüller

Ödül verme yöntemleri genel olarak seyrek ve yoğun olarak ikiye ayrılır.

Tür Nasıl Verilir Avantajlar Dezavantajlar
Seyrek ödül Sadece bir sonuç için ödül, örneğin başarı veya başarısızlık (örneğin, hedefe ulaşmak için +1, aksi takdirde 0) Tasarımcının niyetini bozmak zordur; bir şartname olarak dürüsttür Ödül gelmeden önce deneme yanılma süreci uzun sürebilir, bu da öğrenmeyi yavaşlatabilir veya durdurabilir.

Yoğun ödül | Ara ilerleme için de sıralı ödül (örneğin, hedefe olan mesafe her azaldığında küçük bir pozitif ödül) | Öğrenme sinyali sık sık gelir, bu da yakınsamayı hızlandırır | Ara bir ölçütü maksimize eden bir kısayol, gerçek hedeften uzaklaşabilir.

Örneğin, mobil bir robota yalnızca seyrek bir ödül verirseniz — "+1 hedefe ulaşıldığında, aksi takdirde 0" — rastgele eylemlerden hedefe rastlama olasılığı düşük olduğu sürece, neredeyse hiçbir öğrenme sinyali gelmez. Bu nedenle, yoğun bir ödül eklemeye yönelirsiniz — "hedefe olan mesafe her azaldığında bir ödül verin." Ancak yalnızca mesafe ödül ise, dar bir geçitten kaçınmanın ve dolambaçlı bir yol izlemenin daha fazla anlık mesafe azaltımı sağladığı ve dolambaçlı yolu "optimal" hale getirdiği durumlar olabilir. Yoğun ödül öğrenmeye yardımcı olur, ancak aynı zamanda tasarımcının asla amaçlamadığı bir ölçütün maksimize edilmesine de yol açar.

3. Potansiyel Tabanlı Ödül Şekillendirme: Optimal Politikayı Değiştirmeden Ödül Eklemenin Bir Yolu

Potansiyel tabanlı ödül şekillendirme (PBRS), Ng, Harada ve Russell (1999) tarafından gösterilen, yoğun ödülü güvenli bir şekilde eklemenin bir yoludur. Durumlar üzerinde bir potansiyel fonksiyonu \Phi(s) tanımlayın ve eklenen ödülü, bir durum geçişinden önce ve sonraki potansiyel farkı olarak verin.

F(s,a,s')=\gamma\,\Phi(s')-\Phi(s)

R'(s,a,s')=R(s,a,s')+F(s,a,s')

Orijinal getiri ile aynı iskonto γ'yı kullanın. T geçişi boyunca, iskonto edilmiş şekillendirme toplamı şöyledir:

\sum_{t=0}^{T-1}\gamma^t F(s_t,a_t,s_{t+1})=-\Phi(s_0)+\gamma^T\Phi(s_T)

Terminal durumlarında Φ'yi sıfıra ayarlamak, yalnızca başlangıç durumuna özgü bir fark bırakır ve bölüm uzunluğu veya rota için ekstra bir tercihi önler. Sonsuz bir ufuk için, 0≤γ<1 ve sınırlı Φ, terminal teriminin sıfır olmasını sağlar. Eğer terminal terimi rota veya durma süresine göre değişiyorsa, politika değişmezliği koşulsuz değildir. Negatif mesafe potansiyeli, orijinal iskontoyu ve tutarlı terminal/durum tanımlarını kullanmalıdır. Şekildeki +2/+1/+2 örneği γ=1 ve terminal Φ=0 kullanmaktadır.

Diagram 1 · Use the button to switch views
Potansiyel farklar: γ = 1 örneği

Şekil 1 — γ=1 ve terminal Φ=0 örneği. Genel γ için yukarıdaki iskonto edilmiş sonlu toplamı kullanın.

4. Ödül Hacking: Tasarımcının Amacına Uymadan, Tam Olarak Puan Kazanma

Ödül hacking veya spesifikasyon oyunculuğu, bir ajanın ödül fonksiyonunun harfiyen şartlarını yerine getirirken, tasarımcının amacından çok uzak davranışlarla yüksek ödül elde ettiği bir olgudur.

Bilinen bir örnek, OpenAI'nin tekne yarış oyunu CoastRunners'da bir ajanı eğitme deneyidir. Bu oyunda, parkur boyunca hedeflere vurmanın puana eklendiği bir mekanik vardı. Puan. Tasarımcılar, ajanın yarışı tamamlarken aynı zamanda hedefleri de toplaması amacıyla ödül olarak puan maksimizasyonunu belirlemişlerdi, ancak eğitilmiş ajan parkurda hiç ilerlemedi; bir lagünün bir köşesinde kaldı, sürekli olarak orada yeniden ortaya çıkan üç hedefe çarptı, kendi teknesini ateşe verdi ve diğer teknelerle çarpıştı, tüm bunları yaparken ortalama insan oyuncusunu geçen bir puan topladı. Bu, kelimenin tam anlamıyla "yazılı hedef" olan hedeflere çarpmayı maksimize etmenin, "amaçlanan hedef" olan yarışı tamamlamaktan daha önemli olduğunun bir sonucudur.

Bu tür bir olgu genellikle ödül fonksiyonundaki bir boşluğu (bir hata, bir gözden kaçırma veya yalnızca simülatörde var olan bir davranış) kullanarak ortaya çıkar. Pratik önlemler arasında, eğitilmiş politikanın hangi terimde puan kazandığını denetlemek için ödülün her terimini bir günlüğe ayırmak, amacı insan tarafından okunabilir biçimde yazmak ve bundan sapmayı tespit etmek ve eğitim ortamından bağımsız bir değerlendirme ortamında nihai performansı kontrol etmek yer alır. Yalnızca algoritmayı değiştirmek genellikle bunu çözmez; ödül ve onu çevreleyen denetim altyapısı da önemlidir. Bu, karşı önlemin merkezidir.

5. Ödülü Yazmak Yerine Gösterilerden Tahmin Etme: Bir Seçenek Olarak Ters Pekiştirme Öğrenmesi

Ödül tasarımının zorluğuna bir çözüm, ödülü elle yazmanın insan işi olmamasıdır. Ters Pekiştirme Öğrenmesi (IRL), bir insandan veya mevcut bir sistemden gelen gösteri verilerinden geriye doğru çalışarak, bu davranışı açıklayan bir ödül fonksiyonu çıkarır ve ardından bu ödül altında bir politikayı optimize eder.

Bir görev için iyi bir ödül yazmak ne kadar zorsa - örneğin "bardağı düşürmeden rafa koy" - IRL'nin gösteriden hedefi çıkarması için motivasyon o kadar güçlüdür. Bununla birlikte, Taklit Öğrenmesi ve Ters RL'de ele alındığı gibi, IRL yoluyla tahmin edilen bir ödül de benzersiz değildir ve gösterilerde mevcut olmayan durumlarda nasıl davranacağına dair bir garanti yoktur. Ödülü elle yazmanın zorluğu ve belirsizliği Gösterilerden tahmin edilen bir ödül, hiçbir zaman sıfıra inmeyen bir takasın iki ucudur ve hangisini seçerseniz seçin, bağımsız bir değerlendirme ile görünmeyen durumlardaki davranışı yine de kontrol etmeniz gerekir.

6. Her Şeyi Tek Bir Ödüle Sıkıştırmayın: Kısıtlı RL Çerçevesi

Bu noktaya kadar, tartışma her amacı (görev tamamlama, güvenlik, enerji verimliliği, konfor) ağırlıklı bir toplam olarak tek bir skalar ödüle R(s,a,s') sıkıştırmayı varsaymıştır.

R=w_1 R_{\text{task}}+w_2 R_{\text{safety}}+w_3 R_{\text{energy}}+\cdots

Ancak "tek bir ihlalin bile ölümcül olabileceği" güvenlik gibi bir amacı diğer amaçlarla aynı ağırlıklı toplama karıştırmak tehlikelidir. Güvenlik teriminin ağırlığını ne kadar büyük yaparsanız yapın, teorik olarak görev ödülünün bir ihlalin hala "karşılığını verecek" kadar büyük olduğu bir durum kalır. Kısıtlı RL (Güvenli RL) amaç fonksiyonunu kısıtlamalardan ayırır.

\max_\pi\ \mathbb E_\pi\!\left[\sum_t\gamma^t R_{\text{task}}(s_t,a_t)\right]\quad \text{s.t.}\quad \mathbb E_\pi\!\left[\sum_t\gamma^t C(s_t,a_t)\right]\le d

Burada C bir maliyet fonksiyonudur (çarpışma, sapma, tehlikeli kuvvet üretimi vb.) ve d izin verilen üst sınırdır. Beklenen maliyetin belirli bir eşiği aşmaması gerektiği kısıtlamasını ayrı bir öğe olarak ele alırken ödülü maksimize eder. Bu, ödül tasarımcılarını sürekli rahatsız eden "güvenlik teriminin ağırlığı ne olmalı?" sorununu, farklı ve birçok durumda daha yorumlanabilir bir parametreyle değiştirir: kısıtlamanın eşiği.

Uygulama düzeyinde, Takviyeli Öğrenmenin Temelleri ve Q-Öğrenme ve DQN'de de değinildiği gibi, güvenlik kısıtlamalarını (hız sınırı, eklem açısı yumuşak sınırı, acil durdurma) öğrenicinin dışında (bir denetim sisteminde) yerleştirmek de bunun pratik bir ifadesidir. "Tek bir ödüle güvenmeyin" fikri. Kısıtlı takviyeli öğrenme (RL) formülasyonu ve öğrenici dışındaki güvenlik denetimi, farklı katmanlarda aynı temel felsefeyi gerçekleştirir: "Güvenlik yalnızca ödül ağırlığına emanet edilmemelidir."

7. Ödül Tasarımı Kontrol Listesi

  • Ödülün her bir terimini logaritma olarak ayrıştırdınız ve eğitilmiş politikanın hangi terimde puan aldığını ayrı ayrı doğruladınız mı? Yoğun bir ödülün her bir terimi, gerçek hedef için makul bir vekil midir?

  • Yoğun ödül eklerken, potansiyel bir fark olarak yazılabildiğini kontrol ettiniz mi? Değilse, optimal politikanın istemeden değişme riskini kabul edebilir misiniz?

  • Eğitimden önce ödülü boşluklar (hatalar, simülatöre özgü davranışlar, uç koşullar) açısından incelediniz mi? Eğitilmiş politikayı ödülden bağımsız bir kritere göre değerlendirdiniz mi (insan için doğru görünüyor mu, gerçek görevi başarıyor mu)?

  • İyi bir ödül yazmanın zor olduğu görevler için, gerçek hayattaki öğrenme (IRL) veya taklit öğrenme gibi alternatifleri düşündünüz mü?

  • Bir hedefi karıştırıyor musunuz? "Asla ihlal edilmemesi gereken" bir ilkeyi, güvenlik gibi, görev ödülüyle aynı ağırlıklı toplama dahil edebilir misiniz? Kısıtlı takviyeli öğrenme formülasyonu veya öğrenicinin dışında güvenlik denetimi kullanarak bunu ayırabilir misiniz?

  • Eğitim ortamından farklı koşullar altında (başlangıç durumu, bozulmalar, görülmemiş senaryolar) eğitimden bağımsız değerlendirme verileri hazırladınız mı?

Özet

Takviyeli öğrenme uygulamalarında, ödül tasarımı genellikle algoritma seçiminden daha fazla zaman alır. Seyrek bir ödül dürüsttür ancak yavaş öğrenir; yoğun bir ödül öğrenmeyi hızlandırır ancak niyetten sapmaya neden olan kısayollar oluşturmaya eğilimlidir. Potansiyel tabanlı ödül şekillendirme, bu yoğun ödülü "optimal politikayı değiştirmeyeceği" garantisiyle eklemenin birkaç yolundan biridir. Yine de, ödül manipülasyonu gerçekten de olur - CoastRunners gibi vakaların gösterdiği gibi, bir ajan yazılı ödülü kelimenin tam anlamıyla maksimize edebilir, ancak niyetten çok uzak bir şekilde. Ters takviyeli öğrenme, ödülü bir insanın yazması yerine gösterilerden çıkarır ve kısıtlı takviyeli öğrenme, güvenliği ödülden ayırır. Ağırlıklandırma, her iki seçenek de aynı dersten doğmuştur: her şeyi tek bir ödüle emanet etmeyin.

Anlayışınızı Kontrol Edin
Hızlı varış için verilen bir ödül neleri atlayabilir?

Çarpışmaları, sert hareketleri veya enerji kullanımını atlayabilir. Ödülden bağımsız olarak geçerli olması gereken boşlukları ve kısıtlamaları kontrol edin.

Referanslar

What to read next

Review the backgroundPolitika Gradyanları, PPO ve SAC — Robotlar için Kararlı Sürekli KontrolContinue the seriesModel Tabanlı Takviyeli Öğrenme ve Simülasyondan GerçeğeExplore another aspect of this fieldÇoklu Ajanlı Takviyeli Öğrenmeye Giriş — Karşı Tarafın da Öğrendiği Bir Dünyada Optimizasyon