2
#Inverse Reinforcement Learning
Ödül Tasarımına Giriş — RL'de "Neyi En Üst Düzeye Çıkarmalı" Sorusu Neden En Zor Kısım?
Takviyeli öğrenme uygulamalarında, ödül fonksiyonu tasarımı, algoritmadan daha çok sonucu belirler. Bu makale, seyrek ve yoğun ödül, potansiyel tabanlı ödül şekillendirmenin politika değişmezliği, ödül manipülasyonunun gerçek örnekleri, ters takviyeli öğrenme ve kısıtlı takviyeli öğrenmeyi ele almaktadır.
Fundamentals · 7 min okumaPekiştirmeli Öğrenmeye Giriş: Taklit Öğrenme ve Ters Pekiştirmeli Öğrenme
Davranış Klonlama, DAgger ve ters pekiştirme öğrenmesi, ödüllerin yazılması zor olduğunda gösterimlerden yararlanır. Bu giriş niteliğindeki metin, kovaryat kayması, ödül çıkarımı, VLA bağlantıları, değerlendirme, güvenlik ve veri kaynağı konularını kapsamaktadır.
Fundamentals · 5 min okuma