3
#Sim-to-Real
Pekiştirmeli öğrenme
September 3, 2026
Pekiştirmeli öğrenme
September 3, 2026
Takviyeli Öğrenmenin Temelleri — MDP'ler, Bellman Denklemleri ve Robotlar için Keşif
Takviyeli öğrenme, bir ajanın gözlemlerden eylemler seçtiği ve gecikmeli ödülleri maksimize ettiği kapalı bir döngüdür. Bu giriş niteliğindeki metin, MDP'leri, değer fonksiyonlarını, politikaları, Bellman denklemlerini, keşif ve sömürüyü, ödül tasarımını ve simülasyondan gerçek bir robota giden yolu açıklamaktadır.
Fundamentals · 6 min okuma Pekiştirmeli öğrenme September 3, 2026Model Tabanlı Takviyeli Öğrenme ve Simülasyondan Gerçeğe
Gerçek makineler için dünya modelleri, tahmin hatası, MPC, alan rastgeleleştirme, sistem tanımlama ve güvenlik izleme.
Fundamentals · 4 min okumaPolitika Gradyanları, PPO ve SAC — Robotlar için Kararlı Sürekli Kontrol
Politika gradyanları, yönlendirme, itme ve eklem torkunun sürekli kalabilmesi için politikayı doğrudan günceller. Bu makale, Aktör-Eleştirmen, PPO ve SAC'yi birbirine bağladıktan sonra kırpma, entropi düzenlemesi, değerlendirme ve simülasyondan gerçek hayata aktarım için güvenlik sınırını ele almaktadır.
Fundamentals · 5 min okuma