Pekiştirmeli öğrenme
September 3, 2026
Takviyeli Öğrenmenin Temelleri — MDP'ler, Bellman Denklemleri ve Robotlar için Keşif
Takviyeli öğrenme, bir ajanın gözlemlerden eylemler seçtiği ve gecikmeli ödülleri maksimize ettiği kapalı bir döngüdür. Bu giriş niteliğindeki metin, MDP'leri, değer fonksiyonlarını, politikaları, Bellman denklemlerini, keşif ve sömürüyü, ödül tasarımını ve simülasyondan gerçek bir robota giden yolu açıklamaktadır.
Fundamentals · 6 min okuma