#Sim-to-Real
Dasar-Dasar Pembelajaran Penguatan — MDP, Persamaan Bellman, dan Eksplorasi untuk Robot
Pembelajaran penguatan (reinforcement learning) adalah sebuah siklus tertutup di mana agen memilih tindakan dari pengamatan dan memaksimalkan imbalan yang tertunda. Pengantar ini menjelaskan MDP (Multi-Dependency Process), fungsi nilai, kebijakan, persamaan Bellman, eksplorasi versus eksploitasi, desain imbalan, dan jalur dari simulasi ke robot nyata.
Fundamentals · 6 menit baca Pembelajaran penguatan September 3, 2026Pembelajaran Penguatan Berbasis Model dan Simulasi ke Nyata
Model dunia, kesalahan prediksi, MPC, pengacakan domain, identifikasi sistem, dan pemantauan keselamatan untuk mesin nyata.
Fundamentals · 4 menit bacaGradien Kebijakan, PPO, dan SAC — Kontrol Kontinu Stabil untuk Robot
Gradien kebijakan memperbarui kebijakan secara langsung sehingga kemudi, daya dorong, dan torsi sendi dapat tetap kontinu. Artikel ini menghubungkan Actor-Critic, PPO, dan SAC, kemudian membahas pemotongan (clipping), regularisasi entropi, evaluasi, dan batas keamanan untuk transfer Sim-to-Real.
Fundamentals · 5 menit baca