Pembelajaran penguatan
September 3, 2026
Dasar-Dasar Pembelajaran Penguatan — MDP, Persamaan Bellman, dan Eksplorasi untuk Robot
Pembelajaran penguatan (reinforcement learning) adalah sebuah siklus tertutup di mana agen memilih tindakan dari pengamatan dan memaksimalkan imbalan yang tertunda. Pengantar ini menjelaskan MDP (Multi-Dependency Process), fungsi nilai, kebijakan, persamaan Bellman, eksplorasi versus eksploitasi, desain imbalan, dan jalur dari simulasi ke robot nyata.
Fundamentals · 6 menit baca