Pembelajaran penguatan
September 4, 2026
Pengantar Desain Imbalan — Mengapa "Apa yang Harus Dimaksimalkan" Adalah Bagian Tersulit dari RL
Dalam implementasi pembelajaran penguatan (reinforcement learning), desain fungsi imbalan lebih sering menentukan hasil daripada algoritma itu sendiri. Artikel ini membahas imbalan jarang (sparse) vs. imbalan padat (dense), invariansi kebijakan dari pembentukan imbalan berbasis potensial, kasus nyata peretasan imbalan (reward hacking), pembelajaran penguatan invers (inverse reinforcement learning), dan RL terbatas (constrained RL).
Fundamentals · 8 menit baca