2
#Inverse Reinforcement Learning
Pengantar Desain Imbalan — Mengapa "Apa yang Harus Dimaksimalkan" Adalah Bagian Tersulit dari RL
Dalam implementasi pembelajaran penguatan (reinforcement learning), desain fungsi imbalan lebih sering menentukan hasil daripada algoritma itu sendiri. Artikel ini membahas imbalan jarang (sparse) vs. imbalan padat (dense), invariansi kebijakan dari pembentukan imbalan berbasis potensial, kasus nyata peretasan imbalan (reward hacking), pembelajaran penguatan invers (inverse reinforcement learning), dan RL terbatas (constrained RL).
Fundamentals · 8 menit bacaPengantar Pembelajaran Penguatan: Pembelajaran Imitasi dan Pembelajaran Penguatan Terbalik
Kloning Perilaku, DAgger, dan pembelajaran penguatan terbalik menggunakan demonstrasi ketika imbalan sulit untuk ditulis. Panduan singkat ini mencakup pergeseran kovariat, inferensi imbalan, koneksi VLA, evaluasi, keamanan, dan asal usul data.
Fundamentals · 5 menit baca