#Reinforcement Learning
Pengantar Pembelajaran Penguatan Multi-Agen — Optimasi di Dunia di Mana Pihak Lain Juga Belajar
Ketika beberapa agen belajar secara bersamaan, MDP agen tunggal tidak lagi berlaku. Artikel ini membahas tentang non-stasioneritas, pengaturan kooperatif/kompetitif/campuran, CTDE, masalah penugasan kredit, serta MADDPG dan QMIX, dengan persamaan dan diagram.
Fundamentals · 8 menit bacaPengantar Desain Imbalan — Mengapa "Apa yang Harus Dimaksimalkan" Adalah Bagian Tersulit dari RL
Dalam implementasi pembelajaran penguatan (reinforcement learning), desain fungsi imbalan lebih sering menentukan hasil daripada algoritma itu sendiri. Artikel ini membahas imbalan jarang (sparse) vs. imbalan padat (dense), invariansi kebijakan dari pembentukan imbalan berbasis potensial, kasus nyata peretasan imbalan (reward hacking), pembelajaran penguatan invers (inverse reinforcement learning), dan RL terbatas (constrained RL).
Fundamentals · 8 menit bacaTren Teknologi dalam Model Dunia
Sebuah 'Model Dunia' mempelajari dinamika suatu lingkungan dan mensimulasikan masa depan di dalam pikirannya sendiri. Dari VAE+RNN karya Ha & Schmidhuber, melalui DreamerV3, Genie 3, dan Sora, hingga arsitektur JEPA yang dipelopori oleh Yann LeCun — karya ini memetakan perbedaan antara pendekatan generatif dan non-generatif, serta hambatan konsistensi fisik yang dihadapi kedua sisi.
Trends · 8 menit bacaPengantar Pembelajaran Penguatan: Pembelajaran Imitasi dan Pembelajaran Penguatan Terbalik
Kloning Perilaku, DAgger, dan pembelajaran penguatan terbalik menggunakan demonstrasi ketika imbalan sulit untuk ditulis. Panduan singkat ini mencakup pergeseran kovariat, inferensi imbalan, koneksi VLA, evaluasi, keamanan, dan asal usul data.
Fundamentals · 5 menit baca Pembelajaran penguatan September 3, 2026Dasar-Dasar Pembelajaran Penguatan — MDP, Persamaan Bellman, dan Eksplorasi untuk Robot
Pembelajaran penguatan (reinforcement learning) adalah sebuah siklus tertutup di mana agen memilih tindakan dari pengamatan dan memaksimalkan imbalan yang tertunda. Pengantar ini menjelaskan MDP (Multi-Dependency Process), fungsi nilai, kebijakan, persamaan Bellman, eksplorasi versus eksploitasi, desain imbalan, dan jalur dari simulasi ke robot nyata.
Fundamentals · 6 menit baca Pembelajaran penguatan September 3, 2026Pembelajaran Penguatan Berbasis Model dan Simulasi ke Nyata
Model dunia, kesalahan prediksi, MPC, pengacakan domain, identifikasi sistem, dan pemantauan keselamatan untuk mesin nyata.
Fundamentals · 4 menit bacaTren Teknologi dalam Navigasi
Dari alur kerja klasik berupa peta, peta biaya, dan perencanaan jalur, hingga pendekatan ujung-ke-ujung melalui pembelajaran penguatan, hingga model dasar yang dibangun di atas model Visi-Bahasa. Menelaah posisi navigasi robot bergerak otonom saat ini.
Trends · 7 menit baca