Artikel
Membangun, menguji, dan mengurai teknologi. Eksperimen, penerapan, dan riset menjelaskan cara kerjanya.
7

#Reinforcement Learning

Pembelajaran penguatan September 4, 2026

Pengantar Pembelajaran Penguatan Multi-Agen — Optimasi di Dunia di Mana Pihak Lain Juga Belajar

Ketika beberapa agen belajar secara bersamaan, MDP agen tunggal tidak lagi berlaku. Artikel ini membahas tentang non-stasioneritas, pengaturan kooperatif/kompetitif/campuran, CTDE, masalah penugasan kredit, serta MADDPG dan QMIX, dengan persamaan dan diagram.

Fundamentals · 8 menit baca
Pembelajaran penguatan September 4, 2026

Pengantar Desain Imbalan — Mengapa "Apa yang Harus Dimaksimalkan" Adalah Bagian Tersulit dari RL

Dalam implementasi pembelajaran penguatan (reinforcement learning), desain fungsi imbalan lebih sering menentukan hasil daripada algoritma itu sendiri. Artikel ini membahas imbalan jarang (sparse) vs. imbalan padat (dense), invariansi kebijakan dari pembentukan imbalan berbasis potensial, kasus nyata peretasan imbalan (reward hacking), pembelajaran penguatan invers (inverse reinforcement learning), dan RL terbatas (constrained RL).

Fundamentals · 8 menit baca
Tren teknologi September 4, 2026

Tren Teknologi dalam Model Dunia

Sebuah 'Model Dunia' mempelajari dinamika suatu lingkungan dan mensimulasikan masa depan di dalam pikirannya sendiri. Dari VAE+RNN karya Ha & Schmidhuber, melalui DreamerV3, Genie 3, dan Sora, hingga arsitektur JEPA yang dipelopori oleh Yann LeCun — karya ini memetakan perbedaan antara pendekatan generatif dan non-generatif, serta hambatan konsistensi fisik yang dihadapi kedua sisi.

Trends · 8 menit baca
Pembelajaran penguatan September 3, 2026

Pengantar Pembelajaran Penguatan: Pembelajaran Imitasi dan Pembelajaran Penguatan Terbalik

Kloning Perilaku, DAgger, dan pembelajaran penguatan terbalik menggunakan demonstrasi ketika imbalan sulit untuk ditulis. Panduan singkat ini mencakup pergeseran kovariat, inferensi imbalan, koneksi VLA, evaluasi, keamanan, dan asal usul data.

Fundamentals · 5 menit baca
Pembelajaran penguatan September 3, 2026

Dasar-Dasar Pembelajaran Penguatan — MDP, Persamaan Bellman, dan Eksplorasi untuk Robot

Pembelajaran penguatan (reinforcement learning) adalah sebuah siklus tertutup di mana agen memilih tindakan dari pengamatan dan memaksimalkan imbalan yang tertunda. Pengantar ini menjelaskan MDP (Multi-Dependency Process), fungsi nilai, kebijakan, persamaan Bellman, eksplorasi versus eksploitasi, desain imbalan, dan jalur dari simulasi ke robot nyata.

Fundamentals · 6 menit baca
Pembelajaran penguatan September 3, 2026

Pembelajaran Penguatan Berbasis Model dan Simulasi ke Nyata

Model dunia, kesalahan prediksi, MPC, pengacakan domain, identifikasi sistem, dan pemantauan keselamatan untuk mesin nyata.

Fundamentals · 4 menit baca
Tren teknologi August 20, 2026

Tren Teknologi dalam Navigasi

Dari alur kerja klasik berupa peta, peta biaya, dan perencanaan jalur, hingga pendekatan ujung-ke-ujung melalui pembelajaran penguatan, hingga model dasar yang dibangun di atas model Visi-Bahasa. Menelaah posisi navigasi robot bergerak otonom saat ini.

Trends · 7 menit baca