Contents — find the section you need

Intinya

RL berbasis model mempelajari model dunia \hat f, yang memetakan keadaan dan tindakan ke keadaan berikutnya yang diprediksi, menguji urutan tindakan di dalamnya, dan hanya menerapkan tindakan yang diawasi ke perangkat keras. Metode tanpa model mempelajari kebijakan langsung dari imbalan; MBRL dapat lebih efisien dalam penggunaan data dan dapat mengekspresikan batasan, tetapi kesalahan model dapat menciptakan keberhasilan hanya pada simulator. Lihat Dasar-dasar RL, Q-learning, PPO/SAC, dan MPC.

Model dan Perencanaan Dunia

Diagram 1 · Use the button to switch views
observationsworld modelMPC/policysafety monitor

Gambar 1 — SVG konseptual yang dibuat oleh Duskcoil, bukan data sistem yang diukur.

Pelajari \hat s_{t+1}=\hat f_\theta(s_t,a_t) dan optimalkan tujuan horizon yang menyusut:

a_{t:t+H}^*=\arg\max\sum_{k=0}^{H-1}\gamma^k\hat r(\hat s_{t+k},a_{t+k})-\lambda C(\hat s,a)
Hanya tindakan pertama yang dieksekusi, kemudian sistem diamati lagi. Batasan C dapat mewakili batas tabrakan, sambungan, suhu, kecepatan, atau arus. Di sini s adalah keadaan dan a adalah tindakan; model memprediksi keadaan berikutnya dan \pi(a|s) dapat mengusulkan tindakan. Hadiah yang dipelajari \hat r_\theta(s_t,a_t) dievaluasi pada waktu t di atas horizon H . Sebuah kereta dengan massa 1\,\mathrm{kg} dan input u digunakan dalam contoh numerik di bawah ini.

Simulasi ke Nyata, identifikasi, dan keselamatan

Kesalahan satu langkah akan menumpuk selama peluncuran yang panjang. Ensemble dapat memperkirakan ketidakpastian; perencana dapat menghindari wilayah dengan varians tinggi dan menggunakan horizon pendek. Pengacakan domain memvariasikan massa, gesekan, penundaan, kebisingan sensor, pencahayaan, dan posisi kamera. Identifikasi sistem mengukur inersia, gesekan, konstanta motor, dan latensi sehingga rentang tersebut dapat dipertahankan daripada sembarangan.

Beralih dari pencatatan, ke kontrol bayangan kecepatan rendah, ke uji coba terawasi terbatas. Jauhkan penghentian darurat, monitor kecepatan/gaya/suhu independen, penghentian karena kehilangan komunikasi, dan pemisahan manusia dari kebijakan yang dipelajari. Kegagalan umum meliputi simulasi gesekan tetap yang menyebabkan selip roda, overfitting pencahayaan, peretasan hadiah yang menciptakan getaran, dan penundaan yang tidak dimodelkan yang menyebabkan ketidakstabilan. Laporkan jumlah pelanggaran, jarak berhenti, abstain yang dipicu oleh ketidakpastian, dan perilaku terburuk—bukan hanya imbalan rata-rata.

Peran Model-free dan Model-based

RL Model-free memperbarui kebijakan atau nilai langsung dari pengalaman. Ini ekspresif ketika dinamika kontak sulit dimodelkan, tetapi setiap peningkatan dapat menghabiskan uji coba nyata. MBRL menggunakan kembali setiap transisi untuk melatih prediktor dan mengevaluasi banyak urutan kandidat dalam prediktor tersebut. Jika prediktor memiliki bias sistematis, perencana mengoptimalkan jalan pintas khusus simulator.

Aspek Model-free Model-based
Data perangkat keras efisiensi rendah hingga menengah menengah hingga tinggi dalam rentang model
Waktu eksekusi seringkali inferensi kebijakan ringan peluncuran dan optimasi setiap siklus
Batasan biasanya lapisan imbalan/keamanan tidak langsung wajar untuk dimasukkan ke dalam masalah perencanaan
Kegagalan utama ekstrapolasi yang buruk dari data yang jarang kesalahan model jangka panjang
Kecocokan tipikal kebijakan kontak dan visual yang kompleks Perencanaan gerak, energi, dan termal jangka pendek

Tumpukan hibrida umum digunakan: kebijakan yang dipelajari mengusulkan kandidat, model yang dipelajari memprediksi jangka waktu pendek, dan MPC memberlakukan batasan kecepatan, gaya, dan arus. Gunakan artikel PPO/SAC dan artikel MPC untuk menetapkan tanggung jawab waktu dan keselamatan daripada memperlakukan algoritma sebagai pengganti.

Jangan menggabungkan ketidakpastian menjadi satu angka

Ketidakpastian epistemik berasal dari data pelatihan yang hilang; ketidakpastian aleatorik berasal dari variasi sensor dan lingkungan yang tidak dapat direduksi. Varians ensemble merupakan sinyal yang berguna untuk yang pertama, tetapi ensemble masih dapat memiliki bias yang sama. Ketika varians prediktif melebihi ambang batas, perpendek jangka waktu, kurangi kecepatan, beralih ke pengontrol klasik, atau kumpulkan pengamatan lain sebelum perencanaan. Kebijakan abstain ini harus ditentukan sebelum penerapan.

Untuk residual satu langkah e_t=s_{t+1}-\hat s_{t+1} , kuantil log dan kasus terburuk selain kesalahan kuadrat rata-rata. Kesalahan rata-rata yang rendah dapat menyembunyikan kesalahan besar tepat sebelum kontak. Jangan pernah menafsirkan interval prediksi probabilistik sebagai sertifikat keselamatan; pertahankan monitor tabrakan, gaya, suhu, dan arus yang independen.

Desain eksperimen identifikasi

Identifikasi sistem adalah masalah desain eksperimen, bukan kalibrasi tunggal. Untuk motor, ukur gesekan statis, inersia pada beberapa kecepatan, torsi yang bergantung pada beban, dan penundaan perjalanan bolak-balik komunikasi secara terpisah. Untuk aktuator hidrolik, catat waktu tekanan, aliran, kecepatan silinder, suhu oli, dan perintah katup pada satu jam. Pisahkan data berdasarkan hari, lantai, muatan, pencahayaan, dan suhu—bukan bingkai tetangga acak—sehingga set akhir benar-benar tidak terlihat.

Intuisi numerik kecil

Pertimbangkan gerobak 1 kg yang kecepatannya berubah sebesar 0.1u setiap T_s=0.1\,\mathrm{s} . Model bebas gesekan memprediksi peningkatan kecepatan sebesar 0.5\,\mathrm{m/s} untuk u=1 selama lima langkah. Jika kereta sebenarnya kehilangan 0.02\,\mathrm{m/s} per langkah karena gesekan, kesalahan lima langkah mencapai 0.1\,\mathrm{m/s}. Jangka waktu yang lebih pendek, identifikasi online, margin dalam batasan kecepatan, dan perencanaan ulang dari pengukuran membuat model sederhana ini tetap berguna.

Bukti untuk dipublikasikan

Bersamaan dengan persamaan, pertahankan periode pelatihan, laju sensor, penundaan, seed acak, parameter lingkungan, tenggat waktu pemecah masalah, dan kebijakan cadangan. Plot residual prediksi, pelanggaran batasan, jarak berhenti, dan abstain yang dipicu ketidakpastian dengan ID eksperimen yang sama dengan hadiah. Jika log mentah tidak dapat dibagikan, publikasikan statistik anonim, pengaturan simulasi, satuan, dan tanggal referensi sehingga ruang lingkup klaim tetap dapat diperiksa.

Periksa pemahaman Anda
Apakah model yang dipelajari menjamin peluncuran jangka panjang yang andal?

Kesalahan model kecil Akumulasikan prediksi. Periksa panjang peluncuran, keadaan yang tidak dikenal, dan validasi di lingkungan nyata.

Referensi

Jenis dan perencana model dunia

Model fisik dapat diinterpretasikan tetapi dapat mengalami kesulitan dengan kontak; model laten dan ensemble dapat efisien tetapi memerlukan validasi terhadap keamanan ruang nyata. Tindakan kandidat dapat menggunakan penembakan, CEM, atau MPC yang dapat dibedakan, dengan fallback tenggat waktu.

Kebersihan dataset

Tandai sensor jenuh, kesalahan waktu, intervensi pembatas, nilai interpolasi, dan penyebab terminal. Jaga agar set evaluasi tetap tidak berubah sehingga pembaruan model tidak dapat menyembunyikan regresi.

Batasan bukti

Akurasi prediksi, hadiah, dan perilaku perangkat keras yang aman adalah klaim terpisah. Publikasikan metrik, kondisi pengujian, dan lapisan keamanan yang bertanggung jawab untuk masing-masing.

What to read next

Review the backgroundPengantar Desain Imbalan — Mengapa "Apa yang Harus Dimaksimalkan" Adalah Bagian Tersulit dari RLContinue the seriesPengantar Pembelajaran Penguatan: Pembelajaran Imitasi dan Pembelajaran Penguatan TerbalikExplore another aspect of this fieldPengantar Pembelajaran Penguatan Multi-Agen — Optimasi di Dunia di Mana Pihak Lain Juga Belajar