Contents — find the section you need
Intinya
RL berbasis model mempelajari model dunia \hat f, yang memetakan keadaan dan tindakan ke keadaan berikutnya yang diprediksi, menguji urutan tindakan di dalamnya, dan hanya menerapkan tindakan yang diawasi ke perangkat keras. Metode tanpa model mempelajari kebijakan langsung dari imbalan; MBRL dapat lebih efisien dalam penggunaan data dan dapat mengekspresikan batasan, tetapi kesalahan model dapat menciptakan keberhasilan hanya pada simulator. Lihat Dasar-dasar RL, Q-learning, PPO/SAC, dan MPC.
Model dan Perencanaan Dunia
Gambar 1 — SVG konseptual yang dibuat oleh Duskcoil, bukan data sistem yang diukur.
Pelajari \hat s_{t+1}=\hat f_\theta(s_t,a_t) dan optimalkan tujuan horizon yang menyusut:
Simulasi ke Nyata, identifikasi, dan keselamatan
Kesalahan satu langkah akan menumpuk selama peluncuran yang panjang. Ensemble dapat memperkirakan ketidakpastian; perencana dapat menghindari wilayah dengan varians tinggi dan menggunakan horizon pendek. Pengacakan domain memvariasikan massa, gesekan, penundaan, kebisingan sensor, pencahayaan, dan posisi kamera. Identifikasi sistem mengukur inersia, gesekan, konstanta motor, dan latensi sehingga rentang tersebut dapat dipertahankan daripada sembarangan.
Beralih dari pencatatan, ke kontrol bayangan kecepatan rendah, ke uji coba terawasi terbatas. Jauhkan penghentian darurat, monitor kecepatan/gaya/suhu independen, penghentian karena kehilangan komunikasi, dan pemisahan manusia dari kebijakan yang dipelajari. Kegagalan umum meliputi simulasi gesekan tetap yang menyebabkan selip roda, overfitting pencahayaan, peretasan hadiah yang menciptakan getaran, dan penundaan yang tidak dimodelkan yang menyebabkan ketidakstabilan. Laporkan jumlah pelanggaran, jarak berhenti, abstain yang dipicu oleh ketidakpastian, dan perilaku terburuk—bukan hanya imbalan rata-rata.
Peran Model-free dan Model-based
RL Model-free memperbarui kebijakan atau nilai langsung dari pengalaman. Ini ekspresif ketika dinamika kontak sulit dimodelkan, tetapi setiap peningkatan dapat menghabiskan uji coba nyata. MBRL menggunakan kembali setiap transisi untuk melatih prediktor dan mengevaluasi banyak urutan kandidat dalam prediktor tersebut. Jika prediktor memiliki bias sistematis, perencana mengoptimalkan jalan pintas khusus simulator.
| Aspek | Model-free | Model-based |
|---|---|---|
| Data perangkat keras | efisiensi rendah hingga menengah | menengah hingga tinggi dalam rentang model |
| Waktu eksekusi | seringkali inferensi kebijakan ringan | peluncuran dan optimasi setiap siklus |
| Batasan | biasanya lapisan imbalan/keamanan tidak langsung | wajar untuk dimasukkan ke dalam masalah perencanaan |
| Kegagalan utama | ekstrapolasi yang buruk dari data yang jarang | kesalahan model jangka panjang |
| Kecocokan tipikal | kebijakan kontak dan visual yang kompleks | Perencanaan gerak, energi, dan termal jangka pendek |
Tumpukan hibrida umum digunakan: kebijakan yang dipelajari mengusulkan kandidat, model yang dipelajari memprediksi jangka waktu pendek, dan MPC memberlakukan batasan kecepatan, gaya, dan arus. Gunakan artikel PPO/SAC dan artikel MPC untuk menetapkan tanggung jawab waktu dan keselamatan daripada memperlakukan algoritma sebagai pengganti.
Jangan menggabungkan ketidakpastian menjadi satu angka
Ketidakpastian epistemik berasal dari data pelatihan yang hilang; ketidakpastian aleatorik berasal dari variasi sensor dan lingkungan yang tidak dapat direduksi. Varians ensemble merupakan sinyal yang berguna untuk yang pertama, tetapi ensemble masih dapat memiliki bias yang sama. Ketika varians prediktif melebihi ambang batas, perpendek jangka waktu, kurangi kecepatan, beralih ke pengontrol klasik, atau kumpulkan pengamatan lain sebelum perencanaan. Kebijakan abstain ini harus ditentukan sebelum penerapan.
Untuk residual satu langkah e_t=s_{t+1}-\hat s_{t+1} , kuantil log dan kasus terburuk selain kesalahan kuadrat rata-rata. Kesalahan rata-rata yang rendah dapat menyembunyikan kesalahan besar tepat sebelum kontak. Jangan pernah menafsirkan interval prediksi probabilistik sebagai sertifikat keselamatan; pertahankan monitor tabrakan, gaya, suhu, dan arus yang independen.
Desain eksperimen identifikasi
Identifikasi sistem adalah masalah desain eksperimen, bukan kalibrasi tunggal. Untuk motor, ukur gesekan statis, inersia pada beberapa kecepatan, torsi yang bergantung pada beban, dan penundaan perjalanan bolak-balik komunikasi secara terpisah. Untuk aktuator hidrolik, catat waktu tekanan, aliran, kecepatan silinder, suhu oli, dan perintah katup pada satu jam. Pisahkan data berdasarkan hari, lantai, muatan, pencahayaan, dan suhu—bukan bingkai tetangga acak—sehingga set akhir benar-benar tidak terlihat.
Intuisi numerik kecil
Pertimbangkan gerobak 1 kg yang kecepatannya berubah sebesar 0.1u setiap T_s=0.1\,\mathrm{s} . Model bebas gesekan memprediksi peningkatan kecepatan sebesar 0.5\,\mathrm{m/s} untuk u=1 selama lima langkah. Jika kereta sebenarnya kehilangan 0.02\,\mathrm{m/s} per langkah karena gesekan, kesalahan lima langkah mencapai 0.1\,\mathrm{m/s}. Jangka waktu yang lebih pendek, identifikasi online, margin dalam batasan kecepatan, dan perencanaan ulang dari pengukuran membuat model sederhana ini tetap berguna.
Bukti untuk dipublikasikan
Bersamaan dengan persamaan, pertahankan periode pelatihan, laju sensor, penundaan, seed acak, parameter lingkungan, tenggat waktu pemecah masalah, dan kebijakan cadangan. Plot residual prediksi, pelanggaran batasan, jarak berhenti, dan abstain yang dipicu ketidakpastian dengan ID eksperimen yang sama dengan hadiah. Jika log mentah tidak dapat dibagikan, publikasikan statistik anonim, pengaturan simulasi, satuan, dan tanggal referensi sehingga ruang lingkup klaim tetap dapat diperiksa.
Apakah model yang dipelajari menjamin peluncuran jangka panjang yang andal?
Kesalahan model kecil Akumulasikan prediksi. Periksa panjang peluncuran, keadaan yang tidak dikenal, dan validasi di lingkungan nyata.
Referensi
Jenis dan perencana model dunia
Model fisik dapat diinterpretasikan tetapi dapat mengalami kesulitan dengan kontak; model laten dan ensemble dapat efisien tetapi memerlukan validasi terhadap keamanan ruang nyata. Tindakan kandidat dapat menggunakan penembakan, CEM, atau MPC yang dapat dibedakan, dengan fallback tenggat waktu.
Kebersihan dataset
Tandai sensor jenuh, kesalahan waktu, intervensi pembatas, nilai interpolasi, dan penyebab terminal. Jaga agar set evaluasi tetap tidak berubah sehingga pembaruan model tidak dapat menyembunyikan regresi.
Batasan bukti
Akurasi prediksi, hadiah, dan perilaku perangkat keras yang aman adalah klaim terpisah. Publikasikan metrik, kondisi pengujian, dan lapisan keamanan yang bertanggung jawab untuk masing-masing.
Komentar
Silakan masuk terlebih dahulu.
Belum ada data.