Contents — find the section you need

Mengajari robot untuk meletakkan cangkir dengan aman, menghindari orang di lorong sempit, atau mengoperasikan alat yang kompleks seringkali lebih sulit daripada kedengarannya karena imbalannya sulit ditentukan. Memberi imbalan berdasarkan jarak ke tujuan dapat mendorong untuk menyingkirkan objek; hanya memberi imbalan atas keberhasilan akhir mungkin tidak memberikan sinyal yang berguna bagi eksplorasi. Pembelajaran imitasi menggunakan demonstrasi dari manusia, operator jarak jauh, atau kebijakan yang ada untuk mempelajari tindakan dari pengamatan. Pembelajaran penguatan invers (IRL) sebaliknya mencoba untuk menyimpulkan tujuan—atau imbalan—yang membuat perilaku yang didemonstrasikan masuk akal, kemudian menurunkan kebijakan untuk tujuan tersebut.

Tidak satu pun metode menjadi aman hanya karena menggunakan data manusia. Pertanyaan utamanya adalah apa yang dilakukan kebijakan dalam keadaan yang tidak ada dalam demonstrasi, bagaimana label diatur waktunya dan dikaitkan, bagaimana kegagalan dikumpulkan, dan apa yang secara independen membatasi tindakan fisik. Artikel ini menghubungkan Pengkloningan Perilaku (BC), pergeseran kovariat, DAgger, IRL, model Visi-Bahasa-Aksi, evaluasi, keamanan, dan asal usul data. Lihat Dasar-Dasar Pembelajaran Penguatan, PPO dan SAC, dan Pengantar VLA untuk konsep-konsep terkait.

Kesimpulan Praktis

  • BC adalah pembelajaran terawasi dari keadaan yang ditunjukkan s ke tindakan ahli a. Prosesnya cepat untuk dimulai, tetapi kesalahan kecil di awal dapat menggeser kebijakan ke distribusi keadaan yang belum pernah dilihatnya.

  • DAgger menjalankan kebijakan saat ini dalam pengaturan terkontrol, meminta ahli untuk tindakan dalam keadaan yang sebenarnya dikunjungi kebijakan tersebut, menggabungkan label tersebut, dan melatih ulang. Proses ini mengubah mode kegagalan menjadi data, tetapi membutuhkan eksekusi yang aman dan intervensi ahli yang andal.

  • IRL memperkirakan hadiah r_\theta(s,a) dari demonstrasi dan kemudian mengoptimalkan kebijakan untuk hadiah tersebut. Hadiah tidak diidentifikasi secara unik; nilailah berdasarkan perilaku dalam kondisi yang diuji dan batasan keselamatan yang eksplisit, bukan berdasarkan peta panas yang tampak masuk akal.

  • VLA dapat berupa kebijakan imitasi bersyarat yang besar, tetapi bahasa dan skala gambar tidak menghilangkan batasan fisik, waktu, keselamatan kontak, atau jalur berhenti yang aman.

Demonstrasi adalah catatan operasional, bukan hanya video

Demonstrasi yang dapat digunakan menggabungkan pengamatan (gambar, kedalaman, gaya, keadaan sendi), tindakan (perintah sendi, kecepatan, penjepit, berhenti), stempel waktu, bingkai, instruksi tugas, keberhasilan/kegagalan, operator, kondisi lingkungan, dan peristiwa intervensi. Jika perintah yang dicatat adalah apa yang sampai ke robot setelah penundaan transportasi daripada apa yang dimaksudkan operator, penundaan tersebut termasuk dalam kumpulan data. Offset gambar-ke-lengan 100 ms mengubah perilaku yang benar menjadi pasangan pelatihan yang tidak konsisten.

Asal usul data mencakup persetujuan pengumpul, izin untuk lingkungan perekaman, privasi, karya pihak ketiga, tanggung jawab keselamatan robot, dan kemampuan untuk melacak sampel ke sumbernya. Mencampur dataset publik memerlukan pengecekan lisensi, ketentuan penggunaan komersial, redistribusi, orang dan audio, serta kalibrasi untuk penggunaan yang dimaksudkan. “Ditemukan di internet” bukanlah asal usul; itu adalah ketiadaan persetujuan dan ketentuan yang dapat dilacak.

Diagram 1 · Use the button to switch views
Belajar dari demonstrasi; agregat status yang dikunjungi

Diagram: Duskcoil, konseptual. Peluncuran adalah pengumpulan data nyata; diagram ini tidak menyiratkan bahwa pemantauan keselamatan, logika penghentian, atau intervensi operator dapat dihilangkan.

Pengkloningan Perilaku dan pergeseran kovariat

Dengan pasangan ahli D=\{(s_i,a_i^*)\}_{i=1}^N, BC aksi kontinu dapat meminimalkan

\min_\theta\;\mathcal L_{BC}(\theta)=\frac1N\sum_{i=1}^N\lVert\pi_\theta(s_i)-a_i^*\rVert_2^2

Aksi diskrit menggunakan entropi silang. Jika lebih dari satu aksi valid, prediksi kesalahan kuadrat tunggal dapat merata-ratakan "lewati kiri" dan "lewati kanan" menjadi aksi tengah yang tidak aman; distribusi bersyarat, model campuran, atau kebijakan gaya difusi dapat mewakili beberapa mode. Konteks, gaya operator, dan instruksi tugas penting.

BC menarik karena dapat dilatih secara offline sebelum desain atau eksplorasi hadiah. Kelemahan intinya adalah demonstrasi berasal dari distribusi status ahli d_{\pi^*}(s) sementara penerapan menghasilkan d_{\pi_\theta}(s). Kesalahan kecil mengubah Pengamatan selanjutnya dapat berlipat ganda. Dalam analisis yang disederhanakan, kesalahan satu langkah \epsilon dapat tumbuh hingga orde O(T^2\epsilon) selama horizon sekuensial T; batas pastinya bergantung pada asumsi, tetapi titik kausalnya tahan lama: suatu kebijakan menciptakan input masa depannya sendiri.

DAgger: label agregat di mana pembelajar pergi

Agregasi Dataset menjalankan kebijakan yang dipelajari dalam kondisi terkontrol, meminta tindakan ahli yang diinginkan a^* pada keadaan s yang sebenarnya dikunjungi, menambahkan pasangan tersebut ke D, dan melatih ulang. Campuran kebijakan dapat digunakan selama iterasi. Metode ini membawa distribusi pelatihan menuju distribusi penyebaran.

DAgger bukanlah izin menyeluruh untuk membiarkan robot gagal di depan umum. Mulailah dengan simulasi, kecepatan rendah, penjaga fisik, penghentian darurat jarak jauh, pengambilalihan ahli segera, dan filter keamanan tindakan. Label dapat berupa tindakan yang dilakukan ahli secara fisik atau jawaban kontrafaktual untuk "apa yang seharusnya terjadi di sini?" Yang terakhir bisa berharga tetapi menambah beban kerja ahli, latensi, dan variasi subjektif. Rencanakan pengumpulan data berdasarkan mode kegagalan yang belum terungkap—bukan hanya jumlah baris saja.

IRL: menyimpulkan tujuan daripada meniru tindakan

IRL memperkirakan imbalan r_\theta(s,a) atau r_\theta(s,a,s') dari kebijakan ahli \pi_E. Intuisi entropi maksimum adalah bahwa lintasan ahli lebih menyukai imbalan tinggi tanpa terlalu deterministik di antara lintasan yang sama baiknya. Secara konseptual, probabilitas lintasan \tau adalah

p_\theta(\tau)\propto\exp\left(\sum_t r_\theta(s_t,a_t)\right)

Memperbarui \theta untuk meningkatkan kemungkinan lintasan ahli menghasilkan imbalan yang dapat dipasangkan dengan RL atau kontrol optimal. Ini mungkin beradaptasi lebih baik daripada BC langsung ke keadaan awal atau kendala baru, karena tujuan dapat dioptimalkan kembali.

Tetapi banyak imbalan dapat menjelaskan demonstrasi yang sama; kendala yang tidak teramati dan kebiasaan operator dapat diserap ke dalam imbalan yang dipelajari. Sebuah imbalan Hal itu menjelaskan bahwa lintasan pelatihan dapat digeneralisasikan secara berbahaya. Metode gaya GAIL, sebaliknya, mencocokkan distribusi okupansi ahli dan pembelajar melalui diskriminator. Baik formulasi tersebut tidak membenarkan pembelajaran larangan—tabrakan, gaya jepit, zona eksklusi manusia—hanya melalui inferensi. Aturan keselamatan eksplisit tetap eksplisit.

Koneksi ke VLA

Model Vision-Language-Action (VLA) mengkondisikan tindakan selanjutnya atau sebagian tindakan berdasarkan gambar, bahasa, dan keadaan robot. Secara luas, ini adalah imitasi bersyarat skala besar. Jangkauan objek dan bahasanya tidak menjamin ekstrapolasi ke pencahayaan baru, gesekan, penempatan kamera, instruksi ambigu, atau batasan gaya kontak. VLA yang menginterpretasikan "letakkan cangkir di rak" itu sendiri tidak memastikan gaya, jarak tabrakan, jangkauan sendi, atau jarak berhenti; lihat VLA Primer.

Validasi kerangka koordinat, satuan, kecepatan, percepatan, dan kesegaran sebelum suatu tindakan mencapai aktuator. Arahkan melalui kinematika, pemeriksaan tabrakan, dan impedansi atau Pengontrol posisi/kecepatan. Bahasa yang ambigu harus memicu klarifikasi, penolakan, atau mode kecepatan rendah; persepsi yang menurun harus menghentikan eksekusi. Skala data tidak menggantikan batas keamanan fisik.

Evaluasi, keamanan, dan asal usul

Jangan menyetujui kebijakan hanya berdasarkan kesalahan tindakan offline. Buat evaluasi terpisah atas posisi awal, objek, pencahayaan, latar belakang, gesekan, latensi, kata-kata instruksi, dan gangguan. Laporkan keberhasilan, tabrakan, penghentian, jumlah intervensi, gaya puncak, waktu penyelesaian, dan kasus terburuk yang diamati. Keberhasilan rata-rata yang tinggi tidak menyerap risiko manusia atau peralatan yang jarang terjadi. Lacak setiap iterasi DAgger, demonstrasi sumber, pelabel, pemisahan, model, ambang batas, kegagalan, dan jalur pengembalian.

Lapisan Verifikasi Respons terhadap kegagalan
Data persetujuan, lisensi, waktu, kerangka kerja, asal usul keberhasilan/kegagalan karantina, pelabelan ulang, hentikan penggunaan
Kebijakan status terpisah, pergeseran, ketidakpastian tindakan lambat, tanyakan kepada ahli, ingat kembali
Aktuasi Batasan, laju, tabrakan, gaya, komunikasi filter keselamatan, berhenti, berhenti darurat
Operasi pengawas, pemulihan, log, kontrol perubahan pengembalian dan tinjauan akar penyebab
Periksa pemahaman Anda
Apakah imitasi mengembalikan alasan demonstrator?

Mereproduksi perilaku dan menyimpulkan imbalan adalah tugas yang berbeda. Beberapa imbalan dapat menjelaskan perilaku yang sama, jadi periksa asumsi IRL.

Referensi

What to read next

Review the backgroundPembelajaran Penguatan Berbasis Model dan Simulasi ke NyataContinue the seriesPenjelasan π0 — Bagaimana Pencocokan Aliran Mengubah Generasi Tindakan VLAExplore another aspect of this fieldPengantar Pembelajaran Penguatan Multi-Agen — Optimasi di Dunia di Mana Pihak Lain Juga Belajar