Contents — find the section you need
Lapisan l dapat ditulis sebagai h_{l+1}=\phi(W_lh_l+b_l). Tanpa \phi nonlinier, lapisan-lapisan yang bertumpuk akan menyatu menjadi satu transformasi linier. Pembelajaran melakukan backpropagasi gradien kerugian L dan pembaruan melalui \theta\leftarrow\theta-\eta\nabla_\theta L.
Diagram: Duskcoil, konseptual daripada arsitektur terukur tertentu.
Aktivasi, normalisasi, koneksi residual, dan perhatian mengubah representasi dan optimasi. Augmentasi data, peluruhan bobot, penghentian dini, dan pemisahan valid membantu memantau generalisasi; kerugian pelatihan yang lebih rendah tidak menjamin keamanan atau keadilan.
| Elemen | Peran | Perhatikan |
|---|---|---|
| Aktivasi | Menambahkan representasi nonlinier | saturasi dan unit mati |
| Pengoptimal | Memperbarui parameter dari gradien | laju pembelajaran dan stabilitas numerik |
| Regularisasi | Mendukung generalisasi | tidak dapat mencegah kebocoran pengujian |
Kerugian, lapisan keluaran, dan stabilitas numerik
Menempatkan softmax di akhir pengklasifikasi mengubah probabilitas kelas k menjadi p_k=\exp z_k/\sum_j\exp z_j. Dengan label sebenarnya sebagai one-hot y, entropi silang adalah L=-\sum_k y_k\log p_k. Implementasi menghindari penghitungan \exp z secara langsung, melainkan menggunakan trik log-sum-exp yang mengurangi logit maksimum — ini menghindari Eksponen yang meluap pada logit besar dan mengubah kerugian menjadi NaN. Untuk regresi, kesalahan kuadrat, yang sensitif terhadap outlier, bukanlah satu-satunya pilihan: kerugian Huber juga merupakan kandidat. Kerugian bukan hanya "ekspresi yang membuat angka menjadi kecil" — ini adalah spesifikasi tentang kesalahan operasional mana yang harus dihukum lebih berat.
Optimasi mini-batch memperkenalkan noise sampling. Pengoptimal adaptif seperti Adam dapat mempermudah pelatihan awal, tetapi laju pembelajaran, peluruhan bobot, ukuran batch, dan jadwal semuanya memengaruhi generalisasi. Memperbaiki seed acak saja tidak cukup ketika kernel GPU, urutan data, pra-pemrosesan, dan versi pustaka berbeda. Arsipkan data, kode, lingkungan, bobot, dan kode evaluasi sebagai satu rilis.
Membandingkan arsitektur umum
| Arsitektur | Kekuatan | Input umum | Kegagalan umum |
|---|---|---|---|
| MLP | Sederhana untuk fitur dengan panjang tetap | tabel dan fitur sensor | mengabaikan struktur spasial atau temporal |
| CNN | Memanfaatkan lokalitas | gambar dan grid | resolusi dan pergeseran akuisisi |
| Model RNN/ruang keadaan | Mempertahankan keadaan yang terurut | deret waktu dan audio | ketergantungan dan inisialisasi jangka panjang |
| Transformer | Pengkondisian jarak jauh | teks, gambar, input multimodal | komputasi, asal usul, output yang tidak didukung |
Arsitektur yang lebih rumit tidak dapat memperbaiki label yang ambigu. Label kegagalan yang dibuat setelah pemeliharaan, misalnya, dapat memungkinkan bidang pasca-kejadian masuk ke pelatihan. Akurasi offline kemudian mengukur akses ke masa depan. Pelatihan dan penyajian harus berbagi kode fitur, dan setiap fitur harus diaudit ketersediaannya pada batas waktu prediksi.
Contoh kegagalan: ilusi akurasi tinggi
Pembagian gambar secara acak dapat menempatkan produk, latar belakang, atau bingkai video yang berdekatan yang sama di kedua set pelatihan dan pengujian. Jaringan kemudian menghafal kondisi akuisisi. Kebocoran serupa terjadi dengan rata-rata bergulir di masa mendatang, pasien atau mesin yang berulang, dan lokasi geografis yang berdekatan. Tahan periode mendatang, fasilitas independen, perangkat, atau entitas.
Kesalahan kedua adalah memperlakukan probabilitas sebagai keputusan. Skor 0,9 tidak secara otomatis Berbahaya. Periksa apakah contoh yang mendapat skor mendekati 0,9 bersifat positif pada frekuensi yang kurang lebih sama, kemudian pilih ambang batas dari biaya false-alarm, miss, dan review. Sediakan jalur abstain ketika kualitas input tidak memadai atau kasusnya di luar distribusi.
Prosedur Implementasi
-
Tentukan waktu prediksi, populasi, label, batas latensi, dan biaya error.
-
Bekukan pembagian berdasarkan entitas, waktu, dan lokasi; lakukan pra-pemrosesan hanya pada data pelatihan.
-
Bandingkan model linier atau MLP kecil pada pembagian dan metrik yang sama.
-
Log loss, learning rate, gradient norms, NaN, gap train-validation, dan performa slice.
-
Suntikkan input missingness, noise, latensi, dan di luar distribusi; uji abstain dan rollback.
Jadikan gradien dapat diamati
Ketika pelatihan gagal, pertama-tama periksa data dan jalur gradien. Cobalah untuk mengingat satu batch kecil; kegagalan sering kali mengungkapkan label yang bergeser, mask yang salah, kesalahan dimensi, atau penyalahgunaan API loss. Kemudian rekam per lapisan. Aktivasi, norma gradien, dan magnitudo pembaruan. Nilai yang hilang di lapisan bawah menunjukkan kehilangan gradien, pertumbuhan tiba-tiba menunjukkan divergensi, dan pembaruan nol menunjukkan grafik yang terpisah atau parameter yang beku.
Inisialisasi bertujuan untuk menjaga varians sinyal tetap dapat digunakan di seluruh lapisan. Inisialisasi He adalah titik awal umum untuk keluarga ReLU dan inisialisasi Xavier untuk tanh, tetapi normalisasi dan koneksi residual mengubah perilaku sebenarnya. Pemotongan gradien adalah batas darurat, bukan cara untuk menyembunyikan kerugian yang salah bentuk atau penskalaan input. Dalam presisi campuran, bandingkan hasil float32 kecil dan pantau penskalaan kerugian, luapan, dan kekurangan.
Unit eksperimen yang adil
Bandingkan distribusi seed, kurva pembelajaran, dan anggaran komputasi daripada satu skor terbaik. Jumlah parameter yang sama tidak menciptakan perbandingan yang adil ketika pra-pemrosesan, pra-pelatihan, augmentasi, atau pasca-pemrosesan berbeda. Jangan pernah menyetel ulang ambang batas pada set pengujian. Untuk ketidakseimbangan, pertahankan metrik makro dan per kelas; ketika probabilitas mendorong keputusan, periksa juga kalibrasi.
| Teramati | Pola sehat | Jika abnormal, periksa |
|---|---|---|
| Kerugian pelatihan/validasi | keduanya menurun dengan celah yang stabil | kebocoran, overfitting, entitas terpisah |
| Norma gradien | terbatas tanpa lompatan tiba-tiba | skala, inisialisasi, kerugian |
| Distribusi prediksi | konsisten dengan tugas dan prevalensi | pemetaan label, sumbu softmax, ambang batas |
| Latensi inferensi | latensi ekor memenuhi tenggat waktu | pemanasan, pengelompokan, pra/pasca-pemrosesan |
Contoh kegagalan: kontaminasi validasi
Memilih arsitektur, augmentasi, dan seed setelah puluhan pemeriksaan validasi akan menyebabkan overfitting pada set validasi. Evaluasi set uji yang belum tersentuh sekali, dan catat jumlah pencarian dan aturan pemilihan. Pemisahan tingkat file masih tidak valid jika frame yang berdekatan dari satu video saling terpisah. Pisahkan berdasarkan entitas yang menentukan independensi: pasien, kendaraan, lot produksi, atau sesi perekaman.
Daftar periksa pra-deployment
-
Bandingkan kasus representatif dengan perhitungan manual atau implementasi tepercaya.
-
Otomatiskan 1. Uji overfitting batch kecil, gradien terbatas, dan uji kesetaraan simpan/muat ulang.
-
Lakukan benchmarking model dasar, kandidat, dan terkuantisasi dengan input dan timer yang sama.
-
Masukkan nilai penolakan dan perilaku fallback untuk input yang tidak valid, hilang, atau terlambat dalam kontrak API.
-
Hubungkan model, data, commit kode, dependensi, dan evaluasi ke dalam satu catatan rilis.
Rekayasa jaringan saraf adalah pekerjaan untuk membuat jalur dari data ke keputusan dapat diukur. Tambahkan kompleksitas satu perubahan pada satu waktu sehingga peningkatan memiliki penjelasan dan insiden memiliki titik rollback yang diketahui.
- Kerangka Kerja Manajemen Risiko AI NIST
- Aturan Pembelajaran Mesin Google
- Catatan Reproduksibilitas PyTorch
- NIST AI 100-1
Apakah menambahkan lapisan selalu meningkatkan akurasi?
Data, optimasi, overfitting, dan komputasi juga penting. Kompleksitas tambahan membutuhkan bukti peningkatan pada data validasi.
Komentar
Silakan masuk terlebih dahulu.
Belum ada data.