Contents — find the section you need

Lapisan l dapat ditulis sebagai h_{l+1}=\phi(W_lh_l+b_l). Tanpa \phi nonlinier, lapisan-lapisan yang bertumpuk akan menyatu menjadi satu transformasi linier. Pembelajaran melakukan backpropagasi gradien kerugian L dan pembaruan melalui \theta\leftarrow\theta-\eta\nabla_\theta L.

Diagram 1 · Use the button to switch views
Forward and backward neural network flowInput passes through hidden layers to prediction and loss; gradients flow in reverse.input xhidden hprediction ŷloss L

Diagram: Duskcoil, konseptual daripada arsitektur terukur tertentu.

Aktivasi, normalisasi, koneksi residual, dan perhatian mengubah representasi dan optimasi. Augmentasi data, peluruhan bobot, penghentian dini, dan pemisahan valid membantu memantau generalisasi; kerugian pelatihan yang lebih rendah tidak menjamin keamanan atau keadilan.

Elemen Peran Perhatikan
Aktivasi Menambahkan representasi nonlinier saturasi dan unit mati
Pengoptimal Memperbarui parameter dari gradien laju pembelajaran dan stabilitas numerik
Regularisasi Mendukung generalisasi tidak dapat mencegah kebocoran pengujian

Kerugian, lapisan keluaran, dan stabilitas numerik

Menempatkan softmax di akhir pengklasifikasi mengubah probabilitas kelas k menjadi p_k=\exp z_k/\sum_j\exp z_j. Dengan label sebenarnya sebagai one-hot y, entropi silang adalah L=-\sum_k y_k\log p_k. Implementasi menghindari penghitungan \exp z secara langsung, melainkan menggunakan trik log-sum-exp yang mengurangi logit maksimum — ini menghindari Eksponen yang meluap pada logit besar dan mengubah kerugian menjadi NaN. Untuk regresi, kesalahan kuadrat, yang sensitif terhadap outlier, bukanlah satu-satunya pilihan: kerugian Huber juga merupakan kandidat. Kerugian bukan hanya "ekspresi yang membuat angka menjadi kecil" — ini adalah spesifikasi tentang kesalahan operasional mana yang harus dihukum lebih berat.

Optimasi mini-batch memperkenalkan noise sampling. Pengoptimal adaptif seperti Adam dapat mempermudah pelatihan awal, tetapi laju pembelajaran, peluruhan bobot, ukuran batch, dan jadwal semuanya memengaruhi generalisasi. Memperbaiki seed acak saja tidak cukup ketika kernel GPU, urutan data, pra-pemrosesan, dan versi pustaka berbeda. Arsipkan data, kode, lingkungan, bobot, dan kode evaluasi sebagai satu rilis.

Membandingkan arsitektur umum

Arsitektur Kekuatan Input umum Kegagalan umum
MLP Sederhana untuk fitur dengan panjang tetap tabel dan fitur sensor mengabaikan struktur spasial atau temporal
CNN Memanfaatkan lokalitas gambar dan grid resolusi dan pergeseran akuisisi
Model RNN/ruang keadaan Mempertahankan keadaan yang terurut deret waktu dan audio ketergantungan dan inisialisasi jangka panjang
Transformer Pengkondisian jarak jauh teks, gambar, input multimodal komputasi, asal usul, output yang tidak didukung

Arsitektur yang lebih rumit tidak dapat memperbaiki label yang ambigu. Label kegagalan yang dibuat setelah pemeliharaan, misalnya, dapat memungkinkan bidang pasca-kejadian masuk ke pelatihan. Akurasi offline kemudian mengukur akses ke masa depan. Pelatihan dan penyajian harus berbagi kode fitur, dan setiap fitur harus diaudit ketersediaannya pada batas waktu prediksi.

Contoh kegagalan: ilusi akurasi tinggi

Pembagian gambar secara acak dapat menempatkan produk, latar belakang, atau bingkai video yang berdekatan yang sama di kedua set pelatihan dan pengujian. Jaringan kemudian menghafal kondisi akuisisi. Kebocoran serupa terjadi dengan rata-rata bergulir di masa mendatang, pasien atau mesin yang berulang, dan lokasi geografis yang berdekatan. Tahan periode mendatang, fasilitas independen, perangkat, atau entitas.

Kesalahan kedua adalah memperlakukan probabilitas sebagai keputusan. Skor 0,9 tidak secara otomatis Berbahaya. Periksa apakah contoh yang mendapat skor mendekati 0,9 bersifat positif pada frekuensi yang kurang lebih sama, kemudian pilih ambang batas dari biaya false-alarm, miss, dan review. Sediakan jalur abstain ketika kualitas input tidak memadai atau kasusnya di luar distribusi.

Prosedur Implementasi

  1. Tentukan waktu prediksi, populasi, label, batas latensi, dan biaya error.

  2. Bekukan pembagian berdasarkan entitas, waktu, dan lokasi; lakukan pra-pemrosesan hanya pada data pelatihan.

  3. Bandingkan model linier atau MLP kecil pada pembagian dan metrik yang sama.

  4. Log loss, learning rate, gradient norms, NaN, gap train-validation, dan performa slice.

  5. Suntikkan input missingness, noise, latensi, dan di luar distribusi; uji abstain dan rollback.

Jadikan gradien dapat diamati

Ketika pelatihan gagal, pertama-tama periksa data dan jalur gradien. Cobalah untuk mengingat satu batch kecil; kegagalan sering kali mengungkapkan label yang bergeser, mask yang salah, kesalahan dimensi, atau penyalahgunaan API loss. Kemudian rekam per lapisan. Aktivasi, norma gradien, dan magnitudo pembaruan. Nilai yang hilang di lapisan bawah menunjukkan kehilangan gradien, pertumbuhan tiba-tiba menunjukkan divergensi, dan pembaruan nol menunjukkan grafik yang terpisah atau parameter yang beku.

Inisialisasi bertujuan untuk menjaga varians sinyal tetap dapat digunakan di seluruh lapisan. Inisialisasi He adalah titik awal umum untuk keluarga ReLU dan inisialisasi Xavier untuk tanh, tetapi normalisasi dan koneksi residual mengubah perilaku sebenarnya. Pemotongan gradien adalah batas darurat, bukan cara untuk menyembunyikan kerugian yang salah bentuk atau penskalaan input. Dalam presisi campuran, bandingkan hasil float32 kecil dan pantau penskalaan kerugian, luapan, dan kekurangan.

Unit eksperimen yang adil

Bandingkan distribusi seed, kurva pembelajaran, dan anggaran komputasi daripada satu skor terbaik. Jumlah parameter yang sama tidak menciptakan perbandingan yang adil ketika pra-pemrosesan, pra-pelatihan, augmentasi, atau pasca-pemrosesan berbeda. Jangan pernah menyetel ulang ambang batas pada set pengujian. Untuk ketidakseimbangan, pertahankan metrik makro dan per kelas; ketika probabilitas mendorong keputusan, periksa juga kalibrasi.

Teramati Pola sehat Jika abnormal, periksa
Kerugian pelatihan/validasi keduanya menurun dengan celah yang stabil kebocoran, overfitting, entitas terpisah
Norma gradien terbatas tanpa lompatan tiba-tiba skala, inisialisasi, kerugian
Distribusi prediksi konsisten dengan tugas dan prevalensi pemetaan label, sumbu softmax, ambang batas
Latensi inferensi latensi ekor memenuhi tenggat waktu pemanasan, pengelompokan, pra/pasca-pemrosesan

Contoh kegagalan: kontaminasi validasi

Memilih arsitektur, augmentasi, dan seed setelah puluhan pemeriksaan validasi akan menyebabkan overfitting pada set validasi. Evaluasi set uji yang belum tersentuh sekali, dan catat jumlah pencarian dan aturan pemilihan. Pemisahan tingkat file masih tidak valid jika frame yang berdekatan dari satu video saling terpisah. Pisahkan berdasarkan entitas yang menentukan independensi: pasien, kendaraan, lot produksi, atau sesi perekaman.

Daftar periksa pra-deployment

  1. Bandingkan kasus representatif dengan perhitungan manual atau implementasi tepercaya.

  2. Otomatiskan 1. Uji overfitting batch kecil, gradien terbatas, dan uji kesetaraan simpan/muat ulang.

  3. Lakukan benchmarking model dasar, kandidat, dan terkuantisasi dengan input dan timer yang sama.

  4. Masukkan nilai penolakan dan perilaku fallback untuk input yang tidak valid, hilang, atau terlambat dalam kontrak API.

  5. Hubungkan model, data, commit kode, dependensi, dan evaluasi ke dalam satu catatan rilis.

Rekayasa jaringan saraf adalah pekerjaan untuk membuat jalur dari data ke keputusan dapat diukur. Tambahkan kompleksitas satu perubahan pada satu waktu sehingga peningkatan memiliki penjelasan dan insiden memiliki titik rollback yang diketahui.

Periksa pemahaman Anda
Apakah menambahkan lapisan selalu meningkatkan akurasi?

Data, optimasi, overfitting, dan komputasi juga penting. Kompleksitas tambahan membutuhkan bukti peningkatan pada data validasi.

What to read next

Review the backgroundPengantar Pembelajaran Mesin: Dasar-Dasar — Mendesain Data, Kerugian, dan GeneralisasiContinue the seriesPengantar Deteksi Objek & Segmentasi Semantik — Membaca "Apa dan Di Mana" dari Sebuah GambarExplore another aspect of this fieldTolok ukur LLM lokal: respons pertama, tingkat generasi, dan memori.