Contents — find the section you need

l katmanı h_{l+1}=\phi(W_lh_l+b_l) olarak yazılabilir. Doğrusal olmayan \phi olmadan, üst üste yığılmış katmanlar tek bir doğrusal dönüşüme indirgenir. Öğrenme, kayıp L'ün gradyanını geriye doğru yayar ve \theta\leftarrow\theta-\eta\nabla_\theta L aracılığıyla günceller.

Diagram 1 · Use the button to switch views
Forward and backward neural network flowInput passes through hidden layers to prediction and loss; gradients flow in reverse.input xhidden hprediction ŷloss L

Diyagram: Duskcoil, belirli bir ölçülmüş mimariden ziyade kavramsal bir yapı.

Aktivasyon, normalizasyon, artık Bağlantılar ve dikkat, temsil ve optimizasyonu değiştirir. Veri artırma, ağırlık azaltma, erken durdurma ve geçerli bölme, genellemenin izlenmesine yardımcı olur; daha düşük eğitim kaybı, güvenliği veya adaleti garanti etmez.

Eleman Rol İzlenecekler
Aktivasyon Doğrusal olmayan temsil ekler doygunluk ve ölü birimler
Optimize Edici Gradyanlardan parametreleri günceller öğrenme oranı ve sayısal kararlılık
Düzenleme Genellemeyi destekler test sızıntısını önleyemez

Kayıplar, çıktı katmanları ve sayısal kararlılık

Bir sınıflandırıcının sonuna softmax yerleştirmek, k sınıfının olasılığını p_k=\exp z_k/\sum_j\exp z_j'a dönüştürür. Gerçek etiket tekil kodlu y olduğunda, çapraz entropi L=-\sum_k y_k\log p_k . Uygulamalar, \exp z'yi doğrudan hesaplamaktan kaçınır ve bunun yerine maksimum logiti çıkaran bir log-toplam-üs alma yöntemi kullanır; bu, büyük logitlerde üssün taşmasını ve kaybın NaN'ye dönüşmesini önler. Regresyon için, aykırı değerlere duyarlı olan karesel hata tek seçenek değildir: Huber kaybı da bir adaydır. Kayıp sadece "bir sayıyı küçülten bir ifade" değildir; hangi operasyonel hataların daha ağır cezalandırılması gerektiğinin bir belirtimidir.

Mini-batch optimizasyonu örnekleme gürültüsüne neden olur. Adam gibi adaptif optimizasyon algoritmaları ilk eğitimi kolaylaştırabilir, ancak öğrenme oranı, ağırlık azalması, batch boyutu ve zamanlama genelleme üzerinde etkilidir. GPU çekirdekleri, veri sırası, ön işleme ve kütüphane sürümleri farklı olduğunda, yalnızca rastgele bir tohum belirlemek yeterli değildir. Verileri, kodu, ortamı, ağırlıkları ve değerlendirme kodunu tek bir sürüm olarak arşivleyin.

Yaygın mimarilerin karşılaştırılması

Mimari Güçlü Yönler Tipik girdi Yaygın hata
MLP Sabit uzunluktaki özellikler için basit tablolar ve sensör özellikleri uzamsal veya zamansal yapıyı göz ardı eder
CNN Yerelliği kullanır görüntüler ve ızgaralar çözünürlük ve edinim kayması
RNN/durum uzayı modeli Sıralı durumu korur zaman serileri ve ses uzun bağımlılıklar ve başlatma
Transformer Uzun menzilli koşullandırma metin, görüntüler, çok modlu girdi hesaplama, kaynak, desteklenmeyen çıktı

Daha karmaşık bir mimari, belirsiz bir etiketi onaramaz. Örneğin, bakım sonrasında oluşturulan bir hata etiketi, olay sonrası alanların eğitime girmesine izin verebilir. Çevrimdışı doğruluk daha sonra geleceğe erişimi ölçer. Eğitim ve sunum, özellik kodunu paylaşmalı ve her özellik, tahmin son tarihine kadar kullanılabilirlik açısından denetlenmelidir.

Hata örneği: yüksek doğruluk yanılsaması

Görüntülerin rastgele bölünmesi, aynı ürünü, arka planı veya bitişik video karelerini hem eğitim hem de test kümelerine yerleştirebilir. Ağ daha sonra edinim koşullarını ezberler. Benzer sızıntı, gelecekteki yuvarlanan ortalamalar, tekrarlanan hastalar veya makineler ve komşu görüntülerle de meydana gelir. Coğrafi konumlar. Gelecek dönemleri, bağımsız tesisleri, cihazları veya varlıkları dışarıda bırakın.

İkinci bir hata, olasılığı bir karar olarak ele almaktır. 0,9 puan otomatik olarak tehlikeli değildir. 0,9'a yakın puan alan örneklerin yaklaşık olarak bu sıklıkta pozitif olup olmadığını kontrol edin, ardından yanlış alarm, kaçırma ve inceleme maliyetlerinden eşikler seçin. Giriş kalitesi yetersiz olduğunda veya vaka dağılım dışında olduğunda bir kaçınma yolu sağlayın.

Uygulama prosedürü

  1. Tahmin süresini, popülasyonu, etiketi, gecikme sınırını ve hata maliyetlerini tanımlayın.

  2. Varlık, zaman ve konum farkındalıklı bölmeleri dondurun; ön işlemeyi yalnızca eğitim verilerine uygulayın.

  3. Aynı bölme ve metrikler üzerinde doğrusal bir model veya küçük bir MLP ile karşılaştırın.

  4. Kayıpları, öğrenme oranını, gradyan normlarını, NaN'leri, eğitim-doğrulama boşluklarını ve dilimlenmiş performansı kaydedin.

  5. Eksiklik, gürültü, gecikme ve dağılım dışı girdileri ekleyin; kaçınma ve geri alma işlemlerini test edin.

Gradyanları gözlemlenebilir hale getirin

Ne zaman Eğitim başarısız olursa, öncelikle verileri ve gradyan yolunu inceleyin. Küçük bir veri kümesini ezberlemeye çalışın; başarısızlık genellikle kaymış etiketleri, yanlış maskeyi, boyut hatasını veya kayıp API'sinin yanlış kullanımını ortaya çıkarır. Ardından katman başına aktivasyonları, gradyan normlarını ve güncelleme büyüklüklerini kaydedin. Alt katmanlardaki kaybolan değerler gradyan kaybını, ani büyüme ıraksamayı ve sıfır güncellemeler ise ayrılmış bir grafiği veya donmuş bir parametreyi gösterir.

Başlangıç, sinyal varyansının katmanlar arasında kullanılabilir kalmasını amaçlar. He başlatma, ReLU aileleri için yaygın bir başlangıç noktasıdır ve tanh için Xavier başlatma kullanılır, ancak normalleştirme ve artık bağlantılar gerçek davranışı değiştirir. Gradyan kırpma, hatalı kayıp veya girdi ölçeklendirmesini gizlemenin bir yolu değil, acil bir sınırdır. Karışık hassasiyet altında, küçük bir float32 çalıştırmasını karşılaştırın ve kayıp ölçeklendirmesini, taşmayı ve yetersiz akışı izleyin.

Adil bir deney birimi

Tek bir en iyi skor yerine tohum dağılımlarını, öğrenme eğrilerini ve hesaplama bütçelerini karşılaştırın. Eşit parametre sayıları, ön işleme, ön eğitim sırasında adil bir karşılaştırma oluşturmaz. Veri artırma veya son işlem farklı olabilir. Test kümesinde eşik değerini asla yeniden ayarlamayın. Dengesizlik durumunda, makro ve sınıf başına metrikleri koruyun; olasılıklar kararları yönlendiriyorsa, kalibrasyonu da inceleyin.

Gözlemlenebilir Sağlıklı model Anormal ise inceleyin
eğitim/doğrulama kaybı her ikisi de istikrarlı bir aralıkla azalır sızıntı, aşırı uyum, bölünmüş varlık
gradyan normu ani sıçramalar olmadan sonlu ölçek, başlatma, kayıp
tahmin dağılımı görev ve yaygınlıkla tutarlı etiket eşleme, softmax ekseni, eşik
çıkarım gecikmesi kuyruk gecikmesi son teslim tarihine uyar ısınma, gruplandırma, ön/son işlem

Başarısızlık örneği: doğrulama kirlenmesi

Onlarca doğrulama kontrolünden sonra mimarileri, veri artırmayı ve tohumları seçmek, doğrulama kümesine aşırı uyum sağlar. Dokunulmamış bir test kümesini bir kez değerlendirin ve arama sayısını ve seçim kuralını kaydedin. Bir videodan bitişik kareler kesişiyorsa, dosya düzeyinde bölme hala geçersizdir. Bölmeler. Bağımsızlığı belirleyen varlığa göre bölün: hasta, araç, üretim partisi veya kayıt oturumu.

Dağıtım Öncesi Kontrol Listesi

  1. Temsili vakaları el hesaplamalarıyla veya güvenilir bir uygulamayla karşılaştırın.

  2. Küçük parti aşırı uyum, sonlu gradyan ve kaydetme/yeniden yükleme eşdeğerlik testlerini otomatikleştirin.

  3. Temel, aday ve nicelleştirilmiş modelleri aynı girdi ve zamanlayıcıyla karşılaştırın.

  4. Geçersiz, eksik veya geç girdiler için reddetme değerlerini ve geri dönüş davranışını API sözleşmesine ekleyin.

  5. Model, veri, kod taahhüdü, bağımlılıklar ve değerlendirmeyi tek bir sürüm kaydına bağlayın.

Sinir ağı mühendisliği, veriden karara giden yolu ölçülebilir hale getirme işidir. Bir iyileştirmenin bir açıklaması ve bir olayın bilinen bir geri alma noktası olması için karmaşıklığı birer birer ekleyin.

Anlayışınızı kontrol edin
Katman eklemek her zaman doğruluğu artırır mı?

Veri, optimizasyon, aşırı uyum ve hesaplama da önemlidir. Eklenen karmaşıklık, doğrulama verilerinde iyileşme kanıtı gerektirir.

What to read next

Review the backgroundMakine Öğrenimine Giriş: Temeller — Veri, Kayıp Fonksiyonu ve Genelleme TasarımıContinue the seriesNesne Algılama ve Semantik Bölümleme Temel Bilgileri — Bir Görüntüden "Nerede Ne Var"ı OkumaExplore another aspect of this fieldYerel LLM'lerin performans testleri: ilk yanıt süresi, üretim hızı ve bellek