Contents — find the section you need
l katmanı h_{l+1}=\phi(W_lh_l+b_l) olarak yazılabilir. Doğrusal olmayan \phi olmadan, üst üste yığılmış katmanlar tek bir doğrusal dönüşüme indirgenir. Öğrenme, kayıp L'ün gradyanını geriye doğru yayar ve \theta\leftarrow\theta-\eta\nabla_\theta L aracılığıyla günceller.
Diyagram: Duskcoil, belirli bir ölçülmüş mimariden ziyade kavramsal bir yapı.
Aktivasyon, normalizasyon, artık Bağlantılar ve dikkat, temsil ve optimizasyonu değiştirir. Veri artırma, ağırlık azaltma, erken durdurma ve geçerli bölme, genellemenin izlenmesine yardımcı olur; daha düşük eğitim kaybı, güvenliği veya adaleti garanti etmez.
| Eleman | Rol | İzlenecekler |
|---|---|---|
| Aktivasyon | Doğrusal olmayan temsil ekler | doygunluk ve ölü birimler |
| Optimize Edici | Gradyanlardan parametreleri günceller | öğrenme oranı ve sayısal kararlılık |
| Düzenleme | Genellemeyi destekler | test sızıntısını önleyemez |
Kayıplar, çıktı katmanları ve sayısal kararlılık
Bir sınıflandırıcının sonuna softmax yerleştirmek, k sınıfının olasılığını p_k=\exp z_k/\sum_j\exp z_j'a dönüştürür. Gerçek etiket tekil kodlu y olduğunda, çapraz entropi L=-\sum_k y_k\log p_k . Uygulamalar, \exp z'yi doğrudan hesaplamaktan kaçınır ve bunun yerine maksimum logiti çıkaran bir log-toplam-üs alma yöntemi kullanır; bu, büyük logitlerde üssün taşmasını ve kaybın NaN'ye dönüşmesini önler. Regresyon için, aykırı değerlere duyarlı olan karesel hata tek seçenek değildir: Huber kaybı da bir adaydır. Kayıp sadece "bir sayıyı küçülten bir ifade" değildir; hangi operasyonel hataların daha ağır cezalandırılması gerektiğinin bir belirtimidir.
Mini-batch optimizasyonu örnekleme gürültüsüne neden olur. Adam gibi adaptif optimizasyon algoritmaları ilk eğitimi kolaylaştırabilir, ancak öğrenme oranı, ağırlık azalması, batch boyutu ve zamanlama genelleme üzerinde etkilidir. GPU çekirdekleri, veri sırası, ön işleme ve kütüphane sürümleri farklı olduğunda, yalnızca rastgele bir tohum belirlemek yeterli değildir. Verileri, kodu, ortamı, ağırlıkları ve değerlendirme kodunu tek bir sürüm olarak arşivleyin.
Yaygın mimarilerin karşılaştırılması
| Mimari | Güçlü Yönler | Tipik girdi | Yaygın hata |
|---|---|---|---|
| MLP | Sabit uzunluktaki özellikler için basit | tablolar ve sensör özellikleri | uzamsal veya zamansal yapıyı göz ardı eder |
| CNN | Yerelliği kullanır | görüntüler ve ızgaralar | çözünürlük ve edinim kayması |
| RNN/durum uzayı modeli | Sıralı durumu korur | zaman serileri ve ses | uzun bağımlılıklar ve başlatma |
| Transformer | Uzun menzilli koşullandırma | metin, görüntüler, çok modlu girdi | hesaplama, kaynak, desteklenmeyen çıktı |
Daha karmaşık bir mimari, belirsiz bir etiketi onaramaz. Örneğin, bakım sonrasında oluşturulan bir hata etiketi, olay sonrası alanların eğitime girmesine izin verebilir. Çevrimdışı doğruluk daha sonra geleceğe erişimi ölçer. Eğitim ve sunum, özellik kodunu paylaşmalı ve her özellik, tahmin son tarihine kadar kullanılabilirlik açısından denetlenmelidir.
Hata örneği: yüksek doğruluk yanılsaması
Görüntülerin rastgele bölünmesi, aynı ürünü, arka planı veya bitişik video karelerini hem eğitim hem de test kümelerine yerleştirebilir. Ağ daha sonra edinim koşullarını ezberler. Benzer sızıntı, gelecekteki yuvarlanan ortalamalar, tekrarlanan hastalar veya makineler ve komşu görüntülerle de meydana gelir. Coğrafi konumlar. Gelecek dönemleri, bağımsız tesisleri, cihazları veya varlıkları dışarıda bırakın.
İkinci bir hata, olasılığı bir karar olarak ele almaktır. 0,9 puan otomatik olarak tehlikeli değildir. 0,9'a yakın puan alan örneklerin yaklaşık olarak bu sıklıkta pozitif olup olmadığını kontrol edin, ardından yanlış alarm, kaçırma ve inceleme maliyetlerinden eşikler seçin. Giriş kalitesi yetersiz olduğunda veya vaka dağılım dışında olduğunda bir kaçınma yolu sağlayın.
Uygulama prosedürü
-
Tahmin süresini, popülasyonu, etiketi, gecikme sınırını ve hata maliyetlerini tanımlayın.
-
Varlık, zaman ve konum farkındalıklı bölmeleri dondurun; ön işlemeyi yalnızca eğitim verilerine uygulayın.
-
Aynı bölme ve metrikler üzerinde doğrusal bir model veya küçük bir MLP ile karşılaştırın.
-
Kayıpları, öğrenme oranını, gradyan normlarını, NaN'leri, eğitim-doğrulama boşluklarını ve dilimlenmiş performansı kaydedin.
-
Eksiklik, gürültü, gecikme ve dağılım dışı girdileri ekleyin; kaçınma ve geri alma işlemlerini test edin.
Gradyanları gözlemlenebilir hale getirin
Ne zaman Eğitim başarısız olursa, öncelikle verileri ve gradyan yolunu inceleyin. Küçük bir veri kümesini ezberlemeye çalışın; başarısızlık genellikle kaymış etiketleri, yanlış maskeyi, boyut hatasını veya kayıp API'sinin yanlış kullanımını ortaya çıkarır. Ardından katman başına aktivasyonları, gradyan normlarını ve güncelleme büyüklüklerini kaydedin. Alt katmanlardaki kaybolan değerler gradyan kaybını, ani büyüme ıraksamayı ve sıfır güncellemeler ise ayrılmış bir grafiği veya donmuş bir parametreyi gösterir.
Başlangıç, sinyal varyansının katmanlar arasında kullanılabilir kalmasını amaçlar. He başlatma, ReLU aileleri için yaygın bir başlangıç noktasıdır ve tanh için Xavier başlatma kullanılır, ancak normalleştirme ve artık bağlantılar gerçek davranışı değiştirir. Gradyan kırpma, hatalı kayıp veya girdi ölçeklendirmesini gizlemenin bir yolu değil, acil bir sınırdır. Karışık hassasiyet altında, küçük bir float32 çalıştırmasını karşılaştırın ve kayıp ölçeklendirmesini, taşmayı ve yetersiz akışı izleyin.
Adil bir deney birimi
Tek bir en iyi skor yerine tohum dağılımlarını, öğrenme eğrilerini ve hesaplama bütçelerini karşılaştırın. Eşit parametre sayıları, ön işleme, ön eğitim sırasında adil bir karşılaştırma oluşturmaz. Veri artırma veya son işlem farklı olabilir. Test kümesinde eşik değerini asla yeniden ayarlamayın. Dengesizlik durumunda, makro ve sınıf başına metrikleri koruyun; olasılıklar kararları yönlendiriyorsa, kalibrasyonu da inceleyin.
| Gözlemlenebilir | Sağlıklı model | Anormal ise inceleyin |
|---|---|---|
| eğitim/doğrulama kaybı | her ikisi de istikrarlı bir aralıkla azalır | sızıntı, aşırı uyum, bölünmüş varlık |
| gradyan normu | ani sıçramalar olmadan sonlu | ölçek, başlatma, kayıp |
| tahmin dağılımı | görev ve yaygınlıkla tutarlı | etiket eşleme, softmax ekseni, eşik |
| çıkarım gecikmesi | kuyruk gecikmesi son teslim tarihine uyar | ısınma, gruplandırma, ön/son işlem |
Başarısızlık örneği: doğrulama kirlenmesi
Onlarca doğrulama kontrolünden sonra mimarileri, veri artırmayı ve tohumları seçmek, doğrulama kümesine aşırı uyum sağlar. Dokunulmamış bir test kümesini bir kez değerlendirin ve arama sayısını ve seçim kuralını kaydedin. Bir videodan bitişik kareler kesişiyorsa, dosya düzeyinde bölme hala geçersizdir. Bölmeler. Bağımsızlığı belirleyen varlığa göre bölün: hasta, araç, üretim partisi veya kayıt oturumu.
Dağıtım Öncesi Kontrol Listesi
-
Temsili vakaları el hesaplamalarıyla veya güvenilir bir uygulamayla karşılaştırın.
-
Küçük parti aşırı uyum, sonlu gradyan ve kaydetme/yeniden yükleme eşdeğerlik testlerini otomatikleştirin.
-
Temel, aday ve nicelleştirilmiş modelleri aynı girdi ve zamanlayıcıyla karşılaştırın.
-
Geçersiz, eksik veya geç girdiler için reddetme değerlerini ve geri dönüş davranışını API sözleşmesine ekleyin.
-
Model, veri, kod taahhüdü, bağımlılıklar ve değerlendirmeyi tek bir sürüm kaydına bağlayın.
Sinir ağı mühendisliği, veriden karara giden yolu ölçülebilir hale getirme işidir. Bir iyileştirmenin bir açıklaması ve bir olayın bilinen bir geri alma noktası olması için karmaşıklığı birer birer ekleyin.
- NIST Yapay Zeka Risk Yönetimi Çerçevesi
- Google Makine Öğrenmesi Kuralları
- PyTorch Tekrarlanabilirlik Notları
- NIST AI 100-1
Katman eklemek her zaman doğruluğu artırır mı?
Veri, optimizasyon, aşırı uyum ve hesaplama da önemlidir. Eklenen karmaşıklık, doğrulama verilerinde iyileşme kanıtı gerektirir.
Yorumlar
Lütfen önce giriş yapın.
Henüz veri yok.