Contents — find the section you need

La capa l se puede escribir como h_{l+1}=\phi(W_lh_l+b_l). Sin la transformación no lineal \phi, las capas apiladas se reducen a una transformación lineal. El aprendizaje retropropaga el gradiente de la función de pérdida L y se actualiza mediante \theta\leftarrow\theta-\eta\nabla_\theta L.

Diagram 1 · Use the button to switch views
Forward and backward neural network flowInput passes through hidden layers to prediction and loss; gradients flow in reverse.input xhidden hprediction ŷloss L

Diagrama: Duskcoil, conceptual más que una arquitectura medida específica.

La activación, la normalización, las conexiones residuales y la atención modifican la representación y la optimización. El aumento de datos, la disminución de peso, la detención temprana y la división válida ayudan a monitorizar la generalización; una menor pérdida de entrenamiento no garantiza la seguridad. o equidad.

Elemento Rol Observar
Activación Agrega representación no lineal saturación y unidades muertas
Optimizador Actualiza parámetros a partir de gradientes tasa de aprendizaje y estabilidad numérica
Regularización Admite generalización no puede evitar la fuga de datos de prueba

Pérdidas, capas de salida y estabilidad numérica

Colocar softmax al final de un clasificador convierte la probabilidad de la clase k en p_k=\exp z_k/\sum_j\exp z_j. Con la etiqueta verdadera como one-hot y, la entropía cruzada es L=-\sum_k y_k\log p_k. Las implementaciones evitan calcular \exp z directamente, utilizando en su lugar un truco de log-sum-exp que resta el logit máximo; esto evita El exponente se desborda en logits grandes y convierte la pérdida en NaN. Para la regresión, el error cuadrático, sensible a los valores atípicos, no es la única opción: la pérdida de Huber también es una alternativa. Una pérdida no es simplemente "una expresión que reduce un número", sino una especificación de qué errores operacionales deben penalizarse con mayor severidad.

La optimización por minilotes introduce ruido de muestreo. Los optimizadores adaptativos como Adam pueden facilitar el entrenamiento inicial, pero la tasa de aprendizaje, la disminución de pesos, el tamaño del lote y la planificación afectan la generalización. Fijar una semilla aleatoria por sí sola no es suficiente cuando los kernels de la GPU, el orden de los datos, el preprocesamiento y las versiones de las bibliotecas difieren. Archivar datos, código, entorno, pesos y código de evaluación en una sola versión.

Comparación de arquitecturas comunes

Arquitectura Ventajas Entrada típica Fallos comunes
MLP Sencilla para características de longitud fija tablas y características de sensores descarta la estructura espacial o temporal
CNN Aprovecha la localidad imágenes y cuadrículas resolución y cambio de adquisición
Modelo RNN/espacio de estados Conserva el estado ordenado Series temporales y audio Dependencias e inicialización prolongadas
Transformador Acondicionamiento de largo alcance Texto, imágenes, entrada multimodal Computación, procedencia, salida no compatible

Una arquitectura más elaborada no puede corregir una etiqueta ambigua. Una etiqueta de fallo creada después del mantenimiento, por ejemplo, puede permitir que campos posteriores al evento entren en el entrenamiento. La precisión fuera de línea mide entonces el acceso al futuro. El entrenamiento y la implementación deben compartir el código de las características, y cada característica debe auditarse para comprobar su disponibilidad en la fecha límite de predicción.

Ejemplo de fallo: la ilusión de alta precisión

Dividir aleatoriamente las imágenes puede colocar el mismo producto, fondo o fotogramas de vídeo adyacentes tanto en los conjuntos de entrenamiento como de prueba. La red memoriza entonces las condiciones de adquisición. Se produce una fuga similar con promedios móviles futuros, pacientes o máquinas repetidos y ubicaciones geográficas vecinas. Se deben excluir periodos futuros, instalaciones, dispositivos o entidades independientes.

Un segundo error es tratar una probabilidad como una decisión. Una puntuación de 0,9 no es automáticamente peligrosa. Compruebe si los ejemplos con una puntuación cercana a 0,9 son positivos aproximadamente con esa frecuencia y, a continuación, Seleccione umbrales para los costos de falsa alarma, error y revisión. Proporcione una ruta de abstención cuando la calidad de la entrada sea inadecuada o el caso esté fuera de distribución.

Procedimiento de implementación

  1. Defina el tiempo de predicción, la población, la etiqueta, el límite de latencia y los costos de error.

  2. Congele las divisiones que tienen en cuenta la entidad, el tiempo y la ubicación; ajuste el preprocesamiento solo en los datos de entrenamiento.

  3. Compare un modelo lineal o una MLP pequeña con la misma división y métricas.

  4. Registre las pérdidas, la tasa de aprendizaje, las normas del gradiente, los NaN, las brechas de entrenamiento-validación y el rendimiento segmentado.

  5. Inyecte entradas faltantes, ruido, latencia y fuera de distribución; pruebe la abstención y la reversión.

Hacer observables los gradientes

Cuando el entrenamiento falla, primero inspeccione los datos y la ruta del gradiente. Intente memorizar un pequeño lote; el fallo a menudo revela etiquetas desplazadas, una máscara incorrecta, un error de dimensión o un uso incorrecto de la API de pérdida. Luego, registre las activaciones por capa, las normas del gradiente y actualice. Magnitudes. Los valores que desaparecen en las capas inferiores sugieren pérdida de gradiente, un crecimiento repentino sugiere divergencia y las actualizaciones nulas sugieren un grafo desconectado o un parámetro congelado.

La inicialización busca mantener la varianza de la señal utilizable entre capas. La inicialización He es un punto de partida común para las familias ReLU y la inicialización Xavier para tanh, pero la normalización y las conexiones residuales modifican el comportamiento real. El recorte de gradiente es un límite de emergencia, no una forma de ocultar una pérdida mal formada o un escalado de entrada incorrecto. Con precisión mixta, compare una pequeña ejecución float32 y supervise el escalado de la pérdida, el desbordamiento y el subdesbordamiento.

Una unidad de experimento justa

Compare las distribuciones de semillas, las curvas de aprendizaje y los presupuestos de cómputo en lugar de una única mejor puntuación. Un número igual de parámetros no permite una comparación justa cuando el preprocesamiento, el preentrenamiento, el aumento de datos o el posprocesamiento difieren. Nunca reajuste un umbral en el conjunto de prueba. Para el desequilibrio, conserve las métricas macro y por clase; cuando las probabilidades guían las decisiones, inspeccione también la calibración.

Observable Patrón saludable Si es anormal, inspeccione
Pérdida de entrenamiento/validación Ambas disminuyen con una brecha estable Fuga, sobreajuste, entidad dividida
Norma del gradiente Finita sin saltos abruptos Escala, inicialización, pérdida
Distribución de la predicción Consistente con la tarea y la prevalencia Mapeo de etiquetas, eje softmax, umbral
Latencia de inferencia La latencia de cola cumple con el plazo Calentamiento, procesamiento por lotes, preprocesamiento/posprocesamiento

Ejemplo de fallo: contaminación de la validación

Elegir arquitecturas, aumento de datos y semillas después de docenas de comprobaciones de validación sobreajusta el conjunto de validación. Evalúe un conjunto de prueba sin modificar una sola vez y registre el recuento de búsquedas y la regla de selección. La división a nivel de archivo sigue siendo inválida si los fotogramas adyacentes de un vídeo se dividen entre sí. Divida según la entidad que determina la independencia: paciente, vehículo, lote de producción o sesión de grabación.

Lista de verificación previa al despliegue

  1. Compare casos representativos con cálculos manuales o una implementación de confianza.

  2. Automatice el sobreajuste con lotes pequeños, el gradiente finito y la equivalencia de guardar/recargar. Pruebas.

  3. Comparar los modelos base, candidatos y cuantificados con la misma entrada y temporizador.

  4. Incluir valores de rechazo y comportamiento alternativo para entradas no válidas, faltantes o tardías en el contrato de la API.

  5. Vincular el modelo, los datos, la confirmación de código, las dependencias y la evaluación en un único registro de lanzamiento.

La ingeniería de redes neuronales consiste en hacer que el camino desde los datos hasta la decisión sea medible. Añadir complejidad mediante cambios graduales, de modo que cada mejora tenga una explicación y cada incidente tenga un punto de reversión conocido.

Comprueba tu comprensión
¿Añadir capas siempre mejora la precisión?

Los datos, la optimización, el sobreajuste y la capacidad de cálculo también son importantes. La complejidad añadida requiere evidencia de mejora en los datos de validación.

What to read next

Review the backgroundIntroducción al aprendizaje automático: Fundamentos — Diseño de datos, pérdida y generalizaciónContinue the seriesIntroducción a la detección de objetos y la segmentación semántica: Cómo interpretar "Qué hay dónde" a partir de una imagen.Explore another aspect of this fieldEvaluación comparativa de LLM locales: primera respuesta, tasa de generación y memoria.