Contents — find the section you need

머신러닝은 데이터를 기반으로 입력값 x을 예측값 \hat y=f_\theta(x)로 변환하는 함수를 조정하는 기술입니다. 중요한 것은 높은 정확도를 가진 모델의 이름이 아니라, 무엇을 예측할지 정의하고, 오류의 비용을 측정하는 방법, 그리고 배포 환경에서 동일한 조건을 유지할 수 있는지 여부입니다.

기본 원리 및 데이터 분할

훈련 세트에서 경험적 손실을 최소화합니다.

\hat\theta=\arg\min_\theta\frac1n\sum_{i=1}^n\ell(f_\theta(x_i),y_i)+\lambda\Omega(\theta).

교차 엔트로피는 분류의 경우, 제곱 오차는 회귀의 경우 대표 지표입니다. 중복 데이터와 미래 정보 유출을 방지하기 위해 엔티티, 비디오 또는 시간별로 훈련, 검증 및 최종 테스트 세트를 분할합니다. 테스트 세트를 살펴보고 설정을 조정하는 순간, 해당 세트는 검증 세트가 되어 더 이상 일반화 성능을 측정할 수 없게 됩니다.

Diagram 1 · Use the button to switch views
Machine learning lifecycleCollection, audit, training, evaluation, deployment, and monitoring form a feedback loop.collectaudit/splittrain/validatedeploy/evaluatemonitor

실패 원인 대응
학습 성공 과적합 또는 누출 감사 분할 및 정규화
배포 후 성능 저하 변화 입력 모니터링 및 재평가
불균등 오류 데이터 불균형 계층화된 평가 및 수집

평가 및 안전

드문 위험에 대해서는 정확도만으로는 불충분합니다. 정밀도, 재현율, 보정, 하위 그룹 성능, 지연 시간, 누락된 입력 및 분포 변화를 검사해야 합니다. 위험도가 높은 출력은 최종 결정권자가 되기보다는 담당자 또는 안전한 대안을 통해 검증해야 합니다.

이해력 점검
높은 학습 정확도가 실제 성능을 보장합니까?

측정 일반화는 별도로 수행합니다. 중복 대상이나 겹치는 기간으로 인한 데이터 유출을 방지하기 위해 배포 조건별로 데이터를 분할합니다.

참고 자료

문제 정의에서 특징 추출까지

"수요 예측"과 "이상 징후 감지"는 명확한 명세가 아닙니다. 누가, 어떤 정보가 어떤 마감 시점에 사용 가능한지, 마감일, 그리고 허용 가능한 오류를 정의해야 합니다. 목표 시점(t) 이후에 기록된 특징은 데이터 유출입니다. 전처리 통계, 결측치 대체, 어휘 학습은 훈련 데이터에만 적용해야 합니다. 표준화(x'=(x-\mu)/\sigma)는 훈련 데이터 분할에서 학습된 경우에만 유효합니다.

기준선은 중요합니다. 어제의 값, 규칙, 선형 회귀, 또는 복잡한 모델보다 성능이 떨어지는 작은 트리는 운영 비용을 정당화하지 못합니다. 특징 가용성, 지연 시간, 모델 크기 등을 비교해야 합니다. 유지 관리자 및 오류 복구 기능을 정확도와 동일한 표에 포함합니다.

일반화, 편향 및 변화

낮은 경험적 손실이 \mathbb E_{(x,y)\sim p_{deploy}}[\ell] 배포 분포에서 낮은 예상 손실을 의미하는 것은 아닙니다. 공변량 변화는 입력값을 변경하고, 개념 변화는 레이블 의미를 변경합니다. 계절, 하드웨어 개정, 운영 규칙, 사용자 행동 및 센서 오류는 이 두 가지 모두에 영향을 미칩니다. 고정된 단일 테스트 대신 시간, 지역, 속성 및 장치별로 계층화된 평가를 유지합니다.

평가 질문 놓치기 쉬움
정확도 전체적으로 몇 개가 맞습니까? 희귀 클래스 누락
정밀도/재현율 알림이 신뢰할 수 있고 포착됩니까? 임계값 비용
보정 확률이 빈도와 일치합니까? 높은 신뢰도 오류
시간 제한 미래에도 작동합니까? 계절 및 정책 변경
속성 분할 누가 오류를 받습니까? 소규모 샘플 불확실성

배포 및 오류 처리

배포 전에 입력 스키마를 검증합니다. 단위, 범위, 결측치, 특징 분포 등을 고려합니다. 사용 불가능한 출력이 발생할 경우 기존 예측, 규칙, 또는 담당자의 판단 중 어떤 방식으로 처리할지 결정합니다. 피드백 루프를 모니터링합니다. 권장 사항은 노출 수준을 변경하고, 탐지기는 검사 빈도를 변경하므로 새로운 데이터가 자연스럽게 샘플링되지 않습니다.

데이터 계약, 버전 관리 및 재현 가능한 학습, 섀도우 운영, 단계적 배포, 성능/공정성/지연 시간 모니터링, 즉시 롤백 기능을 활용합니다. 위험도가 높은 결정을 내릴 때는 모델을 최종 결정 기준으로 삼기보다는 담당자에게 증거, 신뢰도, 결측치 정보를 제시합니다.

  1. 예측 임계값 및 사용 가능한 특징을 감사합니다.

  2. 기준선 및 독립적인 테스트를 설정합니다.

  3. 지표를 오류 비용 및 안전 요구 사항에 매핑합니다.

  4. 결측 데이터, 변화, 적대적 입력을 테스트합니다.

  5. 운영에 모니터링 임계값, 중지, 재학습 승인 절차를 도입합니다.

  6. 데이터 세트용 데이터시트

  7. 모델 보고용 모델 카드 )

불확실성과 의사결정 분리

모델 확률은 행동이 아닙니다. 유지보수 알림의 경우, 임계값을 설정하기 전에 고장 확률을 정지 손실, 누락 손실 및 검사 비용에 매핑해야 합니다. 기본 고장률이 변경되면 최적의 임계값도 변경됩니다. 신뢰도 다이어그램과 브라이어 점수를 확인하고, 검증 데이터에만 플랫 또는 등척성 보정을 적용합니다. 보정기는 모델과 함께 버전 관리됩니다.

예측 구간과 앙상블 분산은 유용하지만 보장은 아닙니다. 분포 외 입력, 센서 오류 및 적대적 예제는 불확실성 추정 자체를 무너뜨릴 수 있습니다. 입력 유효성, 분포 외 입력 플래그, 신뢰도 및 비즈니스 규칙을 별도의 신호로 전달합니다. 이 중 하나라도 안전하지 않은 경우 사람의 검토를 거치거나 안전한 기본값을 선택합니다.

학습 방식 선택

방식 교사 정보 적합 사례 평가 경고
지도 학습 각 입력에 대한 레이블 명확한 분류/회귀 레이블 품질 및 누출
비지도 학습 일반적으로 레이블 없음 구조 및 이상 후보 클러스터링 후 의미를 부여하지 마십시오
자기 지도 학습 데이터 기반 프록시 작업 대규모 레이블 없는 코퍼스 다운스트림 평가 및 중복
준 지도 학습 적은 레이블과 레이블 없는 데이터 비용이 많이 드는 어노테이션 의사 레이블 오류 증폭
강화 학습 보상 및 상호 작용 순차적 결정 시뮬레이터 격차 및 안전한 탐색

레이블 추가 비용과 모델 복잡성 증가 비용을 비교하십시오. 비지도 클러스터는 자동으로 인간의 속성을 반영하지 않으며, 약한 의사 레이블은 편향을 증폭시킬 수 있습니다. 각 레이블을 누가, 언제, 어떤 절차로 측정했는지 추적하십시오.

실패 사례: 무작위 분할은 미래를 예측합니다

한 장비에서 겹치는 진동 윈도우를 무작위로 분할하면 학습 및 테스트에 거의 동일한 데이터가 포함됩니다. 고장 후 할당된 유지 보수 코드 또는 전체 기간에 걸쳐 계산된 평균값 또한 미래 정보를 유출합니다. 장비 ID와 시간을 기준으로 분할하고 예측 시점에 사용 가능한 기록에서 특징을 다시 계산하십시오. 낮지만 정직한 점수가 정보 유출로 인해 부풀려진 점수보다 실제 배포에 더 가깝습니다. 점수.

최소 구현 절차

  1. 사용자, 대상, 관찰 임계값, 조치 및 오류 비용을 하나의 명세표에 포함합니다.

  2. 출처, 동의/권한, 결측 사유, 단위, 빈도 및 레이블링 절차를 감사합니다.

  3. 코드에서 그룹/시간 분할을 수정하고 중복 해시 및 ID 교차를 자동으로 확인합니다.

  4. 규칙 및 단순 모델을 기준선으로 유지하고 조건부 신뢰 구간을 보고합니다.

  5. 전처리, 모델, 보정 및 임계값 설정을 하나의 파이프라인으로 저장하고 최종 데이터를 한 번만 평가합니다.

  6. 입력 품질, 지연 시간, 거부 및 하위 결과 모니터링을 통해 섀도우 배포, 제한적 배포 및 단계적 배포를 진행합니다.

  7. 재학습 트리거, 승인자, 롤백 버전, 사고 알림 및 서비스 종료 조건을 문서화합니다.

재학습은 자동적인 개선을 의미하지 않습니다. 동일한 고정 데이터 세트에서 기존 데이터와 새 데이터를 비교하고 새로운 기간 및 장치에 대한 챌린지 세트를 추가합니다. 성능, 통계적 불확실성, 계산 비용, 안전성 및 운영 부담을 종합적으로 검토합니다.

What to read next

Continue the series머신러닝 입문: 신경망 기초Explore another aspect of this field로컬 LLM 벤치마킹: 첫 응답, 생성 속도 및 메모리Explore another aspect of this field객체 탐지 및 의미론적 분할 기초 — 이미지에서 "무엇이 어디에 있는지" 파악하기