
76
2부MLOps적용방법
편향과 분산
편향도 높은 모델(과소적합
Underfitting
)은 학습 데이터에서 학습할 수 있는 규칙 중 일부를 찾아내
지 못할 수 있다. 이는 모델을 지나치게 단순화하는 축소 지향적 가정 때문에 발생한다.
반면 분산도 높은 모델(과대적합
Overfitting
)은 노이즈에서도 패턴을 찾고 모든 변화를 예측하려고
한다. 따라서 모델이 너무 복잡하여 학습 데이터와 조금이라도 다르면 예측에 실패할 수 있다.
실험할 때, 데이터 과학자는 [표
4
-
1
]에 설명된 모델 구성 요소에서 일어날 수 있는 모든 일을
빠르고 반복적으로 검토할 수 있어야 한다. 다행히도 이를 반자동으로 수행할 수 있는 도구가
있다. 사전 지식과 제약(예를 들어, 컴퓨팅 자원, 예산)에 따라 무엇을 테스트할지(발생 가능
영역을 지정한다) 정하면 된다.
어떤 도구는 더 고도화된 자동화도 지원하는데, 계층화된 모델 학습 기능이 그 예다. 예를 들
어, 사업부에서 제품 재고 최적화를 위해 고객의 요구를 예측하려고 한다고 하자. 하지만 고객
행동은 매장마다 다를 것이다. 계층화된 모델을 개발하게 되면 매장마다 모델을 개발하므로,
전체 매장을 예측하는 모델보다 각 매장에 대한 예측을 더 정확히 수행할 수 있을 것이다.
모든 하이퍼파라미터, 특성 등에 대한 조합 전체를 빠르게 ...