
125
7장 모니터링과피드백루프
두 번째 데이터 세트에서는 맞지 않을 수 있다.
수학적으로 말하자면, 각 데이터 세트
1
의 표본은 동일한 분포로 추출되었다고 가정할 수 없다
(즉, 항등 분포
identically
distributed
가 아니다). 한편, 머신러닝 알고리즘이 예상한 대로 작동하도록
보장하려면 또 다른 수학적 속성인 독립성이 필요하다. 예를 들어, 표본이 데이터 세트 내에서
중복된 경우 혹은 이전 표본을 보면 ‘다음’ 표본을 예측할 수 있는 경우 이 속성은 깨진 것이다.
분명히 여러 문제가 발생할 수 있지만, 어쨌든 첫 번째 데이터 세트에서 알고리즘을 학습시킨
다음 배포하여 두 번째 데이터 세트를 입력받는다고 가정하자. 그 결과로 나타나는 분포의 이
동을 드리프트라고 한다. 만약 머신러닝 모델이 알코올 도수를 특성 중 하나로 활용한다면 (혹
은 알코올 도수가 모델의 다른 특성과 상관관계가 있다면) 특성 드리프트라 부르고, 그렇지 않
다면 개념 드리프트라 한다.
7.3
드리프트 감지
앞서 설명했듯이, 적시에 대응하려면 실측 데이터를 기다리지 않고 입력 데이터의 특성 값만
기반으로 하여 모델 작동을 모니터링해야 한다.
데이터 분포(예를 들어, 평균, 표준편차, 특성 간 상관관계)가 학습 및 테스트 단계에서는 이쪽
으로 쏠리고 개발 단계에는 저쪽으로 쏠릴 ...