133
7장 모니터링과피드백루프
평가할 데이터 세트를 선택하는 것이 중요하다. 모델 성능에 대해 신뢰성 있는 추정을 할 수 있
을 만큼 레이블된 새 데이터가 충분히 있는 경우, 상용 환경에서 입력될 것으로 예상되는 데이
터에 가장 가깝기 때문에 이 데이터 세트가 선호된다. 그렇지 않으면, 배포된 모델의 원본 테스
트 데이터 세트를 사용할 수 있다. 데이터가 드리프트되지 않았다고 가정하면, 후보 모델의 성
능을 원본 모델과 비교한 결과의 구체적인 수준을 대략적으로라도 확인할 수 있다.
최적의 후보 모델을 파악했더라도 아직 완료된 상태는 아니다. 실제로는 모델의 오프라인 성능
과 온라인 성능 사이에 상당한 차이가 발생하곤 한다. 따라서 테스트를 상용 환경에서 진행하
는 것이 매우 중요하다. 이 온라인 평가를 통해 실제 데이터에 직면했을 때 후보 모델의 작동에
대한 가장 실제에 가까운 피드백을 얻을 수 있다.
7.4.3
온라인 평가
상용 배포된 모델에 대한 온라인 평가는 비즈니스 관점에서 중요하지만 기술적 관점에서는 어
려울 수 있다. 온라인 평가에는 다음과 같은 두 가지 방식을 주로 사용한다.
●
챔피언/챌린저(섀도우 테스트라고도 함)
후보모델이배포된모델의뒤에섀도우처럼숨어서동일한실시간요청을스코어링한다.
●
A
/
B
테스트
후보모델이실시간요청의일부를스코어링하고배포된모델은그외나머지요청을스코어링한다.
두 테스트 모두 실측 데이터를 요구하므로, 평가는 예측을 실행한 시점과 실측 데이터를 획득
한 시점 사이에 ...