
56
1부MLOps개념과필요성
면, 통계적으로 결과를 비교한다. 또한 섀도우 스코어링
Shadow
Scoring
으로 직무 전문가에게 모델
의 새 버전에 대한 향상된 가시성을 제공할 수 있고, 더 원활하게 버전 간 전환을 수행할 수 있다.
앞에서 제시한 광고 생성 모델 예의 경우, 최종 사용자가 광고를 클릭하기 전까지는 모델이 선
정한 광고가 효과가 있는지 없는지 판단할 수 없다. 이런 경우, 섀도우 테스트는 제한된 효과를
보일 수 있어
A
/
B
테스트를 하는 게 더 낫다.
A
/
B
테스트에서는 기존 모델과 새 모델을 모두 라이브 환경에 배포한다. 하지만 입력값인 요청
을 두 모델에 나눠서 전달한다. 각 요청은 기존 모델 혹은 새 모델에서 처리하고, 양쪽 모두에서
처리하지는 않는다. 그리고 각각에서 생성한 결과는 분석을 위해 로그에 기록한다.
A
/
B
테스트
를 통해 통계적으로 의미 있는 결과를 끌어내기 위해서는 테스트를 신중하게 설계해야 한다.
A
/
B
테스트 방법은
7
장에서 상세히 다루므로 여기서는 맛보기로 간단히 설명하겠다.
A
/
B
테
스트의 가장 단순한 형태는 고정된 예측 범위 테스트
fixed
-
horizon
test
다. 통계적으로 의미 있는 결
론에 도달하기 위해서 사전에 주의 깊게 정의한 표본의 수량만큼 테스트되기를 기다리기만 하
면 되기 때문이다. 테스트가 ...