119
7장 모니터링과피드백루프
음성 인식 모델은 어떻게 반응할까?
비용
cost
조직은 재학습 비용을 들일 만큼 성능을 개선할 가치가 있는지 고려해야 한다. 예를 들어 전체
데이터 파이프라인을 실행하고 모델을 재학습시키는 데 일주일이 걸린다 하더라도 아주 조금
이나마 개선할 가치가 있는가?
모델 성능
model
performance
어떤 경우에는 학습 데이터의 수량에 한계가 있어 모델 성능에 제한이 있을 수 있다. 이런 경
우, 재학습 여부는 새 데이터를 충분히 수집했는가에 달려 있다.
도메인이 어느 분야이든, 실측 데이터를 얻기 위해 필요한 시간이 최소 재학습 기간을 정하는
핵심이다. 예측 시점과 실측 데이터 입수 시점 사이의 지연시간보다 더 빠르게 변화될(드리프
트가 발생할) 가능성이 있다면, 해당 예측 모델을 사용하는 것은 매우 위험하다. 왜냐하면, 이
런 경우에는 드리프트에 대응하여 모델을 재학습시킬 수 없으므로 모델을 중지시키는 것 외에
는 다른 방안이 없어 나쁜 결과를 보일 수밖에 없기 때문이다. 즉, 실측 데이터 획득에
1
년의
지연이 있는 모델은
1
년에 몇 번 밖에 재학습시킬 수 없다.
같은 이유로, 이 지연시간보다 더 짧은 기간 동안 수집한 데이터로는 모델을 학습해봐야 소용
없다. 즉, 재학습 주기는 지연시간보다 더 짧아질 수 없다. 모델 재학습을 지연시간보다 훨씬
더 자주 해본들 모델의 성능에 미치는 영향은 미미할 것이다.
조직 관점에서 재학습 빈도와 관련하여 고려해야 할 두 가지 경계가 있다.
상위 경계
upper
bound
매년 ...