52
1부MLOps개념과필요성
있다. 이는 전통적 소프트웨어에서는 당면하기 힘든 문제이지만, 머신러닝에서는 태생적으로
내재된 문제에 해당한다. 머신러닝에서는 수학을 활용하여 학습 데이터 내의 중요한 패턴을 간
결한 형태로 구성하여, 현실 세계를 잘 반영하려고 한다. 학습 데이터가 현실 세계를 잘 반영하
고 있다면, 모델은 정확하고 효과적일 수밖에 없다.
하지만 현실 세계는 계속 변화한다.
6
개월 전에 이상 거래 탐지 모델 구축 시 사용한 학습 데이
터는 최근
3
개월 내에 발생하기 시작한 새로운 형태의 사기를 반영하지 않는다. 만약 어떤 웹
사이트에 점점 젊은 고객이 인입된다면, 과거에 학습한 광고 생성 모델은 점점 고객과 관련성
이 떨어지는 광고를 선택할 것이다. 어느 순간, 성능이 너무 낮아 모델 재학습을 해야 하는 시
점에 도달할 것이다. 얼마나 자주 모델을 재학습시켜야 하는가는 얼마나 빨리 현실 세계가 변
하고 모델은 얼마나 정확해야 하는가에 달려 있다. 물론 더 나은 모델을 구축하고 배포하는 일
이 얼마나 쉬운가도 중요한 요소다.
어쨌든, 데이터 과학자는 모델의 성능이 떨어지고 있다는 이야기를 어떤 방식으로 할 수 있는
가? 쉽지 않은 문제다. 일반적인 방법으로 두 가지가 있는데, 하나는 실측 데이터
Ground
truth
기
반이고 다른 하나는 입력값 드리프트
Input
drift
다.
실측 데이터
간단히 말해, 실측 데이터는 모델이 풀어야 하는 질문에 대한 정답이다. 예를 들어, “이 신용카
드 거래는 실제로 사기를 당한 것인가?”와 ...