126
2부MLOps적용방법
위해구축한모델이최고의할인을최고의고객에게제안하고있었다면편향될것이다.선택편향은종종데
이터수집파이프라인자체에서비롯된다.와인예시에서알코올도수가
11
%이상인와인만으로구성한원본
데이터세트표본은확실히전체와인을대표하지않는다.이는표본이너무한쪽으로치우친것이다.알코올
도수가
11
%이상인와인표본몇개만두더라도가중치를조절하여상용환경에서입력되는데이터의분포에
가깝도록한다면편향성을완화할수있다.하지만이런작업은말로는쉽지만문제가되는특성을알수없거
나특성을알더라도가중치조절에사용할수없는경우가많다.
●
끊임없이 변화하는 환경:원천(
source
)모집단에서수집한학습데이터가대상(
target
)모집단을대표하지
않는경우다.사용사례예측과같이시간의존적이고계절적효과가강한작업에서자주발생한다.이런경우,
특정월에학습한모델이다른월에대해서는작동하지않을수있다.와인예시에서라면,원본데이터세트의
표본이특정연도의와인만포함하고있고해당연도가특히나품질이좋은(또는나쁜)빈티지와인의연도일
수있다.그러면이데이터로학습한모델은다른연도에는쓸수없다.
7.3.2
입력값 드리프트 감지 기법
여러 유형의 드리프트를 유발할 수 있는 상황을 이해했다면, 그다음으로 자연스럽게 나올 수
있는 질문은 ‘드리프트를 어떻게 감지할 수 있는가?’다. 여기서는