
35
1
장
머신러닝 파이프라인
터 과학자가 모델의 손실 함수를 조정하지 않거나
X
나
Y
범주를 과소 샘플링하지 않는다면,
모델 예측은 가장 수가 많이 존재하는 범주로 편향될 수 있습니다.
공통 데이터 검증 도구를 사용하여 다양한 데이터셋을 비교할 수도 있습니다. 클래스 간 데이
터의 수가 불균형한 데이터셋을 학습과 검증 집합으로 분할할 때는 두 데이터셋 간 레이블 분
포가 거의 동일한지 확인해야 합니다. 데이터 검증 도구를 사용하여 데이터셋을 비교하고 이상
징후를 강조할 수 있습니다.
검증에서 특이한 점이 발견되면 파이프라인을 중지하고 데이터 과학자에게 경고를 보낼 수 있
습니다. 데이터 과학자나 머신러닝 엔지니어는 데이터 드리프트가 감지되면 개별 클래스의 샘
플링을 변경하거나(예: 각 클래스에서 같은 수의 예만 선택) 모델의 손실 함수를 변경하고 새
모델 학습 파이프라인을 다시 시작할 수 있습니다.
1.3.3
데이터 전처리
새롭게 수집한 데이터를 그대로 사용하면 머신러닝 모델을 학습시키기 어렵습니다. 일반적으
로 모델 학습에 사용하려면 데이터를 전처리해야 합니다. 레이블은 원-핫 또는 멀티-핫 벡터
multi
-
hot
vector
1
로 변환해야 할 때가 많습니다. 모델 입력도 마찬가지입니다. 텍스트 데이터에서
모델을 학습할 때는 텍스트의 문자를 인덱스로 변환하거나 ...