108
살아 움직이는 머신러닝 파이프라인 설계
데이터 과학자는 텐서플로 태스크로 표현되는 전처리 단계에 오버헤드가 너무 많다고 생각할
수 있습니다. 결국 파이썬의 팬더스
Pandas
나 넘파이
Numpy
로 전처리하는 것과는 다른 방법이 필
요합니다. 실험 단계에서는
TFT
를 사용하지 않는 편이 좋습니다. 그러나 머신러닝 모델을 프
로덕션 환경으로 가져올 때 전처리 단계에 텐서플로 작업을 사용하면,
4
장에서 설명한 대로 학
습-서빙 왜곡을 방지할 수 있습니다. 다음 절에서 자세히 설명하겠습니다.
5.1
데이터 전처리의 필요성
TFT
는 텐서플로로 전처리 단계를 구현해야 하기 때문에
TFX
에서 가장 배우기 어려운 라이브
러리 중 하나입니다. 그러나
TFT
를 장착한 머신러닝 파이프라인에서 데이터 전처리를 표준화
해야 하는 이유는 다음과 같습니다.
●
전체 데이터셋의 콘텍스트에서 데이터를 효율적으로 전처리합니다.
●
전처리 단계를 효과적으로 확장합니다.
●
잠재적인 학습 -서빙 왜곡을 방지합니다.
5.1.1
전체 데이터셋 콘텍스트에서 데이터 전처리
데이터를 수치 표현으로 변환하려면 전체 데이터셋 콘텍스트에서 변환해야 할 때가 많습니다.
예를 들어 수치 형상을 정규화하려면 먼저 학습 데이터셋에서 형상의 최솟값과 최댓값을 결정
해야 합니다. 결정된 경계를 사용하여 데이터를
0
과
1
사이의 값으로 정규화할 수 있습니다.
이 정규화 단계에서는 두 번의 절차가 필요합니다. 즉, 첫 번째로 경계를 결정하고, 두 번째로
각 피처값을 변환합니다.
TFT
는 백그라운드에서 ...