33
1
장
머신러닝 파이프라인
1.2
머신러닝 파이프라인을 고려해야 할 시기
머신러닝 파이프라인은 다양한 이점을 제공하지만, 모든 데이터 과학 프로젝트에 필요하지는
않습니다. 데이터 과학자들은 때때로 단순히 새로운 모델을 실험하거나, 새로운 모델 아키텍처
를 조사하거나, 최신 논문을 재현합니다. 이런 때에는 파이프라인이 유용하지 않습니다. 그러
나 모델에 사용자가 있다면(예: 앱에서 사용 중) 지속적인 업데이트와 세부 조정을 해야 합니
다. 이런 상황에서는 모델을 지속적으로 업데이트하고 데이터 과학자의 작업의 부담을 줄여야
한다는 점에서 머신러닝 파이프라인이 유용합니다.
머신러닝 프로젝트의 수가 증가할수록 머신러닝 파이프라인이 더욱 중요해집니다. 데이터셋이
나 리소스 요구 사항이 크다면 앞에서 논의한 접근 방식을 사용해 인프라를 쉽게 확장할 수 있
습니다. 반복성이 중요할 때는 머신러닝 파이프라인의 자동화와 감사 추적을 통해 이를 제공합
니다.
1.3
머신러닝 파이프라인 단계
머신러닝 파이프라인은 새로운 학습 데이터 수집으로 시작하여 새로 학습된 모델이 어떻게 작
동하는지에 관한 피드백 받기로 끝납니다. 이 피드백은 프로덕션 성능 지표나 제품 사용자의
피드백일 수 있습니다. 파이프라인에는 데이터 전처리, 모델 학습과 모델 분석, 모델 배포 등
다양한 단계가 포함됩니다. 이런 단계를 수동으로 수행하기란 번거롭고 오류가 발생하기 쉽습
니다. 이 책에서는 머신러닝 파이프라인을 자동화하는 툴과 솔루션을 소개합니다.
[그림
1
-
1
]에서 볼 수 있듯이 파이프라인은 ...