
256
살아 움직이는 머신러닝 파이프라인 설계
그림
9-6
텐서플로 서빙용 프로메테우스 지표 옵션
9.6
텐서플로 서빙과 쿠버네티스를 사용한 간편한 확장
지금까지 하나 이상의 모델 버전을 호스팅하는 단일 텐서플로 서빙 인스턴스의 배포에 대해 살
펴봤습니다. 이 솔루션은 많은 수의 배포에는 충분히 동작하지만, 많은 수의 예측 요청이 발
생하는 애플리케이션에는 충분하지 않습니다. 이런 때는 텐서플로 서빙을 포함한 단일 도커
컨테이너를 복제하여 추가 예측 요청에 응답해야 합니다. 컨테이너 복제의 오케스트레이션
orchestration
은 일반적으로 도커 군집이나 쿠버네티스와 같은 도구를 사용해 관리합니다. 쿠버네
티스를 자세히 소개하는 것은 이 책의 주제를 벗어납니다. 여기서는 쿠버네티스로 배포를 조정
하는 방법을 간략히 소개해 드리겠습니다.
다음 예에서는 쿠버네티스 클러스터가 실행 중이고 클러스터에 대한 액세스는
kubectl
을 통
해 수행된다고 가정합니다. 특정 도커 컨테이너를 구축하지 않고도 텐서플로 모델을 배포할 수
있으므로 이 예에서는 구글이 제공하는 도커 컨테이너를 재사용하고 원격 저장소 버킷에서 모
델을 로드하도록 쿠버네티스를 구성했습니다.
첫 번째 소스 코드 예제에서는 두 가지 측면을 강조합니다.