
342
살아 움직이는 머신러닝 파이프라인 설계
빔 구성은 파이프라인 인스턴스화로 전달됩니다.
tmp_file_location = os.path.join(output_bucket, “tmp”)
beam_pipeline_args = [
“--runner=DataflowRunner”,
“--experiments=shuffle_mode=auto”,
“--project={}”.format(project_id),
“--temp_location={}”.format(tmp_file_location),
“--region={}”.format(gcp_region),
“--disk_size_gb=50”,
]
DataflowRunner
를
runner
유형으로 구성하고
shuffle
_
mode
를
auto
로 설정합니다. 이는
데이터플로의 흥미로운 기능입니다. 구글 컴퓨팅 엔진의
VM
에서
GroupByKey
와 같은 변환을
실행하는 대신 데이터플로의 서비스 백엔드에서 작업을 처리합니다. 따라서 컴퓨팅 인스턴스
의 실행 시간과
CPU
/메모리 비용이 줄어듭니다.
12.3.3
파이프라인 실행
구글 클라우드
AI
플랫폼으로 파이프라인을 실행하는 것은
12
.
2
절 ‘쿠브플로 파이프라인을 사
용한
TFX
파이프라인 조정’에서 살펴본 내용과 다르지 않습니다.
TFX
스크립트는
Argo
구성
을 생성합니다. ...