Skip to Content
데이터 및 머신러닝 플랫폼 아키텍처 설계
book

데이터 및 머신러닝 플랫폼 아키텍처 설계

by Marco Tranquillin, Valliappa Lakshmanan, Firat Tekiner
May 2025
Beginner to intermediate
362 pages
5h 41m
Korean
O'Reilly Media, Inc.
Content preview from 데이터 및 머신러닝 플랫폼 아키텍처 설계

11장. ML 플랫폼 설계

이 작품은 AI를 사용하여 번역되었습니다. 여러분의 피드백과 의견을 환영합니다: translation-feedback@oreilly.com

이전 장에서는 ML 애플리케이션의 전반적인 아키텍처와 대부분의 경우 미리 빌드된 ML 모델을 사용하게 된다는 점에 대해 설명했습니다. 경우에 따라서는 팀이 ML 애플리케이션의 핵심이 되는 ML 모델을 직접 개발해야 할 수도 있습니다.

이 장에서는 이러한 사용자 지정 ML 모델의 개발 및 배포에 대해 자세히 살펴봅니다. ML 모델 개발의 단계와 이러한 개발을 지원하는 프레임워크를 살펴봅니다. 모델이 생성된 후에는 이러한 전환에 도움이 되는 도구와 제품을 살펴봄으로써 학습 프로세스를 자동화해야 합니다. 마지막으로, 엔드포인트에 배포된 학습된 모델의 동작을 모니터링하여 추론할 때 드리프트가 발생하지 않는지 확인해야 합니다.

이전 장에서는 데이터 플랫폼의 다양한 부분에서 지원되는 ML 기능에 대해 설명했습니다. 구체적으로, ML 플랫폼의 데이터 스토리지는 데이터 레이크(5장) 또는 DWH(6장)에 있을 수 있고, 학습은 해당 스토리지에 효율적인 컴퓨팅에서 수행되며, 추론은 스트리밍 파이프라인(8장)에서 호출되거나 엣지에 배포될 수 있습니다(9장). 이 장에서는 이러한 모든 논의를 종합하여 이러한 ML 기능에 무엇이 들어가는지 살펴보겠습니다.

ML 활동

맞춤형 ML 모델 개발을 지원하기 위해 ML 플랫폼을 구축하는 경우, 어떤 활동을 지원해야 할까요? 데이터 과학자와 ML 엔지니어가 플랫폼에서 수행할 수 있어야 하는 많은 활동을 고려하지 않고 바로 ML 프레임워크로 넘어가는 아키텍트를 너무 자주 봅니다("우리 데이터 과학자들이 사용하는 것이 XGBoost와 PyTorch이므로 이를 지원해야 합니다").

일반적으로 ML 플랫폼은 그림 11-1의 활동을 지원해야 합니다.

Activities that an ML platform needs to support
그림 11-1. ML 플랫폼이 지원해야 하는 활동

원시 데이터를 정리하고 처리하여 ML에 더 적합하게 만들고 그 결과 학습된 모델을 더 정확하게 만들 수 있도록 해야 합니다. 데이터를 준비하려면 탐색적 데이터 분석을 통해 데이터를 조사하고, 분포를 플로팅하고, 뉘앙스를 연구해야 합니다. 그런 다음, 데이터의 하위 집합에 대해 ML 모델을 학습시키고 다른 하위 집합을 사용하여 평가합니다. 이를 바탕으로 데이터 과학자는 데이터 준비 또는 모델링 단계를 변경합니다. 이 과정은 반복적이며 일반적으로 많은 실험을 수반합니다.

모델 학습이 완료되면 테스트 데이터와 비교하여 평가하고 규정 준수 및 성능을 확인한 다음 엔드포인트에 배포해야 합니다. 그러면 ML 모델의 클라이언트가 엔드포인트에 예측 요청을 보낼 수 있습니다.

학습된 모델은 무한정 목적에 맞는 상태로 유지되지 않습니다. 일반적으로 환경은 변화하고 시간이 지남에 따라 모델의 정확도가 떨어지기 시작합니다. ...

Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.

Read now

Unlock full access

More than 5,000 organizations count on O’Reilly

AirBnbBlueOriginElectronic ArtsHomeDepotNasdaqRakutenTata Consultancy Services

QuotationMarkO’Reilly covers everything we've got, with content to help us build a world-class technology community, upgrade the capabilities and competencies of our teams, and improve overall team performance as well as their engagement.
Julian F.
Head of Cybersecurity
QuotationMarkI wanted to learn C and C++, but it didn't click for me until I picked up an O'Reilly book. When I went on the O’Reilly platform, I was astonished to find all the books there, plus live events and sandboxes so you could play around with the technology.
Addison B.
Field Engineer
QuotationMarkI’ve been on the O’Reilly platform for more than eight years. I use a couple of learning platforms, but I'm on O'Reilly more than anybody else. When you're there, you start learning. I'm never disappointed.
Amir M.
Data Platform Tech Lead
QuotationMarkI'm always learning. So when I got on to O'Reilly, I was like a kid in a candy store. There are playlists. There are answers. There's on-demand training. It's worth its weight in gold, in terms of what it allows me to do.
Mark W.
Embedded Software Engineer

You might also like

Spark를 사용한 데이터 알고리즘

Spark를 사용한 데이터 알고리즘

Mahmoud Parsian
데이터 엔지니어를 위한 97가지 조언

데이터 엔지니어를 위한 97가지 조언

Tobias Macey, 임혜연(Lim Hye Yeon)

Publisher Resources

ISBN: 9798341659728