9장. 스케일링: 하드웨어, 인프라 및 리소스 관리
이 작품은 AI를 사용하여 번역되었습니다. 여러분의 피드백과 의견을 환영합니다: translation-feedback@oreilly.com
배포 및 LLM 관리는 인프라 및 리소스 관리 영역에서 고유한 과제와 기회를 제공합니다. 이 책 전체에서 살펴본 바와 같이 LLM은 컴퓨팅 집약적이며, 효율적으로 운영하려면 상당한 하드웨어, 스토리지 및 네트워크 리소스가 필요합니다. LLM을 Cloud 기반 서비스로 활용하든, 온프레미스 데이터 센터에 사전 학습된 모델을 배포하든, 처음부터 자체 모델을 학습하든, 인프라 결정은 성능, 확장성, 비용 효율성에 영향을 미칩니다.
LLM을 위한 효과적인 리소스 관리에는 컴퓨팅 성능, 메모리, 스토리지 최적화가 포함됩니다. 이 장에서는 하드웨어 요구 사항과 배포 전략을 비롯하여 LLM을 위한 인프라의 주요 구성 요소를 살펴봅니다. 또한 리소스 사용 최적화, 비용 관리, 프로덕션 환경에서의 안정성 유지를 위한 모범 사례에 대해서도 설명합니다. 이 장에서는 대규모 AI 애플리케이션을 위한 리소스 관리와 관련된 장단점을 이해하는 데 도움이 될 것입니다.
올바른 접근 방식 선택하기
LLM을 사용하기 위한 적절한 방법은 사용하려는 애플리케이션의 요구 사항에 따라 달라집니다. 스타트업이나 소규모 애플리케이션의 경우 Cloud에서 직접 모델을 사용하는 것이 가장 빠르고 비용 효율적인 솔루션일 수 있습니다. 특수한 요구 사항이 있거나 워크로드가 많은 기업의 경우, Cloud 인프라에 LLM을 배포하면 유연성과 확장성 간의 적절한 균형을 찾는 데 도움이 될 수 있습니다. 마지막으로, 엄격한 데이터 개인정보 보호 또는 지연 시간 요구 사항이 있는 조직의 경우 로컬 배포는 운영 복잡성이 높아지는 대신 탁월한 제어 및 보안을 제공합니다.
각 접근 방식의 장단점을 신중하게 평가함으로써 조직은 LLM 배포 전략을 기술 및 비즈니스 목표에 맞게 조정하여 이러한 혁신적인 AI 기술을 효율적이고 효과적으로 사용할 수 있습니다.
어떤 솔루션을 선택하든 항상 타사 API 기반 접근 방식, 즉 Cloud에서 직접 모델을 사용하는 것부터 시작하는 것이 좋습니다. 실제 배포에서 제가 관찰한 주요 문제 중 하나는 LLM이 주어진 문제에 대한 좋은 솔루션인지 파악하는 것이었습니다. 타사의 API 기반 접근 방식을 사용하면 인프라에 많은 리소스를 커밋하기 전에 프로토타입에서 이 질문에 답할 수 있습니다.
확장 및 리소스 할당
LLM 기반 애플리케이션에서 성능, 비용 효율성 및 안정성을 유지하려면 리소스를 잘 관리해야 합니다. 특히 AI 시스템 실행에 필요한 GPU 및 메모리 대역폭과 같이 수요가 많은 리소스를 과도하게 할당하면 불필요한 비용이 발생할 수 있습니다. 리소스를 과소 할당하면 시스템 충돌과 열악한 사용자 경험의 위험에 노출될 수 있습니다.
대부분의 학습 실패는 연산이 아닌 메모리 부족에서 비롯됩니다. 저는 이를 '빙산 문제'라고 부르는데, 겉으로 드러난 문제는 실패이지만 그 밑에 숨겨진 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access