1장. 대규모 언어 모델 소개
이 작품은 AI를 사용하여 번역되었습니다. 여러분의 피드백과 의견을 환영합니다: translation-feedback@oreilly.com
대규모 언어 모델(LLM)의 인기( )는 우연이 아니며, 우리가 기술과 상호작용하는 방식을 변화시키고 기계 학습 모델이 할 수 있는 일의 경계를 넓혀가고 있습니다.
하지만 문제는 이러한 모델이 인상적이지만, 이를 확장하고 프로덕션 환경에서 관리하는 것은 결코 쉬운 일이 아니라는 점입니다. 연구 프로젝트에서 본격적인 신뢰할 수 있는 도구로 도약하는 과정에는 장애물이 많습니다. 방대한 계산 요구 사항을 충족하고, 복잡한 데이터를 관리하며, 자체 호스팅이든 독점 모델을 사용하든 모든 것이 원활하고 안전하게 실행되도록 보장해야 합니다.
LLM 운영의 핵심을 살펴보기 전에 이러한 모델이 왜 그리고 어떻게 생겨나게 되었는지 이해하는 것이 중요합니다. 이러한 모델의 기원과 궤적을 알면 프로덕션에서 이러한 모델의 동작을 예측할 때 직면하는 문제를 이해하는 데 도움이 됩니다.
LLM의 진화는 일련의 점진적인 혁신을 반영하며, 각 모델은 이전 모델의 특정 한계를 해결합니다. 초기 모델은 범위가 제한적이었고 기본적인 작업에도 사람의 광범위한 입력이 필요했습니다. 순환 신경망(RNN)에서 트랜스포머로 전환하고 모델 크기를 확장하는 등 아키텍처가 발전하면서 LLM은 더욱 정교해졌습니다. 이러한 발전은 방대한 양의 데이터를 관리하고 효율적인 학습 프로세스를 보장하는 것과 같은 새로운 과제를 가져왔습니다.
그럼 지금부터 시작하겠습니다.
몇 가지 주요 용어
더 나아가기 전에 명확히 해야 할 세 가지 용어가 있습니다:
- 기초 모델
-
기초모델 은 고급 ML 아키텍처로, 전문화된 모델을 만들기 위한 기본 구성 요소 역할을 합니다. 주로 텍스트로 구성된 대규모 데이터 세트에 대해 사전 학습되며 최근에는 일반적인 언어 이해 및 패턴 인식 기능을 개발하기 위해 코드, 이미지, 오디오 및 비디오와 같은 다른 데이터 유형도 포함됩니다. 이러한 모델은 학습 데이터에서 통계적 관계와 언어 구조를 인코딩하여 추가 미세 조정을 위한 강력한 출발점을 형성합니다. 이러한 미세 조정을 통해 모델을 특정 작업이나 애플리케이션에 맞게 조정할 수 있습니다(예: LLM 또는 기타 AI 기반 솔루션 강화).
- 대규모 언어 모델
-
대규모 언어 모델은 특정 언어 기반 작업에서 탁월한 성능을 발휘하도록 추가 학습 또는 미세 조정을 거친 기초 모델을 전문적으로 구현한 모델입니다. 이러한 모델은 자연어 패턴을 분석하고 에뮬레이션하여 사람과 유사한 텍스트를 예측하고 생성하도록 설계되었습니다. LLM은 텍스트 생성, 감정 분석, 언어 번역, 질문 답변 등과 같은 여러 가지 자연어 처리(NLP) 애플리케이션을 지원하는 매우 다재다능한 모델입니다. 인기 있는 사용 사례로는 챗봇, 콘텐츠 제작, 다국어 커뮤니케이션, 데이터 분석, 코드 생성, 추천 시스템 및 가상 비서가 있습니다. "LLM을 위한 엔터프라이즈 사용 사례"에서는 이러한 애플리케이션을 ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access