Capítulo 2. Serviço de modelos de linguagemde grande porte
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
No capítulo anterior, apresentamos o conceito de modelos, o serviço de modelos d e e os paradigmas comuns de serviço. Neste capítulo, vamos focar nos desafios e técnicas específicas envolvidos no serviço de LLMs.
Uma das barreiras mais comuns para quem está entrando no mundo da prestação de serviços de modelos é a enorme complexidade dos sistemas modernos de prestação de serviços. Com arquiteturas de modelos, algoritmos de treinamento e ferramentas em rápida evolução — combinados com camadas de infraestrutura de produção como monitoramento, escalonamento, segurança, pipelines de CI/CD e dependências de serviços —, a experiência pode rapidamente se tornar opressiva. O resultado é que muitos engenheiros e pesquisadores perdem o foco, ficando presos nos detalhes do sistema antes mesmo de conseguirem compreender os princípios fundamentais.
Para resolver isso, nossa abordagem é começar pelo básico. Começamos com o código mínimo necessário para servir um LLM e partimos daí. Isso ajuda a estabelecer um modelo mental sólido de como funciona a geração de tokens e por que servir LLMs apresenta desafios únicos. A partir dessa base, vamos expandir gradualmente para tópicos mais avançados, como arquitetura de sistema, métodos de otimização de desempenho e escolhas de infraestrutura nos capítulos restantes. Neste ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access