Overview
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Os modelos de linguagem ampla (LLMs) são os mecanismos de raciocínio da IA moderna. Hoje, chegou um grande ponto de inflexão: à medida que o mundo corre para implantar a IA em escala, a inferência de modelos passou para o centro da pilha. Bem-vindo à era da inferência.
No entanto, sem a otimização adequada, os LLMs podem ser caros e lentos para servir. Com o livro Hands-On LLM Serving and Optimization, você encontrará um guia abrangente sobre as complexidades da implantação e otimização de LLMs em escala.
Neste livro prático e focado em engenharia, os autores Chi Wang e Peiheng Hu combinam exemplos práticos, códigos e estratégias para a criação de fábricas de tokens de IA robustas, eficientes e econômicas. Independentemente de você estar criando a infraestrutura de inferência LLM ou os aplicativos que a consomem, um profundo conhecimento do LLM servindo fará de você um engenheiro mais eficaz e pronto para o futuro, já que a IA transforma a forma como trabalhamos e construímos.
- Você aprenderá os fundamentos do serviço de modelos com conceitos básicos, paradigmas de design e práticas recomendadas do setor
- Entenda os desafios comuns de hospedar LLMs em escala
- Equilibre a latência e a taxa de transferência para atender às demandas de aplicativos de IA e requisitos de negócios
- Hospedar LLMs de forma econômica com técnicas práticas e baseadas em código
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access