Capítulo 9. Otimização deLLM na prática
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
A otimização é um alvo em movimento: em diferentes ambientes de, a “melhor” estratégia muda. Os recursos são limitados, então você não pode testar todas as opções por tentativa e erro. Para te ajudar a otimizar de forma eficiente para o seu próprio domínio, escolhemos cuidadosamente alguns exemplos reais para mostrar como fatores-chave — configuração de hardware, escolha do modelo, comportamento da memória e do cache KV, serviço distribuído e padrões de tráfego — afetam o desempenho do serviço, e como medir e interpretar essas diferenças. Esse entendimento vai te dar a intuição necessária para lidar com suas restrições e chegar a uma configuração de serviço robusta.
Neste capítulo prático, vamos colocar em prática tudo o que você aprendeu nos capítulos anteriores. Usando o modelo de código aberto Qwen3-14B com vLLM como nosso exemplo, vamos te guiar por um processo prático de otimização de serviço de LLM e mostrar como escalar o serviço tanto horizontal quanto verticalmente.
Começaremos com um plano de otimização conciso e o executaremos passo a passo — configurando o ambiente, preparando a carga de trabalho de avaliação, realizando experimentos, servindo o modelo em configurações com uma ou várias GPUs, analisando resultados e aplicando as técnicas apresentadas anteriormente. Concluiremos com um conjunto de lições comprovadas ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access