Capítulo 8. Estruturas de serviçode LLM
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Nos capítulos anteriores, exploramos os fundamentos da prestação de serviços de LLM — projetode sistemas, implementação de serviços e técnicas práticas de otimização. Este capítulo se concentra na camada de base — as estruturas de prestação de serviços que implementam e executam a inferência de modelos com diferentes técnicas de otimização sob restrições reais de produção. Vamos discutir quatro frameworks de serviço de código aberto amplamente adotados que você provavelmente encontrará na prática: vLLM, TensorRT-LLM, SGLang e llama.cpp. Cada um tem uma filosofia distinta, pegada de hardware e tecnologia testada em batalha, além de contar com comunidades ativas e uso crescente em produção.
Por ser a estrutura mais amplamente aplicada, vamos nos aprofundar no vLLM — sua arquitetura, processo de inicialização e execução de modelos, agendamento em nível de solicitação e token, e estratégia de otimização em camadas. Compreender o funcionamento interno do vLLM vai te dar uma boa noção de como as estruturas LLM funcionam na prática e facilitar a avaliação das soluções de compromisso em outras estruturas.
Em seguida, abordaremos as demais estruturas com visões gerais concisas e orientadas para a tomada de decisão, além de exemplos curtos. Encerraremos o capítulo com o método de avaliação que usamos para comparar estruturas de ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access