Capítulo 7. Técnicasavançadas de otimização de LLM
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Depois do último capítulo, você já está equipado com as técnicas essenciais para enfrentar muitos dos desafios da otimização de serviços de LLM, especialmente aqueles que não são excessivamente grandes e cabem em uma única GPU. Para LLMs maiores, com, por exemplo, mais de 100 bilhões de parâmetros, uma GPU geralmente não é suficiente para carregar o modelo na memória da GPU e gerar resultados com uma latência satisfatória. Neste capítulo, exploramos técnicas avançadas para melhorar ainda mais o desempenho dos serviços de LLM, incluindo:
-
Decodificação especulativa para acelerar a fase de decodificação da geração de LLMs, reduzindo a latência entre tokens (ITL)
-
Serviço com múltiplas GPUs e múltiplos nós para grandes LLMs que não cabem ou não têm desempenho suficiente ao rodar em uma única GPU
-
Desagregação de pré-preenchimento-decodificação (PD) para separar as fases de pré-preenchimento e decodificação e ajustar suas soluções de compromisso de forma independente
-
Técnicas avançadas de cache KV para alcançar um tempo até o primeiro token (TTFT) extremamente rápido e uma alta taxa de acertos no cache
Decodificação especulativa
E se uma única técnica pudesse, sozinh, melhorar a latência — especialmente a ITL — em um fator de dois ou três? Conheça a decodificação especulativa, uma abordagem inovadora que ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access