Capítulo 6. Técnicasessenciais de otimização de LLMs
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Nos capítulos anteriores, mostramos a importância e os desafios da otimização de LLMs para o serviço. Nos próximos dois capítulos, vamos nos aprofundar em cada uma das técnicas essenciais de otimização de LLMs, uma por uma, para que você tenha o conhecimento necessário para decidir quando, como e por que usá-las de acordo com suas necessidades de serviço.
Neste capítulo, especificamente, vamos nos concentrar nas técnicas essenciais que vão te ajudar a entender a maioria dos conceitos de otimização e a alcançar muitos dos teus objetivos de otimização. Vamos deixar as técnicas mais avançadas e as tendências do setor para o Capítulo 7.
Neste capítulo, discutiremos como usar:
-
Agrupamento e agendamento de solicitações para obter melhor paralelismo e utilização da GPU
-
Otimização de atenção para obter melhor eficiência de computação, menor necessidade de computação e melhor gerenciamento de memória
-
Compressão de modelos para obter modelos menores, menos movimentação de memória e/ou menos computação
-
Cache de prefixos para armazenar em cache e reutilizar prompts anteriores, incluindo como fazer isso de forma eficiente e obter uma alta taxa de acertos no cache
Agrupamento de solicitações e otimizações no nível de agendamento
No Capítulo 2, dividimos o atendimento de solicitações de modelo em atendimento offline ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access