Capítulo 9. Otimização da inferência
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Nos últimos capítulos, aprendemos várias técnicas para adaptar e utilizar LLMs para resolver tarefas específicas. Neste capítulo, aprenderemos como fazer inferência eficiente sobre elas para uso no mundo real. O grande tamanho das LLMs torna a implementação e a inferência particularmente desafiantes, uma vez que exercem uma pressão significativa nos requisitos de computação, memória e energia. Isto revela-se especialmente difícil em dispositivos de ponta como os telemóveis.
No resto do capítulo, centrar-nos-emos no campo da otimização da inferência, discutindo os factores que influenciam o tempo de inferência LLM. Em seguida, apresentaremos uma variedade de técnicas de otimização, incluindo armazenamento em cache, destilação de conhecimento, saída antecipada, quantização, descodificação paralela e especulativa, entre outras.
Desafios da Inferência LLM
Quais são os estrangulamentos que afectam a inferência LLM? Como todos sabemos, as suas dimensões gigantescas requerem vastos recursos de computação e de memória. Além disso, dois factores adicionais agravam a situação:
-
Como vimos no Capítulo 4, os LLMs contemporâneos baseiam-se em grande parte em modelos de descodificação que funcionam de forma auto-regressiva. Isto significa que cada token é gerado um após o outro, impondo assim uma limitação sequencial. Mais adiante neste ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access