Capítulo 10. Otimizar os serviços de IA
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Neste capítulo, aprenderás a otimizar ainda mais os teus serviços através de engenharia prompt, quantização de modelos e mecanismos de cache.
Técnicas de otimização
Os objectivos da otimização de um serviço de IA consistem em melhorar a qualidade da produção ou o desempenho (latência, débito, custos, etc.).
As optimizações relacionadas com o desempenho incluem o seguinte:
-
Utilização de APIs de processamento em lote
-
Armazena em cache (palavra-chave, semântica, contexto ou prompt)
-
Quantização do modelo
As optimizações relacionadas com a qualidade incluem o seguinte:
-
Utiliza saídas estruturadas
-
Engenharia prompt
-
Afinação do modelo
Vamos analisar cada um deles com mais pormenor.
Processamento em lote
A solução mais óbvia é submeter várias chamadas à API por entrada. No entanto, a abordagem óbvia pode ser dispendiosa ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access