Capítulo 10. Avanços na prestação de serviços de LLM
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Se você chegou até aqui, parabéns por ter percorrido toda a jornada, desde a compreensão dos paradigmas de serviço de modelos até como servir LLMs de forma eficiente para diferentes casos de uso.
O capítulo final destaca alguns avanços emergentes no serviço de LLM e serve como um guia para o teu aprendizado contínuo, à medida que novas ideias e técnicas evoluem rapidamente. Algumas dessas ideias poderiam preencher livros inteiros, e o progresso na área está avançando rapidamente. É um momento emocionante para testemunhar e contribuir para a evolução dos sistemas de inferência inteligente. Nosso objetivo aqui é apresentar as principais ideias e estruturas para que você termine este livro se sentindo preparado para conectar os fundamentos básicos que abordamos com as novas ideias que estão moldando a próxima geração de sistemas de serviço de LLMs.
Neste capítulo, vamos explorar:
Cache semântico e roteamento como mecanismos de alto nível para uma distribuição mais inteligente de solicitações com consciência semântica
Perfilagem de desempenho para ajuste de desempenho refinado
Serviço multimodal, à medida que os LLMs baseados em texto se expandem para modelos de linguagem visual (VLMs) e outras modalidades
Serviço de ponta, levando inferência de baixa latência e com preservação de privacidade aos dispositivos ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access