Prefácio
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Os grandes modelos de linguagem (LLMs) passaram de curiosidades de pesquisa para infraestrutura essencial à produção em um tempo incrivelmente curto — bem parecido com a revolução da internet. Um mundo agente está chegando, e, de muitas maneiras, já está aqui: uma nova onda de “tokenização”, em que cada vez mais aplicativos são construídos sobre a infraestrutura de LLMs, em vez de APIs e serviços tradicionais.
Em apenas alguns anos, o “basta chamar a API” de provedores públicos de LLM, como a OpenAI, evoluiu para “precisamos de nossos próprios modelos” e, depois, para “precisamos executar esses modelos de forma eficiente, segura e em escala”. As empresas agora precisam de muito mais controle sobre seus LLMs — para governança de dados, solução de problemas, avaliação, conformidade e gestão de custos. Muitas equipes descobriram que a parte mais difícil da GenAI não é treinar um modelo ou configurar uma interface de chat — é tudo o que vem no meio: configurar a entrega e a otimização do modelo de forma a atingir os objetivos de negócios a um custo aceitável.
A gente tem acompanhado essa lacuna de perto. Vimos protótipos brilhantes desmoronarem sob tráfego real ou estourarem o orçamento de GPU em uma semana. Vimos organizações ansiosas por reconstruir casos de uso essenciais para LLMs, mas impedidas por preocupações com os custos de APIs públicas e a segurança ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access