IA aplicada para desenvolvimento Java empresarial (Portuguese Edition)
by Alex Soto Bueno, Markus Eisele, Natale Vinto
Capítulo 6. APIsde inferência
Este trabalho foi traduzido com recurso a IA. Agradecemos o teu feedback e comentários: translation-feedback@oreilly.com
Você já ampliou seus conhecimentos sobre IA e os vários tipos de modelos em. Além disso, você implantou esses modelos localmente (se possível) e os testou com consultas. Mas, quando chega a hora de usar os modelos, você precisa expô-los corretamente, seguir as práticas recomendadas da sua organização e fornecer aos desenvolvedores uma maneira fácil de usar o modelo.
Uma API de inferência ajuda a resolver esses problemas, tornando os modelos acessíveis a todos os desenvolvedores. Este capítulo explora como expor um modelo de IA/ML usando uma API de inferência em Java.
O que é uma API de inferência?
Uma API de inferência permite que os desenvolvedores d m enviem dados (em qualquer protocolo, como HTTP, gRPC ou Kafka) para um servidor com um modelo de ML implantado e recebam as previsões ou classificações como resultado. Na prática, toda vez que você acessa modelos em nuvem como OpenAI ou Gemini ou modelos implantados localmente usando Ollama, você faz isso por meio da API de inferência deles.
Embora seja comum hoje em dia usar grandes modelos treinados por grandes corporações como Google, IBM ou Meta, principalmente para fins de LLM, você pode precisar usar pequenos modelos treinados personalizados para resolver um problema específico do seu negócio. Normalmente, esses modelos são desenvolvidos pelos cientistas de dados da sua organização, ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access