Capítulo 9. Comprensiónmultimodal
Este trabajo se ha traducido utilizando IA. Agradecemos tus opiniones y comentarios: translation-feedback@oreilly.com
Los sistemas de agentes tienen un gran potencial cuando se desarrollan para aplicaciones del mundo real. Sin embargo, estas aplicaciones no se limitan solo a la información basada en texto, como es el caso de los LLMs genéricos. Un agente puede necesitar procesar un video, analizar una imagen para evaluar el diseño de un sitio web o ser capaz de escuchar tu solicitud de voz.
Esta capacidad de entender diferentes tipos de información —no solo texto escrito, sino también imágenes, audio y videos— se llama comprensión multimodal e . Cuando ves un video y lees la leyenda, tu cerebro combina todas esas señales para formar una comprensión clara.
Los LLMs multimodales están diseñados para hacer algo similar: recibir múltiples tipos de información (diferentes modalidades) y procesarlos juntos para generar una respuesta más precisa. Un agente que solo pueda leer o escribir texto se perderá partes importantes de lo que ocurre en situaciones cotidianas, como al desarrollar la UI de una aplicación o en un navegador autónomo que necesite procesar imágenes y textos de sitios web.
Algunos LLMs multimodales no solo pueden procesar diferentes modalidades, sino también generarlas. Imagina un sistema en el que el LLM no solo pueda generar texto, sino también audio o imágenes. Un modelo así podría usar su «voz» para hablarte o para generar imágenes ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access