Capítulo 7. Evaluación de agentes
Este trabajo se ha traducido utilizando IA. Agradecemos tus opiniones y comentarios: translation-feedback@oreilly.com
En los capítulos anteriores fuimos construyendo, uno por uno, los componentes de un agente: cómo razona, cómo usa herramientas, cómo almacena y recupera información, y cómo planifica en múltiples pasos. A estas alturas ya tienes una idea de cómo encajan todas estas piezas para formar el sistema que llamamos agente de IA. La siguiente pregunta lógica es: ¿cómo sabemos si todo esto está funcionando?
De eso se trata este capítulo, como puedes ver en la Figura 7-1. La evaluación es lo que te permite pasar de «parece que funciona» a «tengo pruebas de que funciona». También es lo que te permite detectar el momento en que deja de funcionar. Las evaluaciones son una de las áreas en las que menos se invierte en el desarrollo de agentes. Los equipos suelen depender de las pruebas manuales y la intuición por más tiempo del que deberían, y luego se ven incapaces de lanzar mejoras con confianza o de diagnosticar regresiones cuando aparecen.
Empezaremos con los puntos de referencia, que encontrarás con mayor frecuencia en los anuncios de modelos y en los artículos de investigación. Luego avanzaremos hacia las herramientas y los conceptos que necesitas para diseñar tus propias evaluaciones. Al final del capítulo, tendrás una idea clara de cómo se miden los agentes y qué significan realmente esas mediciones.
Figura 7-1. En este capítulo se explica ...
Become an O’Reilly member and get unlimited access to this title plus top books and audiobooks from O’Reilly and nearly 200 top publishers, thousands of courses curated by job role, 150+ live events each month,
and much more.
Read now
Unlock full access