Saltar al contenido
Xavi Creus

IA

Evals (evaluación de sistemas de IA)

Las evals son las pruebas sistemáticas que miden si un modelo o agente de IA responde bien a un conjunto de casos reales, antes y después de cada cambio.

Definición

Las evals (evaluaciones de IA) son conjuntos de pruebas que miden de forma sistemática la calidad de un modelo o de una aplicación de IA: se le presentan cientos de casos representativos con la respuesta esperada y se comprueba cuántos resuelve bien, con qué precisión y a qué coste. Son a la IA lo que los tests automáticos son al software tradicional. Sin evals, cualquier cambio en el prompt, el modelo o los datos es una apuesta a ciegas.

En la empresa, las evals son lo que permite pasar de una demo prometedora a un sistema en producción con garantías. El equipo recopila casos reales, como tickets ya resueltos o contratos ya revisados, con la respuesta correcta validada por un experto, y los convierte en la prueba de referencia. Cada nueva versión del prompt o cada cambio de modelo se ejecuta contra esa prueba. Si la puntuación baja, no se despliega. Es la herramienta de control de calidad de la IA.

Hoy es habitual usar un modelo de IA como juez para calificar las respuestas de otro cuando la corrección no es binaria, como en una redacción o un resumen. Los proveedores de modelos publican evaluaciones estandarizadas, pero la única eval que importa para tu empresa es la que usa tus datos. El malentendido habitual es fiarse de la impresión de que funciona tras probar diez ejemplos. Las evals existen porque el ejemplo once es el que llega al cliente.

En la práctica

Antes de lanzar su asistente de soporte, una empresa de software construye una eval con 500 tickets históricos y sus respuestas correctas. Cada cambio de prompt se mide contra esos 500 casos; la tasa de acierto pasa del 71% al 89% en tres semanas y ese es el dato que decide el lanzamiento.

Por qué importa

Las evals son la diferencia entre una empresa que usa IA y una que la gestiona. Si un proveedor o tu equipo no puede decirte con un número cuánto acierta el sistema con tus casos, todavía no tienes un producto, tienes una demostración.

Preguntas frecuentes

¿Cómo se mide si un sistema de IA funciona bien?
Con un conjunto de casos reales y su respuesta correcta, ejecutando el sistema sobre todos ellos y calculando la tasa de acierto, el coste y el tiempo. Ese conjunto se llama eval. Se repite con cada cambio para comprobar que no empeora. Para respuestas abiertas, otro modelo o un experto puntúa la calidad.
¿Cuántos casos necesito para evaluar un modelo de IA?
Para empezar, entre 50 y 100 casos variados y validados por alguien que conozca el proceso dan una señal útil. Para decidir un despliegue con confianza, varios cientos. Lo importante es que representen la realidad, incluidos los casos difíciles y raros, y que las respuestas correctas estén revisadas.

¿Necesitas que te lo explique para tu empresa?

Una hora conmigo suele bastar para convertir el vocabulario en una decisión.

Reservar una sesión