Resultado de la lección: construir un set pequeño que detecte regresiones y defectos importantes.
Evaluar el sistema, no el carisma
Una respuesta extensa, segura y pulida puede estar equivocada. Evalúa la salida contra el trabajo que debe cumplir.
Set mínimo
- 5 casos normales;
- 3 casos difíciles;
- 2 casos inválidos;
- 2 casos de abuso o instrucción maliciosa;
- 1 dependencia caída;
- 1 caso que exige escalar.
Tipos de evaluación
- Determinista: total, formato, campo, estado, archivo.
- Rúbrica humana: claridad, continuidad, tono, utilidad.
- Juez asistido: clasificación o comparación, calibrada con humanos.
- Prueba de usuario: la persona completa la acción.
- Observación operativa: costo, tiempo, fallo y recuperación.
Combina. No conviertas el gusto en una fórmula falsa ni dejes lo verificable a una impresión.
Baseline
Antes de “mejorar con IA”, mide el camino manual o la versión anterior:
- tiempo;
- costo;
- calidad;
- variación;
- tasa de error;
- carga humana.
Sin baseline no puedes afirmar mejora.
Misión
Ejecuta el set contra dos versiones. Registra:
CASO | ESPERADO | RESULTADO | PASA/FALLA | EVIDENCIA | DECISIÓN
No cambies instrucciones después de cada caso. Agrupa fallos por patrón.
Evidencia
Tabla de evals, baseline y tres fallos clasificados.
Pase
La versión candidata mejora o mantiene lo crítico y no crea una regresión oculta.