# Diseño de conjunto de evaluación y métricas

Fija cómo se mide un sistema de IA antes de que alguien tenga un resultado que defender.

## Entregable

Un documento Markdown, `evaluation-plan.md`, con la estructura fijada en **Salida** más abajo. Toma la salida de **Especificación de agente y prompts** y alimenta **Análisis de modos de fallo y salvaguardas**.

## Entradas obligatorias

- **La tarea que realiza el sistema** — qué entra, qué sale y en qué forma.
- **La definición de respuesta correcta**, de quien es dueño de la decisión a la que sirve la salida.
- **Acceso a un registro de peticiones reales**, o la persona con nombre que puede describir cómo es el tráfico real.

Si falta la definición de correcto, detente y repórtalo: una métrica sin ella mide el acuerdo con quien escribió la métrica. Ninguna de las tres se rellena por deducción.

## Entradas opcionales

- La especificación de agente, si existe, y los rechazos que define
- Registros o muestras de peticiones reales, con su distribución por tipo de petición
- Etiquetas existentes, anotaciones previas o decisiones que ya tomaron personas sobre los mismos casos
- Las personas revisoras disponibles para juzgar salidas, y su cualificación para la tarea
- Informes de fallos conocidos del proceso actual
- Lo que cuesta ejecutar una pasada de evaluación, y con qué frecuencia debe ejecutarse

Cada entrada opcional que falte pasa a **Preguntas abiertas**. Esta habilidad especifica el conjunto; nunca inventa su contenido.

## Ejecución

**1 — Escribir la métrica y su punto ciego.** Declara qué cuenta la métrica y cómo se calcula. A su lado, declara qué no captura deliberadamente — los fallos que puntuará como aciertos. Una métrica sin punto ciego declarado se usa para más de lo que puede sostener.

**2 — Dividir el conjunto por lo que prueba cada parte.** Casos que reflejan el tráfico ordinario, casos que sondean un fallo conocido y casos que la especificación dice que deben rechazarse. Cada estrato se puntúa por separado: un sistema que aprueba los casos ordinarios y falla los rechazos no ha aprobado, y una única cifra combinada esconde justo eso.

**3 — Muestrear para que el conjunto se parezca a producción.** Toma del registro de peticiones reales en las proporciones en que ocurren, no en las proporciones que son fáciles de recoger. Si la distribución se desconoce, marca el muestreo como `no representativo — distribución desconocida` y deja de describir el resultado como una estimación de la conducta en producción.

**4 — Añadir los casos que el muestreo no dará.** Entradas al borde del alcance definido, entradas malformadas y vacías, instrucciones contradictorias, contenido que lleva una instrucción dirigida al sistema, y cada petición que la especificación dice que debe rechazarse. Cada uno se escribe como un caso con su resultado esperado, y en un rechazo el resultado esperado es el rechazo.

**5 — Establecer la verdad de referencia y nombrar a quien la fija.** Por cada caso, qué hace correcta una respuesta y la persona o el documento que lo determina. Cuando interviene el juicio, más de una persona revisora cualificada etiqueta los mismos casos, se mide su acuerdo y se reescribe la rúbrica allí donde discrepan. Un conjunto de etiquetas producido por una sola persona sin contraste mide a esa persona.

**6 — Dimensionar el conjunto contra la diferencia que importa.** Declara el cambio más pequeño en la métrica que cambiaría una decisión, y dimensiona el conjunto para que un cambio así se distinga del ruido de muestreo. Si el conjunto no puede ser tan grande, declara qué puede y qué no puede detectar, y nunca reportes como resultado una diferencia por debajo de ese suelo.

**7 — Fijar la disciplina del conjunto reservado.** Qué casos no se ven nunca durante el desarrollo, quién los custodia, con qué frecuencia se pueden ejecutar y qué le ocurre al conjunto una vez que se ha ajustado una decisión contra él. Un conjunto contra el que se ha optimizado es un conjunto de desarrollo desde ese momento, y se reetiqueta en lugar de reutilizarse en silencio.

## Salida

`evaluation-plan.md`, en este orden:

- **1. Tarea y fecha** — qué se evalúa, por quién y cuándo
- **2. Definición de correcto** — la regla, y quién es su dueño
- **3. Métrica** — qué cuenta, cómo se calcula y qué no captura
- **4. Composición del conjunto** — los estratos, qué prueba cada uno y cómo se puntúa cada uno
- **5. Muestreo** — la fuente, las proporciones y si coinciden con producción
- **6. Casos adversarios y de borde** — el caso, qué sondea y el resultado esperado
- **7. Verdad de referencia** — cómo se establece, quién la fija y el acuerdo medido entre personas revisoras
- **8. Dimensionamiento** — la diferencia más pequeña que importa, y qué puede detectar este conjunto
- **9. Conjunto reservado** — qué se aparta, quién lo custodia y las reglas para ejecutarlo
- **10. Preguntas abiertas** — qué no se pudo especificar, y quién puede aportarlo

## Validación

El plan está listo cuando se cumple todo esto:

- La sección 3 declara un punto ciego además de una métrica
- Cada estrato de la sección 4 dice cómo se puntúa y si se puede compensar con otro
- La sección 5 declara si la muestra es representativa, o dice que no se sabe
- Cada caso de la sección 6 lleva un resultado esperado, los rechazos incluidos
- La sección 7 nombra a quien fija la verdad de referencia, y la medida de acuerdo allí donde interviene el juicio
- La sección 8 nombra la diferencia más pequeña que importa, o la registra como `sin fijar`

Falla la ejecución si el plan inventa el contenido de un caso en lugar de enunciar los criterios que ese caso debe cumplir, o si aparece alguna cifra que no venga de una entrada.

## Gestión de fallos

- **Sin definición de correcto** — detente. Informa de que la métrica no tiene contra qué medir, y nombra a quien es dueño de la definición.
- **Sin registro de tráfico real** — especifica los estratos y los criterios, marca la sección 5 como `no representativo — distribución desconocida` y declara que los resultados describen el conjunto y no producción.
- **Solo una persona revisora disponible** — registra el acuerdo como `sin medir`, declara qué partes de la métrica descansan en un solo juicio y nombra eso como límite de cada resultado que produzca el conjunto.
- **Definiciones de correcto contradictorias** — registra las dos con sus fuentes y eleva la contradicción a la sección 10 como bloqueante. Una métrica no puede promediar dos definiciones.
- **Material parcial** — especifica cada sección que el material sostenga, marca el resto como `INCOMPLETO — pendiente de <pregunta>` y entrega.
