3 corridas por escenario
- Dominant language
- Shell
- Stars
- 1
- Forks
- 0
- PR merge metrics
- No merged PRs in 30d
Description
## Qué es esta tarea
Ejecutar cada escenario 3 veces para medir la consistencia del agente. Son 9 × 3 = 27 ejecuciones de escenarios positivos + 5 × 3 = 15 de casos negativos = 42 corridas totales.
## Qué se debe hacer
- Para cada escenario:
1. Restaurar el VPS desde el snapshot
2. Ejecutar el script de provocación (con tráfico de fondo)
3. Esperar a que el agente detecte, diagnostique y (si aplica) corrija
4. Guardar el informe generado en `pruebas/resultados/`
5. Evaluar contra las respuestas esperadas
6. Repetir 3 veces
- Para los 5 casos negativos, verificar que el agente NO dispara
- Nombrar resultados con escenario + número de corrida (ej: `07_cascada_run2.md`)
- Registrar cualquier anomalía o variación entre corridas
## Por qué importa
Un agente que acierta 1 de 3 veces no es confiable. Las 3 corridas por escenario miden la consistencia — ¿el agente produce el mismo diagnóstico correcto cada vez, o depende del timing? Las métricas del proyecto (sección 16: >90% detección, >80% causa raíz) se calculan sobre estas 42 corridas.
## Criterio de avance
42 corridas completadas. Cada corrida tiene su informe guardado y evaluado contra la respuesta esperada. Las métricas calculadas sobre las 42 corridas están dentro de las metas definidas.
Contributor guide
Assessment
This issue has not been assessed yet.