K-Forge / K-Forge/Beetle

3 corridas por escenario

Open
#205 0 comments 0 reactions 2 assignees Claimed by @13rianVargas View on GitHub
fase-8
Dominant language
Shell
Stars
1
Forks
0
PR merge metrics
No merged PRs in 30d

Description

## Qué es esta tarea

Ejecutar cada escenario 3 veces para medir la consistencia del agente. Son 9 × 3 = 27 ejecuciones de escenarios positivos + 5 × 3 = 15 de casos negativos = 42 corridas totales.

## Qué se debe hacer

- Para cada escenario:
1. Restaurar el VPS desde el snapshot
2. Ejecutar el script de provocación (con tráfico de fondo)
3. Esperar a que el agente detecte, diagnostique y (si aplica) corrija
4. Guardar el informe generado en `pruebas/resultados/`
5. Evaluar contra las respuestas esperadas
6. Repetir 3 veces
- Para los 5 casos negativos, verificar que el agente NO dispara
- Nombrar resultados con escenario + número de corrida (ej: `07_cascada_run2.md`)
- Registrar cualquier anomalía o variación entre corridas

## Por qué importa

Un agente que acierta 1 de 3 veces no es confiable. Las 3 corridas por escenario miden la consistencia — ¿el agente produce el mismo diagnóstico correcto cada vez, o depende del timing? Las métricas del proyecto (sección 16: >90% detección, >80% causa raíz) se calculan sobre estas 42 corridas.

## Criterio de avance

42 corridas completadas. Cada corrida tiene su informe guardado y evaluado contra la respuesta esperada. Las métricas calculadas sobre las 42 corridas están dentro de las metas definidas.

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.