aws-samples / aws-samples/sample-autonomous-cloud-coding-agents

CDK: Harness-level SLO metrics on operator dashboard

Ouverte
#511 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
enhancement infra-cdk P1
Langage dominant
TypeScript
Étoiles
143
Forks
46
Merge moyen
3 j 9 h
PR mergées (30 j)
20

Description

> **Roadmap:** Evaluation pipeline; Validation and risk analytics
> **Priority:** P1

## Component

CDK / infrastructure

## Describe the feature

Emit **harness-level** CloudWatch metrics and dashboard panels that evaluate the control plane/runtime separately from raw task pass/fail. Final task success conflates model quality, harness quality, and environment luck (arXiv:2605.18747 §5.2.1).

## Use case

- **Operators/SREs** track whether the platform is getting more reliable independent of model upgrades.
- **Field engagements** report dark-factory scorecard progress with objective harness SLOs.
- **A/B prompt experiments** isolate prompt changes from harness regressions.

## Proposed solution

Define and emit metrics (names illustrative; finalize in implementation):

| Metric | Definition |
|--------|------------|
| `HarnessToolCallsPerTask` | Agent tool invocations per completed task |
| `HarnessTokensPerTask` | Bedrock tokens (from existing cost telemetry) |
| `HarnessWallClockSeconds` | Submit → terminal |
| `HarnessVerificationCoverage` | % tasks with full evidence bundle / all required sensors run |
| `HarnessRecoveryRate` | % tasks that failed verify then succeeded on retry (when fix-up loop exists) |
| `HarnessReplayCompleteness` | % tasks with TaskEvents + trace URI + prompt_version |

Add widgets to the existing operator dashboard construct; document dimensions (`repo`, `workflow_ref`, `prompt_version`) without PII.

### Acceptance criteria

- [ ] Metrics emitted from orchestrator and/or agent telemetry path
- [ ] Dashboard panels added to operator dashboard (CDK)
- [ ] Documented in `docs/design/OBSERVABILITY.md` with metric definitions
- [ ] Referenced from dark-factory scorecard / `ABCA_V2.md` success metrics where appropriate
- [ ] No new PII dimensions in metric labels

## Other information

- **Depends on (soft):** Verification evidence bundles for `VerificationCoverage`
- **Paper:** arXiv:2605.18747 §5.2.1 harness-level evaluation dimensions
- **Existing:** Operator dashboard, OTEL spans, TaskEvents (shipped)

## Acknowledgements

- [ ] I may be able to implement this feature
- [ ] This might be a breaking change

Guide de contribution

Ouvrir le guide de contribution

Piste de recherche

Commencez par le construct existant du tableau de bord de l’opérateur et le chemin de télémétrie de l’orchestrateur ou de l’agent, puis examinez les spans OTEL existants, les TaskEvents et la télémétrie des coûts. Définissez les métriques du harness et les dimensions sans PII, ajoutez des panneaux au tableau de bord, documentez-les dans docs/design/OBSERVABILITY.md et mettez à jour, le cas échéant, les métriques de réussite de la scorecard dark-factory ou de ABCA_V2.md.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
aws, typescript
Domaine
cloud, infrastructure, observability-sre
Type d'issue
Fonctionnalité
Difficulté
4/5
Temps estimé
3-5 jours
Activité
Calme
Clarté
Plutôt claire
Accessibilité débutants
48/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.