aws-samples / aws-samples/sample-autonomous-cloud-coding-agents

feat(observability): LLM-assisted trace analysis for failed tasks

Ouverte
#458 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub

Personne n'a encore pris cette issue.

agent-runtime enhancement observability
Langage dominant
TypeScript
Étoiles
146
Forks
46
Merge moyen
3 j 10 h
PR mergées (30 j)
24

Description

Context: ROADMAP.md → Agent quality → LLM-assisted trace analysis
Related: --trace (shipped), automated alert triage draft


Component

API or orchestration

Describe the feature

Automated post-mortem deep dive on failed task trajectories (S3 trace NDJSON + OpenTelemetry spans + TaskEvents) using an LLM to surface recurring reasoning and tool-use failure modes. Distinct from mid-run bgagent ask and optional status summarization.

Use case

Operators debugging failure clusters spend hours reading traces. Platform teams need pattern detection across failures (e.g. repeated git push auth errors, hallucinated file paths).

Proposed solution

  1. Trigger on task_failed (optional Blueprint flag or operator-initiated bgagent trace analyze).
  2. Lambda loads trace + events; calls Bedrock with structured output schema.
  3. Persist analysis artifact (S3 + TaskEvents trace_analysis event).
  4. Rate limits and cost caps per analysis.
  5. Optional aggregation job for cross-task themes (weekly operator report).

Other information

  • Distinct from automated alert triage (security/ops alarms, not task post-mortems).

  • Design context: docs/design/OBSERVABILITY.md, docs/design/EVALUATION.md.

  • This might be a breaking change

Guide de contribution

Ouvrir le guide de contribution

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Piste de recherche

Commencez par ROADMAP.md, docs/design/OBSERVABILITY.md et docs/design/EVALUATION.md, puis suivez le flux --trace existant et le chemin de l’événement task_failed. Examinez le point d’entrée proposé bgagent trace analyze et définissez comment s’articulent les données de trace, l’analyse Bedrock, les artefacts persistés, les limites de débit et l’agrégation facultative. Le travail est terminé lorsque le périmètre et la conception de la fonctionnalité sont définis pour l’implémentation.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
aws, typescript
Domaine
backend-api-design, cloud, observability
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
Calme
Clarté
À clarifier
Accessibilité débutants
25/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.