apache / apache/cloudstack

Scrape duration using prometheus is increasing continuously until restart

Ouverte
#13,586 2 commentaires 0 réactions 0 personnes assignées Réclamée par @DaanHoogland Voir sur GitHub
component:prometheus
Langage dominant
Java
Étoiles
3.1k
Forks
1.4k
Merge moyen
6 j 19 h
PR mergées (30 j)
32

Description

### problem

We are using Prometheus to scrape metrics from the management server.
We see a issue that the scrape_duration_seconds metric for the cloudstack job is increasing in slow pace and after ~7-10 days the scrape duration is longer then the configured interval and we get no more metrics.
First time we saw this just doing a time curl towards the mangement server it took 40-50s for metrics to come back.

Image

### versions

CloudStack 4.22.0.0

### The steps to reproduce the bug

1. Start scraping
2. See the scrape_duration_seconds{job="cloudstack"} increasing daily.

### What to do about it?

1. Restart the management server solves the issue, temporarily

Guide de contribution

Ouvrir le guide de contribution

Piste de recherche

Commencez par le endpoint de métriques Prometheus du serveur de gestion CloudStack et reproduisez le problème en l’interrogeant pendant plusieurs jours tout en surveillant scrape_duration_seconds{job="cloudstack"}. Comparez le temps de réponse de l’endpoint avec l’intervalle de scraping configuré ; le travail est terminé lorsque la durée du scraping n’augmente plus continuellement et que les métriques restent disponibles sans redémarrer le serveur de gestion.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
java, prometheus
Domaine
backend, observability
Type d'issue
Bug
Difficulté
4/5
Temps estimé
3-5 jours
Activité
À l'abandon
Clarté
Plutôt claire
Accessibilité débutants
25/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.