Scrape duration using prometheus is increasing continuously until restart
- Langage dominant
- Java
- Étoiles
- 3.1k
- Forks
- 1.4k
- Merge moyen
- 6 j 19 h
- PR mergées (30 j)
- 32
Description
### problem
We are using Prometheus to scrape metrics from the management server.
We see a issue that the scrape_duration_seconds metric for the cloudstack job is increasing in slow pace and after ~7-10 days the scrape duration is longer then the configured interval and we get no more metrics.
First time we saw this just doing a time curl towards the mangement server it took 40-50s for metrics to come back.
### versions
CloudStack 4.22.0.0
### The steps to reproduce the bug
1. Start scraping
2. See the scrape_duration_seconds{job="cloudstack"} increasing daily.
### What to do about it?
1. Restart the management server solves the issue, temporarily
Guide de contribution
Ouvrir le guide de contribution
Piste de recherche
Commencez par le endpoint de métriques Prometheus du serveur de gestion CloudStack et reproduisez le problème en l’interrogeant pendant plusieurs jours tout en surveillant scrape_duration_seconds{job="cloudstack"}. Comparez le temps de réponse de l’endpoint avec l’intervalle de scraping configuré ; le travail est terminé lorsque la durée du scraping n’augmente plus continuellement et que les métriques restent disponibles sans redémarrer le serveur de gestion.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- java, prometheus
- Domaine
- backend, observability
- Type d'issue
- Bug
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- Plutôt claire
- Accessibilité débutants
- 25/100