Scrape duration using prometheus is increasing continuously until restart
- Lingua principale
- Java
- Stelle
- 3.1k
- Fork
- 1.4k
- Merge medio
- 6g 19h
- PR unite (30g)
- 32
Descrizione
### problem
We are using Prometheus to scrape metrics from the management server.
We see a issue that the scrape_duration_seconds metric for the cloudstack job is increasing in slow pace and after ~7-10 days the scrape duration is longer then the configured interval and we get no more metrics.
First time we saw this just doing a time curl towards the mangement server it took 40-50s for metrics to come back.
### versions
CloudStack 4.22.0.0
### The steps to reproduce the bug
1. Start scraping
2. See the scrape_duration_seconds{job="cloudstack"} increasing daily.
### What to do about it?
1. Restart the management server solves the issue, temporarily
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia dall'endpoint delle metriche Prometheus del server di gestione CloudStack e riproduci il problema eseguendo lo scraping per diversi giorni mentre osservi scrape_duration_seconds{job="cloudstack"}. Confronta il tempo di risposta dell'endpoint con l'intervallo di scraping configurato; il lavoro è completato quando la durata dello scraping non aumenta più continuamente e le metriche rimangono disponibili senza riavviare il server di gestione.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- java, prometheus
- Ambito
- backend, observability
- Tipo di issue
- Bug
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 25/100