apache / apache/cloudstack

Scrape duration using prometheus is increasing continuously until restart

Aperta
#13,586 2 commenti 0 reazioni 0 assegnatari Rivendicata da @DaanHoogland Vedi su GitHub
component:prometheus
Lingua principale
Java
Stelle
3.1k
Fork
1.4k
Merge medio
6g 19h
PR unite (30g)
32

Descrizione

### problem

We are using Prometheus to scrape metrics from the management server.
We see a issue that the scrape_duration_seconds metric for the cloudstack job is increasing in slow pace and after ~7-10 days the scrape duration is longer then the configured interval and we get no more metrics.
First time we saw this just doing a time curl towards the mangement server it took 40-50s for metrics to come back.

Image

### versions

CloudStack 4.22.0.0

### The steps to reproduce the bug

1. Start scraping
2. See the scrape_duration_seconds{job="cloudstack"} increasing daily.

### What to do about it?

1. Restart the management server solves the issue, temporarily

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia dall'endpoint delle metriche Prometheus del server di gestione CloudStack e riproduci il problema eseguendo lo scraping per diversi giorni mentre osservi scrape_duration_seconds{job="cloudstack"}. Confronta il tempo di risposta dell'endpoint con l'intervallo di scraping configurato; il lavoro è completato quando la durata dello scraping non aumenta più continuamente e le metriche rimangono disponibili senza riavviare il server di gestione.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
java, prometheus
Ambito
backend, observability
Tipo di issue
Bug
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
25/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.