Scrape duration using prometheus is increasing continuously until restart
- Linguagem predominante
- Java
- Estrelas
- 3.1k
- Forks
- 1.4k
- Merge médio
- 6d 19h
- PRs com merge (30d)
- 32
Descrição
### problem
We are using Prometheus to scrape metrics from the management server.
We see a issue that the scrape_duration_seconds metric for the cloudstack job is increasing in slow pace and after ~7-10 days the scrape duration is longer then the configured interval and we get no more metrics.
First time we saw this just doing a time curl towards the mangement server it took 40-50s for metrics to come back.
### versions
CloudStack 4.22.0.0
### The steps to reproduce the bug
1. Start scraping
2. See the scrape_duration_seconds{job="cloudstack"} increasing daily.
### What to do about it?
1. Restart the management server solves the issue, temporarily
Guia de contribuição
Direção de pesquisa
Comece pelo endpoint de métricas do Prometheus do servidor de gerenciamento do CloudStack e reproduza o problema fazendo scraping dele por vários dias enquanto observa scrape_duration_seconds{job="cloudstack"}. Compare o tempo de resposta do endpoint com o intervalo de scraping configurado; considera-se concluído quando a duração do scraping não aumentar mais continuamente e as métricas permanecerem disponíveis sem reiniciar o servidor de gerenciamento.
Escrita pelo modelo de indexação a partir do texto da issue.
Avaliação
- Stack de tecnologia
- java, prometheus
- Domínio
- backend, observability
- Tipo de issue
- Bug
- Dificuldade
- 4/5
- Tempo estimado
- 3-5 dias
- Status de atividade
- Estagnada
- Clareza
- Razoavelmente clara
- Facilidade para iniciantes
- 25/100