apache / apache/cloudstack

Scrape duration using prometheus is increasing continuously until restart

Aberta
#13,586 2 comentários 0 reações 0 responsáveis Reivindicada por @DaanHoogland Ver no GitHub
component:prometheus
Linguagem predominante
Java
Estrelas
3.1k
Forks
1.4k
Merge médio
6d 19h
PRs com merge (30d)
32

Descrição

### problem

We are using Prometheus to scrape metrics from the management server.
We see a issue that the scrape_duration_seconds metric for the cloudstack job is increasing in slow pace and after ~7-10 days the scrape duration is longer then the configured interval and we get no more metrics.
First time we saw this just doing a time curl towards the mangement server it took 40-50s for metrics to come back.

Image

### versions

CloudStack 4.22.0.0

### The steps to reproduce the bug

1. Start scraping
2. See the scrape_duration_seconds{job="cloudstack"} increasing daily.

### What to do about it?

1. Restart the management server solves the issue, temporarily

Guia de contribuição

Abrir o guia de contribuição

Direção de pesquisa

Comece pelo endpoint de métricas do Prometheus do servidor de gerenciamento do CloudStack e reproduza o problema fazendo scraping dele por vários dias enquanto observa scrape_duration_seconds{job="cloudstack"}. Compare o tempo de resposta do endpoint com o intervalo de scraping configurado; considera-se concluído quando a duração do scraping não aumentar mais continuamente e as métricas permanecerem disponíveis sem reiniciar o servidor de gerenciamento.

Escrita pelo modelo de indexação a partir do texto da issue.

Avaliação

Stack de tecnologia
java, prometheus
Domínio
backend, observability
Tipo de issue
Bug
Dificuldade
4/5
Tempo estimado
3-5 dias
Status de atividade
Estagnada
Clareza
Razoavelmente clara
Facilidade para iniciantes
25/100

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.