4paradigm / 4paradigm/k8s-vgpu-scheduler

如何在Prometheus里监控gpu的使用情况

Ouverte
#40 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Langage dominant
Go
Étoiles
595
Forks
100
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

包括每个pod的gpu使用率,显存。有相关指标的介绍吗?

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

L’issue porte sur l’exposition des métriques GPU (utilisation, mémoire) par pod dans Prometheus pour le k8s-vgpu-scheduler. Commencez par examiner le code existant du device plugin afin de voir quelles métriques sont déjà collectées. Recherchez une intégration du client Prometheus ou des endpoints de métriques. Étudiez la manière dont d’autres device plugins GPU (comme celui de NVIDIA) exposent leurs métriques. Déterminez quelles nouvelles métriques doivent être définies et comment les étiqueter par pod. Vérifiez s’il existe déjà des tests pour les métriques.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
kubernetes, prometheus
Domaine
cloud, devops, observability
Type d'issue
Fonctionnalité
Difficulté
4/5
Temps estimé
3-5 jours
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
25/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.