4paradigm / 4paradigm/k8s-vgpu-scheduler
如何在Prometheus里监控gpu的使用情况
- Langage dominant
- Go
- Étoiles
- 595
- Forks
- 100
- Métriques de merge des PR
- Aucune PR mergée en 30 j
Description
包括每个pod的gpu使用率,显存。有相关指标的介绍吗?
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Piste de recherche
L’issue porte sur l’exposition des métriques GPU (utilisation, mémoire) par pod dans Prometheus pour le k8s-vgpu-scheduler. Commencez par examiner le code existant du device plugin afin de voir quelles métriques sont déjà collectées. Recherchez une intégration du client Prometheus ou des endpoints de métriques. Étudiez la manière dont d’autres device plugins GPU (comme celui de NVIDIA) exposent leurs métriques. Déterminez quelles nouvelles métriques doivent être définies et comment les étiqueter par pod. Vérifiez s’il existe déjà des tests pour les métriques.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- kubernetes, prometheus
- Domaine
- cloud, devops, observability
- Type d'issue
- Fonctionnalité
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 25/100