4paradigm / 4paradigm/k8s-vgpu-scheduler
如何在Prometheus里监控gpu的使用情况
- Vorherrschende Sprache
- Go
- Sterne
- 595
- Forks
- 100
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
包括每个pod的gpu使用率,显存。有相关指标的介绍吗?
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Rechercherichtung
Das Issue fragt nach der Bereitstellung von GPU-Metriken (Auslastung, Speicher) pro Pod in Prometheus für den k8s-vgpu-scheduler. Untersuche zunächst den vorhandenen Device-Plugin-Code, um zu sehen, welche Metriken bereits erfasst werden. Suche nach einer Integration des Prometheus-Clients oder nach Metrik-Endpunkten. Recherchiere, wie andere GPU-Device-Plugins (wie das von NVIDIA) Metriken bereitstellen. Ermittle, welche neuen Metriken definiert werden müssen und wie sie nach Pod gelabelt werden sollen. Prüfe, ob bereits Tests für Metriken vorhanden sind.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- kubernetes, prometheus
- Bereich
- cloud, devops, observability
- Issue-Typ
- Feature
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 25/100