4paradigm / 4paradigm/k8s-vgpu-scheduler

如何在Prometheus里监控gpu的使用情况

Offen
#40 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Go
Sterne
595
Forks
100
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

包括每个pod的gpu使用率,显存。有相关指标的介绍吗?

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Das Issue fragt nach der Bereitstellung von GPU-Metriken (Auslastung, Speicher) pro Pod in Prometheus für den k8s-vgpu-scheduler. Untersuche zunächst den vorhandenen Device-Plugin-Code, um zu sehen, welche Metriken bereits erfasst werden. Suche nach einer Integration des Prometheus-Clients oder nach Metrik-Endpunkten. Recherchiere, wie andere GPU-Device-Plugins (wie das von NVIDIA) Metriken bereitstellen. Ermittle, welche neuen Metriken definiert werden müssen und wie sie nach Pod gelabelt werden sollen. Prüfe, ob bereits Tests für Metriken vorhanden sind.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
kubernetes, prometheus
Bereich
cloud, devops, observability
Issue-Typ
Feature
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
25/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.