4paradigm / 4paradigm/k8s-vgpu-scheduler

Vgpu的限制问题

Offen
#28 1 Kommentar 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Go
Sterne
595
Forks
100
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

6月前更新的libvgpu.so。可以工作,在pytorch上工作正常,超出显存大小会正常报错。但是在tensorflow上不正常,显存限制不正常,可以超出切分的大小而不报错。

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Das Issue betrifft die Bibliothek libvgpu.so und ihre Interaktion mit TensorFlow. Beginne damit, den Code des vGPU-Device-Plugins zu untersuchen, insbesondere die Speicherverwaltung und die Fehlerbehandlung für TensorFlow. Suche nach Tests oder Beispielen für die Durchsetzung von Speicherlimits. Ziel ist es, zu verstehen, warum TensorFlow das Speicherlimit nicht einhält, und dafür zu sorgen, dass es ordnungsgemäß fehlschlägt, wenn der zugewiesene vGPU-Speicher überschritten wird.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
kubernetes, pytorch, tensorflow
Bereich
ai-infra-agents, cloud, devops, infrastructure
Issue-Typ
Bug
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
35/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.