4paradigm / 4paradigm/k8s-vgpu-scheduler
Vgpu的限制问题
- Vorherrschende Sprache
- Go
- Sterne
- 595
- Forks
- 100
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
6月前更新的libvgpu.so。可以工作,在pytorch上工作正常,超出显存大小会正常报错。但是在tensorflow上不正常,显存限制不正常,可以超出切分的大小而不报错。
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Rechercherichtung
Das Issue betrifft die Bibliothek libvgpu.so und ihre Interaktion mit TensorFlow. Beginne damit, den Code des vGPU-Device-Plugins zu untersuchen, insbesondere die Speicherverwaltung und die Fehlerbehandlung für TensorFlow. Suche nach Tests oder Beispielen für die Durchsetzung von Speicherlimits. Ziel ist es, zu verstehen, warum TensorFlow das Speicherlimit nicht einhält, und dafür zu sorgen, dass es ordnungsgemäß fehlschlägt, wenn der zugewiesene vGPU-Speicher überschritten wird.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- kubernetes, pytorch, tensorflow
- Bereich
- ai-infra-agents, cloud, devops, infrastructure
- Issue-Typ
- Bug
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 35/100