4paradigm / 4paradigm/k8s-vgpu-scheduler

Vgpu的限制问题

Ouverte
#28 1 commentaire 0 réactions 0 personnes assignées Voir sur GitHub
Langage dominant
Go
Étoiles
595
Forks
100
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

6月前更新的libvgpu.so。可以工作,在pytorch上工作正常,超出显存大小会正常报错。但是在tensorflow上不正常,显存限制不正常,可以超出切分的大小而不报错。

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

L’issue concerne la bibliothèque libvgpu.so et son interaction avec TensorFlow. Commencez par examiner le code du plugin de périphérique vGPU, en particulier la gestion de la mémoire et la gestion des erreurs pour TensorFlow. Recherchez des tests ou des exemples d’application de limites de mémoire. L’objectif est de comprendre pourquoi TensorFlow ne respecte pas la limite de mémoire et de faire en sorte qu’il échoue correctement lorsqu’il dépasse la mémoire vGPU allouée.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
kubernetes, pytorch, tensorflow
Domaine
ai-infra-agents, cloud, devops, infrastructure
Type d'issue
Bug
Difficulté
4/5
Temps estimé
3-5 jours
Activité
À l'abandon
Clarté
Plutôt claire
Accessibilité débutants
35/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.