4paradigm / 4paradigm/k8s-vgpu-scheduler

commited image can not run in another node.

Ouverte
#8 3 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Langage dominant
Go
Étoiles
595
Forks
100
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

_The template below is mostly useful for bug reports and support questions. Feel free to remove anything which doesn't apply to you and add more information where it makes sense._
---

### 1. Issue or feature description
commited image can not run in another node.
### 2. Steps to reproduce the issue
1. start pod with gpu enabled
2. commit container to image and push to registry
3. start pod with commited image in another node
container can not run with following error
```
Error response from daemon: OCI runtime create failed: container_linux.go:349: starting container process caused "process_linux.go:449: container init caused \"process_linux.go:432: running prestart hook 0 caused \\\"error running hook:
exit status 1, stdout: , stderr: nvidia-container-cli: device error: GPU-caba9b00-6386-2c33-7834-646ef2692cb7: unknown device\\\\n\\\"\"": unknown
```
### 3. Information to [attach](https://help.github.com/articles/file-attachments-on-issues-and-pull-requests/) (optional if deemed irrelevant)

Common error checking:
- [ ] The output of `nvidia-smi -a` on your host
- [ ] Your docker configuration file (e.g: `/etc/docker/daemon.json`)
- [ ] The k8s-device-plugin container logs
- [ ] The kubelet logs on the node (e.g: `sudo journalctl -r -u kubelet`)

Additional information that might help better understand your environment and reproduce the bug:
- [ ] Docker version from `docker version`: 19.03
- [ ] Docker command, image and tag used: docker commit
- [ ] Kernel version from `uname -a`
- [ ] Any relevant kernel output lines from `dmesg`
- [ ] NVIDIA packages version from `dpkg -l '*nvidia*'` _or_ `rpm -qa '*nvidia*'`
- [ ] NVIDIA container library version from `nvidia-container-cli -V`
- [ ] NVIDIA container library logs (see [troubleshooting](https://github.com/NVIDIA/nvidia-docker/wiki/Troubleshooting))

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

L’erreur indique une incompatibilité de périphérique GPU lorsqu’une image de conteneur commitée s’exécute sur un autre nœud. Commencez par examiner les journaux de nvidia-container-cli et la gestion des UUID de GPU par le device plugin. Consultez les journaux du conteneur k8s-device-plugin et les journaux de kubelet sur le nœud affecté afin de comprendre comment les ressources GPU sont allouées. Vérifiez si l’image commitée conserve des identifiants de GPU spécifiques au nœud qui provoquent l’erreur « unknown device ».

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
docker, go, kubernetes
Domaine
cloud, devops, infrastructure
Type d'issue
Bug
Difficulté
4/5
Temps estimé
3-5 jours
Activité
À l'abandon
Clarté
Plutôt claire
Accessibilité débutants
35/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.