4paradigm / 4paradigm/k8s-vgpu-scheduler

显存显示问题

未关闭
#7 8 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看
主要语言
Go
星标
595
派生
100
PR 合并指标
30 天内没有已合并 PR

描述

容器内执行nvidia-smi返回如下:
+-----------------------------------------------------------------------------+
| NVIDIA-SMI 440.64.00 Driver Version: 440.64.00 CUDA Version: 10.2 |
|-------------------------------+----------------------+----------------------+
| GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. |
|===============================+======================+======================|
| 0 Tesla V100-SXM2... On | 00000000:00:0A.0 Off | 0 |
| N/A 36C P0 42W / 300W | 112MiB / 16160MiB | 0% Default |
+-------------------------------+----------------------+----------------------+

+-----------------------------------------------------------------------------+
| Processes: GPU Memory |
| GPU PID Type Process name Usage |
|=============================================================================|
| No running processes found |

Memory-Usage: 112MiB / 16160MiB
1. 还没程序跑,显示112MiB已使用?
2. 默认一张卡相当于3张vgpu卡,总的显存不应该是16160MiB/3吗?

贡献指南

这个仓库没有索引到贡献指南

调研方向

该 issue 涉及 Kubernetes vGPU device plugin 中的内存报告。首先检查 plugin 中负责 GPU 内存统计和虚拟化逻辑的代码。检查如何解析 nvidia-smi 的输出,以及如何实现 vGPU 内存划分。查找与内存报告相关的现有测试。要诊断这一差异,需要了解 Kubernetes device plugin 和 NVIDIA GPU 管理。

由索引模型根据 Issue 内容生成。

评估

技术栈
docker, go, kubernetes
领域
cloud, devops, infrastructure
Issue 类型
缺陷
难度
4/5
预计耗时
3-5 天
活跃度
停滞
描述清晰度
基本清楚
新手友好度
35/100

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。