4paradigm / 4paradigm/k8s-vgpu-scheduler
显存显示问题
- 主要语言
- Go
- 星标
- 595
- 派生
- 100
- PR 合并指标
- 30 天内没有已合并 PR
描述
容器内执行nvidia-smi返回如下:
+-----------------------------------------------------------------------------+
| NVIDIA-SMI 440.64.00 Driver Version: 440.64.00 CUDA Version: 10.2 |
|-------------------------------+----------------------+----------------------+
| GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. |
|===============================+======================+======================|
| 0 Tesla V100-SXM2... On | 00000000:00:0A.0 Off | 0 |
| N/A 36C P0 42W / 300W | 112MiB / 16160MiB | 0% Default |
+-------------------------------+----------------------+----------------------+
+-----------------------------------------------------------------------------+
| Processes: GPU Memory |
| GPU PID Type Process name Usage |
|=============================================================================|
| No running processes found |
Memory-Usage: 112MiB / 16160MiB
1. 还没程序跑,显示112MiB已使用?
2. 默认一张卡相当于3张vgpu卡,总的显存不应该是16160MiB/3吗?
贡献指南
这个仓库没有索引到贡献指南
调研方向
该 issue 涉及 Kubernetes vGPU device plugin 中的内存报告。首先检查 plugin 中负责 GPU 内存统计和虚拟化逻辑的代码。检查如何解析 nvidia-smi 的输出,以及如何实现 vGPU 内存划分。查找与内存报告相关的现有测试。要诊断这一差异,需要了解 Kubernetes device plugin 和 NVIDIA GPU 管理。
由索引模型根据 Issue 内容生成。
评估
- 技术栈
- docker, go, kubernetes
- 领域
- cloud, devops, infrastructure
- Issue 类型
- 缺陷
- 难度
- 4/5
- 预计耗时
- 3-5 天
- 活跃度
- 停滞
- 描述清晰度
- 基本清楚
- 新手友好度
- 35/100