4paradigm / 4paradigm/k8s-vgpu-scheduler
显存显示问题
- Ngôn ngữ chính
- Go
- Star
- 595
- Fork
- 100
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Mô tả
容器内执行nvidia-smi返回如下:
+-----------------------------------------------------------------------------+
| NVIDIA-SMI 440.64.00 Driver Version: 440.64.00 CUDA Version: 10.2 |
|-------------------------------+----------------------+----------------------+
| GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. |
|===============================+======================+======================|
| 0 Tesla V100-SXM2... On | 00000000:00:0A.0 Off | 0 |
| N/A 36C P0 42W / 300W | 112MiB / 16160MiB | 0% Default |
+-------------------------------+----------------------+----------------------+
+-----------------------------------------------------------------------------+
| Processes: GPU Memory |
| GPU PID Type Process name Usage |
|=============================================================================|
| No running processes found |
Memory-Usage: 112MiB / 16160MiB
1. 还没程序跑,显示112MiB已使用?
2. 默认一张卡相当于3张vgpu卡,总的显存不应该是16160MiB/3吗?
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Hướng nghiên cứu
Issue này liên quan đến việc báo cáo bộ nhớ trong một device plugin vGPU của Kubernetes. Trước tiên, hãy kiểm tra mã của plugin liên quan đến việc hạch toán bộ nhớ GPU và logic ảo hóa. Kiểm tra cách đầu ra của nvidia-smi được phân tích và cách việc phân chia bộ nhớ vGPU được triển khai. Tìm các bài kiểm thử hiện có liên quan đến việc báo cáo bộ nhớ. Cần hiểu về device plugin của Kubernetes và việc quản lý GPU NVIDIA để chẩn đoán sự không nhất quán này.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Đánh giá
- Công nghệ
- docker, go, kubernetes
- Lĩnh vực
- cloud, devops, infrastructure
- Loại issue
- Lỗi
- Độ khó
- 4/5
- Thời gian dự kiến
- 3-5 ngày
- Mức độ hoạt động
- Đình trệ
- Độ rõ ràng
- Khá rõ ràng
- Mức phù hợp với người mới
- 35/100