4paradigm / 4paradigm/k8s-vgpu-scheduler
如何在Prometheus里监控gpu的使用情况
オープン
- 主要言語
- Go
- スター
- 595
- フォーク
- 100
- PR マージ指標
- 30日以内にマージされた PR はありません
説明
包括每个pod的gpu使用率,显存。有相关指标的介绍吗?
コントリビューションガイド
このリポジトリのコントリビューションガイドは索引されていません
調査の方向性
この issue では、k8s-vgpu-scheduler の Prometheus で pod ごとに GPU メトリクス(使用率、メモリ)を公開する方法について扱っています。まず、既存の device plugin のコードを調べ、どのメトリクスがすでに収集されているかを確認します。Prometheus client の統合やメトリクスエンドポイントを探します。他の GPU device plugin(NVIDIA のものなど)がどのようにメトリクスを公開しているかを調査します。新たに定義する必要があるメトリクスと、pod ごとにどのようにラベル付けするかを決定します。メトリクスに関する既存のテストがあるか確認します。
索引モデルが issue の本文から書いたものです。
評価
- 技術スタック
- kubernetes, prometheus
- 領域
- cloud, devops, observability
- issue の種類
- 機能追加
- 難易度
- 4/5
- 見積もり時間
- 3〜5日
- 活発さ
- 停滞
- 明瞭さ
- 説明が足りない
- 初心者へのやさしさ
- 25/100