4paradigm / 4paradigm/k8s-vgpu-scheduler

如何在Prometheus里监控gpu的使用情况

オープン
#40 コメント 0 件 リアクション 0 件 担当者 0 名 GitHub で見る
主要言語
Go
スター
595
フォーク
100
PR マージ指標
30日以内にマージされた PR はありません

説明

包括每个pod的gpu使用率,显存。有相关指标的介绍吗?

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

調査の方向性

この issue では、k8s-vgpu-scheduler の Prometheus で pod ごとに GPU メトリクス(使用率、メモリ)を公開する方法について扱っています。まず、既存の device plugin のコードを調べ、どのメトリクスがすでに収集されているかを確認します。Prometheus client の統合やメトリクスエンドポイントを探します。他の GPU device plugin(NVIDIA のものなど)がどのようにメトリクスを公開しているかを調査します。新たに定義する必要があるメトリクスと、pod ごとにどのようにラベル付けするかを決定します。メトリクスに関する既存のテストがあるか確認します。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
kubernetes, prometheus
領域
cloud, devops, observability
issue の種類
機能追加
難易度
4/5
見積もり時間
3〜5日
活発さ
停滞
明瞭さ
説明が足りない
初心者へのやさしさ
25/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。