microsoft / microsoft/TransformerCompression
How to finetune with multi-gpus under data parallel setting?
オープン
まだ誰も着手していません。
- 主要言語
- Python
- スター
- 460
- フォーク
- 58
- 平均マージ
- 8時間 40分
- マージ済み PR(30日)
- 1
説明
Many thanks for sharing the amazing work!
I'm trying to finetune sliced 7b model on some large dataset with millions of samples.
But the distribute-model seems to be model parallel.
How can we finetune on the model with, let's say 8 gpus, under data parallel setting ?
コントリビューションガイド
このリポジトリのコントリビューションガイドは索引されていません
はじめの一歩
- issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
- 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
- リポジトリをフォークし、ブランチを切って変更します。
- issue 番号を参照したプルリクエストを送ります。
調査の方向性
まず distribute-model エントリポイントと、その周辺にある fine-tuning のドキュメントを読んで、モデル並列の動作が要求されているデータ並列の構成とどのように異なるのかを確認してください。この issue ではファイルやテストが指定されていません。完了には、合意された再現可能な multi-GPU fine-tuning の手順、またはそれがサポートされているかどうかを説明するドキュメントが必要です。
索引モデルが issue の本文から書いたものです。
評価
- 技術スタック
- python
- 領域
- distributed-systems, machine-learning
- issue の種類
- ドキュメント
- 難易度
- 5/5
- 見積もり時間
- 1週間以上
- 活発さ
- 停滞
- 明瞭さ
- 説明が足りない
- 初心者へのやさしさ
- 20/100