microsoft / microsoft/TransformerCompression

How to finetune with multi-gpus under data parallel setting?

Đang mở
#167 1 bình luận 0 reaction 0 người được giao Xem trên GitHub

Chưa có ai nhận issue này.

Ngôn ngữ chính
Python
Star
460
Fork
58
Merge trung bình
8 giờ 40 phút
Pull request đã merge (30 ngày)
1

Mô tả

Many thanks for sharing the amazing work!

I'm trying to finetune sliced 7b model on some large dataset with millions of samples.
But the distribute-model seems to be model parallel.
How can we finetune on the model with, let's say 8 gpus, under data parallel setting ?

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Bắt đầu từ đâu

  1. Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
  2. Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
  3. Fork repository và làm thay đổi trên một nhánh.
  4. Mở pull request có tham chiếu số hiệu của issue.

Hướng nghiên cứu

Bắt đầu bằng cách đọc entry point distribute-model và mọi tài liệu fine-tuning liên quan để xác định hành vi song song mô hình của nó khác với thiết lập song song dữ liệu được yêu cầu như thế nào. Issue không nêu tên tệp hoặc test; để hoàn thành, cần có một quy trình fine-tuning multi-GPU đã được thống nhất và có thể tái lập, hoặc tài liệu giải thích liệu tính năng này có được hỗ trợ hay không.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Đánh giá

Công nghệ
python
Lĩnh vực
distributed-systems, machine-learning
Loại issue
Tài liệu
Độ khó
5/5
Thời gian dự kiến
Hơn một tuần
Mức độ hoạt động
Đình trệ
Độ rõ ràng
Cần làm rõ
Mức phù hợp với người mới
20/100

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.