microsoft / microsoft/TransformerCompression
How to finetune with multi-gpus under data parallel setting?
Chưa có ai nhận issue này.
- Ngôn ngữ chính
- Python
- Star
- 460
- Fork
- 58
- Merge trung bình
- 8 giờ 40 phút
- Pull request đã merge (30 ngày)
- 1
Mô tả
Many thanks for sharing the amazing work!
I'm trying to finetune sliced 7b model on some large dataset with millions of samples.
But the distribute-model seems to be model parallel.
How can we finetune on the model with, let's say 8 gpus, under data parallel setting ?
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Hướng nghiên cứu
Bắt đầu bằng cách đọc entry point distribute-model và mọi tài liệu fine-tuning liên quan để xác định hành vi song song mô hình của nó khác với thiết lập song song dữ liệu được yêu cầu như thế nào. Issue không nêu tên tệp hoặc test; để hoàn thành, cần có một quy trình fine-tuning multi-GPU đã được thống nhất và có thể tái lập, hoặc tài liệu giải thích liệu tính năng này có được hỗ trợ hay không.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Đánh giá
- Công nghệ
- python
- Lĩnh vực
- distributed-systems, machine-learning
- Loại issue
- Tài liệu
- Độ khó
- 5/5
- Thời gian dự kiến
- Hơn một tuần
- Mức độ hoạt động
- Đình trệ
- Độ rõ ràng
- Cần làm rõ
- Mức phù hợp với người mới
- 20/100