bigscience-workshop / bigscience-workshop/tokenization
Is there anyway to merge multiple tokenize vocab?
Đang mở
- Ngôn ngữ chính
- Python
- Star
- 11
- Fork
- 2
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Mô tả
Hi guys, My PC RAM Is overused because the large files to tokenize, So I have to train the tokenizers for part to part, but is there any way to merge them? Thanks a lot!
Hướng dẫn đóng góp
Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này
Hướng nghiên cứu
Issue không nêu tên tệp, bài kiểm thử, triển khai tokenizer hoặc định dạng từ vựng nào. Trước tiên, hãy kiểm tra repository để xác định các entry point của tokenizer và các vocabulary artifact được hỗ trợ, sau đó làm rõ những vocabulary được huấn luyện độc lập nào cần được hợp nhất và việc hợp nhất thành công phải bảo toàn những gì.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Đánh giá
- Công nghệ
- python
- Lĩnh vực
- machine-learning
- Loại issue
- Tính năng
- Độ khó
- 5/5
- Thời gian dự kiến
- Hơn một tuần
- Mức độ hoạt động
- Đình trệ
- Độ rõ ràng
- Cần làm rõ
- Mức phù hợp với người mới
- 25/100