bigscience-workshop / bigscience-workshop/tokenization

Is there anyway to merge multiple tokenize vocab?

Đang mở
#3 0 bình luận 0 reaction 0 người được giao Xem trên GitHub
Ngôn ngữ chính
Python
Star
11
Fork
2
Chỉ số merge pull request
Không có pull request nào được merge trong 30 ngày

Mô tả

Hi guys, My PC RAM Is overused because the large files to tokenize, So I have to train the tokenizers for part to part, but is there any way to merge them? Thanks a lot!

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Hướng nghiên cứu

Issue không nêu tên tệp, bài kiểm thử, triển khai tokenizer hoặc định dạng từ vựng nào. Trước tiên, hãy kiểm tra repository để xác định các entry point của tokenizer và các vocabulary artifact được hỗ trợ, sau đó làm rõ những vocabulary được huấn luyện độc lập nào cần được hợp nhất và việc hợp nhất thành công phải bảo toàn những gì.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Đánh giá

Công nghệ
python
Lĩnh vực
machine-learning
Loại issue
Tính năng
Độ khó
5/5
Thời gian dự kiến
Hơn một tuần
Mức độ hoạt động
Đình trệ
Độ rõ ràng
Cần làm rõ
Mức phù hợp với người mới
25/100

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.