bigscience-workshop / bigscience-workshop/tokenization
Is there anyway to merge multiple tokenize vocab?
未关闭
- 主要语言
- Python
- 星标
- 11
- 派生
- 2
- PR 合并指标
- 30 天内没有已合并 PR
描述
Hi guys, My PC RAM Is overused because the large files to tokenize, So I have to train the tokenizers for part to part, but is there any way to merge them? Thanks a lot!
贡献指南
这个仓库没有索引到贡献指南
调研方向
该 issue 没有指出任何文件、测试、tokenizer 实现或词汇格式。首先检查仓库,以确定 tokenizer 的入口点和受支持的词汇工件,然后明确哪些独立训练的词汇应当合并,以及成功合并必须保留什么。
由索引模型根据 Issue 内容生成。
评估
- 技术栈
- python
- 领域
- machine-learning
- Issue 类型
- 功能
- 难度
- 5/5
- 预计耗时
- 一周以上
- 活跃度
- 停滞
- 描述清晰度
- 需要澄清
- 新手友好度
- 25/100