bigscience-workshop / bigscience-workshop/tokenization
Is there anyway to merge multiple tokenize vocab?
- Langage dominant
- Python
- Étoiles
- 11
- Forks
- 2
- Métriques de merge des PR
- Aucune PR mergée en 30 j
Description
Hi guys, My PC RAM Is overused because the large files to tokenize, So I have to train the tokenizers for part to part, but is there any way to merge them? Thanks a lot!
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Piste de recherche
L’issue ne nomme aucun fichier, test, implémentation du tokenizer ni format de vocabulaire. Commencez par inspecter le dépôt afin d’identifier les points d’entrée du tokenizer et les artefacts de vocabulaire pris en charge, puis déterminez quels vocabulaires entraînés indépendamment doivent être fusionnés et ce que cette fusion doit préserver pour être réussie.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- python
- Domaine
- machine-learning
- Type d'issue
- Fonctionnalité
- Difficulté
- 5/5
- Temps estimé
- Plus d'une semaine
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 25/100