bigscience-workshop / bigscience-workshop/tokenization

Is there anyway to merge multiple tokenize vocab?

Ouverte
#3 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Langage dominant
Python
Étoiles
11
Forks
2
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

Hi guys, My PC RAM Is overused because the large files to tokenize, So I have to train the tokenizers for part to part, but is there any way to merge them? Thanks a lot!

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

L’issue ne nomme aucun fichier, test, implémentation du tokenizer ni format de vocabulaire. Commencez par inspecter le dépôt afin d’identifier les points d’entrée du tokenizer et les artefacts de vocabulaire pris en charge, puis déterminez quels vocabulaires entraînés indépendamment doivent être fusionnés et ce que cette fusion doit préserver pour être réussie.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
python
Domaine
machine-learning
Type d'issue
Fonctionnalité
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
25/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.