bigscience-workshop / bigscience-workshop/tokenization
Is there anyway to merge multiple tokenize vocab?
- Lenguaje dominante
- Python
- Estrellas
- 11
- Forks
- 2
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Descripción
Hi guys, My PC RAM Is overused because the large files to tokenize, So I have to train the tokenizers for part to part, but is there any way to merge them? Thanks a lot!
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
El issue no especifica archivos, pruebas, una implementación del tokenizer ni un formato de vocabulario. Primero inspecciona el repositorio para identificar los puntos de entrada del tokenizer y los artefactos de vocabulario compatibles; después, aclara qué vocabularios entrenados de forma independiente deben fusionarse y qué debe preservarse para que la fusión sea satisfactoria.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python
- Área
- machine-learning
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 25/100