bigscience-workshop / bigscience-workshop/tokenization

Is there anyway to merge multiple tokenize vocab?

Abierto
#3 0 comentarios 0 reacciones 0 asignados Ver en GitHub
Lenguaje dominante
Python
Estrellas
11
Forks
2
Métricas de merge de PR
Sin PR fusionados en 30 d

Descripción

Hi guys, My PC RAM Is overused because the large files to tokenize, So I have to train the tokenizers for part to part, but is there any way to merge them? Thanks a lot!

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Línea de trabajo

El issue no especifica archivos, pruebas, una implementación del tokenizer ni un formato de vocabulario. Primero inspecciona el repositorio para identificar los puntos de entrada del tokenizer y los artefactos de vocabulario compatibles; después, aclara qué vocabularios entrenados de forma independiente deben fusionarse y qué debe preservarse para que la fusión sea satisfactoria.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
python
Área
machine-learning
Tipo de issue
Nueva funcionalidad
Dificultad
5/5
Tiempo estimado
Más de una semana
Estado de actividad
Estancado
Claridad
Necesita aclaración
Aptitud para principiantes
25/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.