Cannot tokenize byte sequences that are not valid UTF-8 due to design flaw
- Lenguaje dominante
- Rust
- Estrellas
- 134
- Forks
- 24
- Merge medio
- 16 h 27 min
- PR fusionados (30 d)
- 11
Descripción
Hello,
The BPE algorithm is capable of tokenizing any byte sequence, and LLMs generally accept any sequence of tokens and use token dictionaries that can successfully represent any byte sequence, but the encode method in bpe-openai accepts a type that has to be valid UTF-8. So there are lots of byte sequences, many of which are only 1 byte long, which you cannot tokenize using this library.
Guía de contribución
Línea de trabajo
Comienza inspeccionando el método encode de bpe-openai y el tipo de entrada que acepta. Determina cómo debería exponer la biblioteca secuencias de bytes arbitrarias; después, añade cobertura para entradas UTF-8 no válidas y verifica que todas las secuencias de bytes puedan tokenizarse.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- rust
- Área
- tooling
- Tipo de issue
- Error
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Estado de actividad
- Estancado
- Claridad
- Necesita aclaración
- Aptitud para principiantes
- 35/100