github / github/rust-gems

Cannot tokenize byte sequences that are not valid UTF-8 due to design flaw

Abierto
#51 1 comentario 0 reacciones 0 asignados Ver en GitHub
Lenguaje dominante
Rust
Estrellas
134
Forks
24
Merge medio
16 h 27 min
PR fusionados (30 d)
11

Descripción

Hello,

The BPE algorithm is capable of tokenizing any byte sequence, and LLMs generally accept any sequence of tokens and use token dictionaries that can successfully represent any byte sequence, but the encode method in bpe-openai accepts a type that has to be valid UTF-8. So there are lots of byte sequences, many of which are only 1 byte long, which you cannot tokenize using this library.

Guía de contribución

Abrir la guía de contribución

Línea de trabajo

Comienza inspeccionando el método encode de bpe-openai y el tipo de entrada que acepta. Determina cómo debería exponer la biblioteca secuencias de bytes arbitrarias; después, añade cobertura para entradas UTF-8 no válidas y verifica que todas las secuencias de bytes puedan tokenizarse.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
rust
Área
tooling
Tipo de issue
Error
Dificultad
5/5
Tiempo estimado
Más de una semana
Estado de actividad
Estancado
Claridad
Necesita aclaración
Aptitud para principiantes
35/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.