Cannot tokenize byte sequences that are not valid UTF-8 due to design flaw
- Langage dominant
- Rust
- Étoiles
- 134
- Forks
- 24
- Merge moyen
- 16 h 27 min
- PR mergées (30 j)
- 11
Description
Hello,
The BPE algorithm is capable of tokenizing any byte sequence, and LLMs generally accept any sequence of tokens and use token dictionaries that can successfully represent any byte sequence, but the encode method in bpe-openai accepts a type that has to be valid UTF-8. So there are lots of byte sequences, many of which are only 1 byte long, which you cannot tokenize using this library.
Guide de contribution
Ouvrir le guide de contribution
Piste de recherche
Commencez par examiner la méthode encode de bpe-openai et le type d’entrée qu’elle accepte. Déterminez comment la bibliothèque devrait exposer des séquences d’octets arbitraires, puis ajoutez une couverture pour les entrées UTF-8 invalides et vérifiez que toutes les séquences d’octets peuvent être tokenisées.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- rust
- Domaine
- tooling
- Type d'issue
- Bug
- Difficulté
- 5/5
- Temps estimé
- Plus d'une semaine
- Activité
- À l'abandon
- Clarté
- À clarifier
- Accessibilité débutants
- 35/100