github / github/rust-gems

Cannot tokenize byte sequences that are not valid UTF-8 due to design flaw

Ouverte
#51 1 commentaire 0 réactions 0 personnes assignées Voir sur GitHub
Langage dominant
Rust
Étoiles
134
Forks
24
Merge moyen
16 h 27 min
PR mergées (30 j)
11

Description

Hello,

The BPE algorithm is capable of tokenizing any byte sequence, and LLMs generally accept any sequence of tokens and use token dictionaries that can successfully represent any byte sequence, but the encode method in bpe-openai accepts a type that has to be valid UTF-8. So there are lots of byte sequences, many of which are only 1 byte long, which you cannot tokenize using this library.

Guide de contribution

Ouvrir le guide de contribution

Piste de recherche

Commencez par examiner la méthode encode de bpe-openai et le type d’entrée qu’elle accepte. Déterminez comment la bibliothèque devrait exposer des séquences d’octets arbitraires, puis ajoutez une couverture pour les entrées UTF-8 invalides et vérifiez que toutes les séquences d’octets peuvent être tokenisées.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
rust
Domaine
tooling
Type d'issue
Bug
Difficulté
5/5
Temps estimé
Plus d'une semaine
Activité
À l'abandon
Clarté
À clarifier
Accessibilité débutants
35/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.