abetlen / abetlen/llama-cpp-python

model.tokenize result is different from tranformers tokenizer result

Aberta
#1,468 1 comentário 0 reações 0 responsáveis Ver no GitHub
Linguagem predominante
Python
Estrelas
10.6k
Forks
1.4k
Métricas de merge de PRs
Métricas de PR pendentes

Descrição

model.tokenize result is different from tranformers tokenizer result

using the same mode Qwen1.5-7B
input_ids1 = model.tokenize(prompt.encode("utf-8"))

input_ids2 = tokenizer([prompt], padding=False)["input_ids"]

input_ids1 != input_ids2

Guia de contribuição

Abrir o guia de contribuição

Avaliação

Esta issue ainda não foi avaliada.

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.