InternLM / InternLM/Tutorial

lmdeploy教程疑问 - KV Cache量化和W4A16量化怎么叠加?

Aberta
#376 2 comentários 0 reações 0 responsáveis Ver no GitHub
Linguagem predominante
Python
Estrelas
2k
Forks
1.5k
Métricas de merge de PRs
Nenhum PR com merge em 30d

Descrição

[lmdeploy教程量化部分](https://github.com/InternLM/tutorial/blob/main/lmdeploy/lmdeploy.md#3-%E6%A8%A1%E5%9E%8B%E9%87%8F%E5%8C%96) 分别介绍了如何做KV Cache量化和W4A16量化,两者结果都得到turbomind格式的模型。
但怎么把这两者结合起来?比如在KV Cache量化的结果上做W4A16量化。
`lmdeploy lite calibrate`和`lmdeploy lite auto_awq`都𣎴接受turbomind格式的模型,该如何去叠加?

另外,如果想把量化后的模型和别人共享,怎么把turbomind格式的转换成hugging face格式的?

Guia de contribuição

Nenhum guia de contribuição indexado para este repositório

Direção de pesquisa

Comece pela seção de quantização do lmdeploy.md vinculada, especialmente pelos pontos de entrada `lmdeploy lite calibrate` e `lmdeploy lite auto_awq`. Verifique como o KV Cache e a quantização W4A16 interagem e se um caminho de conversão de Turbomind para Hugging Face está documentado. O trabalho estará concluído quando o tutorial explicar claramente o workflow compatível e as etapas de conversão para compartilhamento de modelos.

Escrita pelo modelo de indexação a partir do texto da issue.

Avaliação

Stack de tecnologia
huggingface
Domínio
documentation, machine-learning
Tipo de issue
Documentação
Dificuldade
4/5
Tempo estimado
3-5 dias
Status de atividade
Estagnada
Clareza
Precisa de esclarecimento
Facilidade para iniciantes
25/100

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.