deepseek-ai / deepseek-ai/DeepSeek-Coder
33B inference too slowly
Open
- Dominant language
- Python
- Stars
- 24.3k
- Forks
- 2.9k
- PR merge metrics
- No merged PRs in 30d
Description
When I load the 33B model by the method shown in below, it's too slow to generate a token. And per token is about 2.9s
```python
tokenizer = AutoTokenizer.from_pretrained(checkpoint)
tokenizer.pad_token = tokenizer.eos_token
model = AutoModelForCausalLM.from_pretrained(checkpoint, trust_remote_code=True, torch_dtype=torch.float16, low_cpu_mem_usage=True, device_map="balanced")
```
have any solution about this?
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.