Support 1 * 128 and 128 * 128 block-wise quant?
Ouverte
@szkarpinski y travaille déjà.
Depuis le 6/8/2025.
enhancement
- Langage dominant
- Cython
- Étoiles
- 601
- Forks
- 46
- Métriques de merge des PR
- Aucune PR mergée en 30 j
Description
In the CUDA 12.9 cuBLASLt documentation, I noticed support for 1×128 and 128×128 block-wise quantization methods. However, I found that nvmath-python currently lacks bindings for this type of quantize approach. I wonder do we have any plan for support this approach?
https://docs.nvidia.com/cuda/cublas/index.html#cublasltmatmulmatrixscale-t
Guide de contribution
Ouvrir le guide de contribution
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Évaluation
Cette issue n'a pas encore été évaluée.