NVIDIA / NVIDIA/nvmath-python

Support 1 * 128 and 128 * 128 block-wise quant?

Aperta
#38 2 commenti 0 reazioni 1 assegnatario Vedi su GitHub

@szkarpinski ci sta già lavorando.

Dal 6/8/2025.

enhancement
Lingua principale
Cython
Stelle
601
Fork
46
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

In the CUDA 12.9 cuBLASLt documentation, I noticed support for 1×128 and 128×128 block-wise quantization methods. However, I found that nvmath-python currently lacks bindings for this type of quantize approach. I wonder do we have any plan for support this approach?

https://docs.nvidia.com/cuda/cublas/index.html#cublasltmatmulmatrixscale-t

Guida per i contributori

Apri la guida per i contributori

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Valutazione

Questa issue non è ancora stata valutata.

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.