Support 1 * 128 and 128 * 128 block-wise quant?
Abierto
@szkarpinski ya está trabajando en esto.
Desde el 6/8/2025.
enhancement
- Lenguaje dominante
- Cython
- Estrellas
- 601
- Forks
- 46
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Descripción
In the CUDA 12.9 cuBLASLt documentation, I noticed support for 1×128 and 128×128 block-wise quantization methods. However, I found that nvmath-python currently lacks bindings for this type of quantize approach. I wonder do we have any plan for support this approach?
https://docs.nvidia.com/cuda/cublas/index.html#cublasltmatmulmatrixscale-t
Guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Evaluación
Este issue todavía no se ha evaluado.