JuliaGPU / JuliaGPU/GemmKernels.jl
Large LocalArray eltypes runs into compiler heuristics
Open
- Dominant language
- Julia
- Stars
- 86
- Forks
- 13
- PR merge metrics
- No merged PRs in 30d
Description
The following works:
```julia
function broken_kernel()
c_frags = LocalArray{Tuple{16}, CUDA.WMMA.Fragment{16, 16, 16, 8, Float16, CUDA.WMMA.Unspecified, CUDA.WMMA.Accumulator}}(undef)
frag = CUDA.WMMA.Fragment{16, 16, 16, 8, Float16, CUDA.WMMA.Unspecified, CUDA.WMMA.Accumulator}(ntuple(_->Float16(0), 8))
setindex(c_frags, frag, 1)
return
end
CUDA.code_llvm(GemmKernels.Kernel.broken_kernel, Tuple{})
```
But bumping the eltype to `Tuple{64}` results in an `apply_iterate`.
Contributor guide
No contributing guide indexed for this repository
Assessment
This issue has not been assessed yet.