JuliaGPU / JuliaGPU/GemmKernels.jl

Large LocalArray eltypes runs into compiler heuristics

Open
#99 5 comments 0 reactions 0 assignees View on GitHub
Dominant language
Julia
Stars
86
Forks
13
PR merge metrics
No merged PRs in 30d

Description

The following works:

```julia
function broken_kernel()
c_frags = LocalArray{Tuple{16}, CUDA.WMMA.Fragment{16, 16, 16, 8, Float16, CUDA.WMMA.Unspecified, CUDA.WMMA.Accumulator}}(undef)

frag = CUDA.WMMA.Fragment{16, 16, 16, 8, Float16, CUDA.WMMA.Unspecified, CUDA.WMMA.Accumulator}(ntuple(_->Float16(0), 8))
setindex(c_frags, frag, 1)

return
end

CUDA.code_llvm(GemmKernels.Kernel.broken_kernel, Tuple{})
```

But bumping the eltype to `Tuple{64}` results in an `apply_iterate`.

Contributor guide

No contributing guide indexed for this repository

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.