[CUB] Vectorize shuffles in `WarpReduceBatched` for <4B types and blocked output
Open
- Dominant language
- C++
- Stars
- 2.5k
- Forks
- 486
- Avg merge
- 2d 6h
- Merged PRs (30d)
- 295
Description
The blocked output arrangement would allow us to make more efficient use of warp shuffles by exchanging multiple 1B or 2B items with a single shuffle.
Contributor guide
Assessment
This issue has not been assessed yet.