apache / apache/gluten

[VL] Add support for `approx_count_distinct_for_intervals`

Open
#11,599 1 comment 0 reactions 1 assignee Claimed by @malinjawi View on GitHub
enhancement
Dominant language
Scala
Stars
1.6k
Forks
657
Avg merge
2d 14h
Merged PRs (30d)
80

Description

An essential function for Spark CBO + histogram.

Error:

```
[main] WARN org.apache.spark.sql.execution.GlutenFallbackReporter - Validation failed for plan: ObjectHashAggregate[QueryId=113], due to:
- Validation failed with exception from: RegularHashAggregateExecTransformer, reason: Could not find a valid substrait mapping name for approx_count_distinct_for_intervals(s_store_sk#87088L, org.apache.spark.sql.catalyst.expressions.UnsafeArrayData@3915186b, 0.05, 0, 0).
```

Reference:

https://github.com/apache/spark/blob/ebd5b007fcf203eadcf8b037ab2b99577490f869/sql/core/src/main/scala/org/apache/spark/sql/execution/command/CommandUtils.scala#L401

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.