apache / apache/datafusion

Statistic: data_size should be in ColumnStatistics.

Aperta
#7,548 2 commenti 0 reazioni 0 assegnatari Vedi su GitHub
enhancement
Lingua principale
Rust
Stelle
9.3k
Fork
2.4k
Merge medio
3g 11h
PR unite (30g)
360

Descrizione

### Is your feature request related to a problem or challenge?

_No response_

### Describe the solution you'd like

Current, we use `total_byte_size` to store whole byte_size.

But it isn't good enough, a better way is to put `avg_data_size/total_date_size` into `ColumnStatistics`.

a `total_byte_size` of statistic is useless, because we hard to propagate it in `Statistic derive`.
But if we use `Column avg_data_size` we can use it to propagate it into other Plan.

Spark:

```scala
case class ColumnStat(
....
avgLen: Option[Long] = None,
maxLen: Option[Long] = None,
...
```

Presto

```java
public final class ColumnStatistics
{
private final Estimate nullsFraction;
private final Estimate distinctValuesCount;
private final Estimate dataSize;
private final Optional range;
}

```

### Describe alternatives you've considered

_No response_

### Additional context

_No response_

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia individuando ColumnStatistics e la logica di derivazione di Statistic, quindi traccia come viene attualmente utilizzato total_byte_size quando le statistiche vengono propagate ad altri piani. L’issue è completata quando la dimensione media o totale dei dati a livello di colonna è rappresentata in ColumnStatistics e può essere propagata attraverso il relativo flusso delle statistiche di pianificazione.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
rust
Ambito
databases
Tipo di issue
Funzionalità
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
30/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.