Statistic: data_size should be in ColumnStatistics.
- Lingua principale
- Rust
- Stelle
- 9.3k
- Fork
- 2.4k
- Merge medio
- 3g 11h
- PR unite (30g)
- 360
Descrizione
### Is your feature request related to a problem or challenge?
_No response_
### Describe the solution you'd like
Current, we use `total_byte_size` to store whole byte_size.
But it isn't good enough, a better way is to put `avg_data_size/total_date_size` into `ColumnStatistics`.
a `total_byte_size` of statistic is useless, because we hard to propagate it in `Statistic derive`.
But if we use `Column avg_data_size` we can use it to propagate it into other Plan.
Spark:
```scala
case class ColumnStat(
....
avgLen: Option[Long] = None,
maxLen: Option[Long] = None,
...
```
Presto
```java
public final class ColumnStatistics
{
private final Estimate nullsFraction;
private final Estimate distinctValuesCount;
private final Estimate dataSize;
private final Optional range;
}
```
### Describe alternatives you've considered
_No response_
### Additional context
_No response_
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia individuando ColumnStatistics e la logica di derivazione di Statistic, quindi traccia come viene attualmente utilizzato total_byte_size quando le statistiche vengono propagate ad altri piani. L’issue è completata quando la dimensione media o totale dei dati a livello di colonna è rappresentata in ColumnStatistics e può essere propagata attraverso il relativo flusso delle statistiche di pianificazione.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- rust
- Ambito
- databases
- Tipo di issue
- Funzionalità
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Stato di attività
- Ferma
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 30/100