apache / apache/datafusion-benchmarks
TPC-DS at different scale factors
- Lingua principale
- Python
- Stelle
- 23
- Fork
- 19
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Descrizione
My understanding from #25 is that the data generation itself is somewhat random so it should be static rather than generated on the fly, so would a PR adding a fixed version of SF=10 be welcome?
My main motivation is diving into [this](https://github.com/apache/datafusion/issues/17494) DataFusion issue I've filed a while ago, right now my main way to reproduce the issue is through another benchmarking setup but that is a bit convoluted and it'll be really nice to use the built-in setup in the main repo.
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Direzione di ricerca
Inizia leggendo #25 e la configurazione di benchmark integrata esistente, quindi confrontala con la riproduzione di DataFusion collegata. Il lavoro sarebbe completo quando fosse incluso un dataset fisso con SF=10 e la configurazione integrata potesse riprodurre il problema di DataFusion senza la configurazione separata per il benchmarking.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- performance, testing
- Tipo di issue
- Funzionalità
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Stato di attività
- Tranquilla
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 35/100