apache / apache/datafusion-benchmarks

TPC-DS at different scale factors

Aperta
#30 4 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Python
Stelle
23
Fork
19
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

My understanding from #25 is that the data generation itself is somewhat random so it should be static rather than generated on the fly, so would a PR adding a fixed version of SF=10 be welcome?

My main motivation is diving into [this](https://github.com/apache/datafusion/issues/17494) DataFusion issue I've filed a while ago, right now my main way to reproduce the issue is through another benchmarking setup but that is a bit convoluted and it'll be really nice to use the built-in setup in the main repo.

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Inizia leggendo #25 e la configurazione di benchmark integrata esistente, quindi confrontala con la riproduzione di DataFusion collegata. Il lavoro sarebbe completo quando fosse incluso un dataset fisso con SF=10 e la configurazione integrata potesse riprodurre il problema di DataFusion senza la configurazione separata per il benchmarking.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python
Ambito
performance, testing
Tipo di issue
Funzionalità
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Tranquilla
Chiarezza
Abbastanza chiara
Idoneità per principianti
35/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.