apache / apache/datafusion

`NestedLoopsJoin` memory tracking may be insufficient

Aperta
#8,952 3 commenti 0 reazioni 0 assegnatari Vedi su GitHub
enhancement
Lingua principale
Rust
Stelle
9.3k
Fork
2.4k
Merge medio
3g 11h
PR unite (30g)
360

Descrizione

### Is your feature request related to a problem or challenge?

Similarly to https://github.com/apache/arrow-datafusion/issues/7848, @metesynnada noted https://github.com/apache/arrow-datafusion/pull/8020#issuecomment-1903359773 that it is possible for `NestedLoopsJoin` to generate a single (very) large `RecordBatch`. For certain pathalogical queries this may lead to DataFusion far exceeding its memory limits and erroring out

### Describe the solution you'd like

Implement / adapt the same approach as @korowa did in https://github.com/apache/arrow-datafusion/pull/8020 (❤️ ) to incrementally create join output for joins that match many keys rather than doing it all at once.

### Describe alternatives you've considered

_No response_

### Additional context

_No response_

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia leggendo l’issue 7848 correlata e il pull request 8020, in particolare l’approccio per produrre incrementalmente l’output del join. Poi segui NestedLoopsJoin per identificare dove molte chiavi corrispondenti creano un RecordBatch di grandi dimensioni; il lavoro è completato quando l’output del join viene prodotto incrementalmente senza superare i limiti di memoria configurati per query patologiche.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
rust
Ambito
databases
Tipo di issue
Funzionalità
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
38/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.