`NestedLoopsJoin` memory tracking may be insufficient
- Lingua principale
- Rust
- Stelle
- 9.3k
- Fork
- 2.4k
- Merge medio
- 3g 11h
- PR unite (30g)
- 360
Descrizione
### Is your feature request related to a problem or challenge?
Similarly to https://github.com/apache/arrow-datafusion/issues/7848, @metesynnada noted https://github.com/apache/arrow-datafusion/pull/8020#issuecomment-1903359773 that it is possible for `NestedLoopsJoin` to generate a single (very) large `RecordBatch`. For certain pathalogical queries this may lead to DataFusion far exceeding its memory limits and erroring out
### Describe the solution you'd like
Implement / adapt the same approach as @korowa did in https://github.com/apache/arrow-datafusion/pull/8020 (❤️ ) to incrementally create join output for joins that match many keys rather than doing it all at once.
### Describe alternatives you've considered
_No response_
### Additional context
_No response_
Guida per i contributori
Apri la guida per i contributori
Direzione di ricerca
Inizia leggendo l’issue 7848 correlata e il pull request 8020, in particolare l’approccio per produrre incrementalmente l’output del join. Poi segui NestedLoopsJoin per identificare dove molte chiavi corrispondenti creano un RecordBatch di grandi dimensioni; il lavoro è completato quando l’output del join viene prodotto incrementalmente senza superare i limiti di memoria configurati per query patologiche.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- rust
- Ambito
- databases
- Tipo di issue
- Funzionalità
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 38/100