apache / apache/datafusion-python

Queries on tables via `register_dataset()` much slower than `register_parquet()`

Aberta
#584 2 comentários 0 reações 0 responsáveis Ver no GitHub
bug
Linguagem predominante
Python
Estrelas
604
Forks
174
Merge médio
2d 22h
PRs com merge (30d)
5

Descrição

**Describe the bug**
Queries against tables registered with `register_dataset()` perform around 80x slower than those registered with `register_parquet()`.

**To Reproduce**
```
import datafusion
import pyarrow.dataset as ds
from pathlib import Path

ctx = datafusion.SessionContext()
ctx.register_parquet("mytable", "*.parquet")
ctx.register_dataset("mytable2", ds.dataset(list(Path(".").glob("*.parquet"))))
```
Fast:
```
%time ctx.sql('select file_date, sum("Price" * "Volume") from mytable group by file_date order by file_date').to_arrow_table()
CPU times: user 2min 41s, sys: 3.35 s, total: 2min 45s
Wall time: 2.49 s
```
Slow:
```
%time ctx.sql('select file_date, sum("Price" * "Volume") from mytable2 group by file_date order by file_date').to_arrow_table()
CPU times: user 10min 51s, sys: 5min 40s, total: 16min 31s
Wall time: 3min 18s
```

**Expected behavior**
I'd expect these to be similar performance.

**Additional context**
The reason I'm using `ds.dataset` is because the actual files I'm interesting in accessing are not conveniently globbable (they're across multiple directories). So ideally I'd be able to provide a list of files to `ctx.register_parquet()` instead of a simple glob.

Guia de contribuição

Nenhum guia de contribuição indexado para este repositório

Direção de pesquisa

Comece executando a reprodução e comparando ctx.register_parquet() e ctx.register_dataset() com a consulta agrupada; em seguida, rastreie os dois pontos de entrada de registro nos bindings do Python. O trabalho estará concluído quando os mesmos arquivos parquet tiverem desempenho de consulta comparável e register_parquet() puder aceitar uma lista de arquivos, conforme solicitado.

Escrita pelo modelo de indexação a partir do texto da issue.

Avaliação

Stack de tecnologia
python
Domínio
data-engineering, performance
Tipo de issue
Bug
Dificuldade
4/5
Tempo estimado
3-5 dias
Status de atividade
Estagnada
Clareza
Razoavelmente clara
Facilidade para iniciantes
35/100

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.