ClickHouse / ClickHouse/ClickBench
Snowflake CSV - use parallel scan settings for uncompressed CSV
- Lingua principale
- Shell
- Stelle
- 1.1k
- Fork
- 313
- Merge medio
- 2h 43m
- PR unite (30g)
- 598
Descrizione
I noticed that for duckdb the CSV file is first uncompressed before loading. https://github.com/ClickHouse/ClickBench/blob/main/duckdb/benchmark.sh#L18C1-L18C5
For Snowflake, we also support faster parallel scanning of uncompressed CSVs.
Can we modify the Snowflake data loading test such that it loads a uncompressed CSV with MULTI_LINE=FALSE and COMPRESSION=NONE?
https://medium.com/snowflake/recap-of-snowflake-ingestion-cost-and-performance-improvements-large-csv-demo-911e6588d626?source=friends_link&sk=38a754b71aa06f51f269c6974b24abd8
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Direzione di ricerca
Individua il test di caricamento dei dati Snowflake e confronta la gestione attuale dell'input con duckdb/benchmark.sh alla riga 18. Aggiorna il test in modo che carichi un CSV non compresso usando MULTI_LINE=FALSE e COMPRESSION=NONE, quindi verifica che il benchmark venga ancora eseguito con queste impostazioni.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- shell
- Ambito
- databases
- Tipo di issue
- Funzionalità
- Difficoltà
- 3/5
- Tempo stimato
- 1-2 giorni
- Stato di attività
- Ferma
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 35/100