ClickHouse / ClickHouse/ClickBench

Snowflake CSV - use parallel scan settings for uncompressed CSV

Offen
#408 1 Kommentar 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Shell
Sterne
1.1k
Forks
313
Ø Merge
2 Std. 43 Min.
Gemergte PRs (30 T.)
598

Beschreibung

I noticed that for duckdb the CSV file is first uncompressed before loading. https://github.com/ClickHouse/ClickBench/blob/main/duckdb/benchmark.sh#L18C1-L18C5

For Snowflake, we also support faster parallel scanning of uncompressed CSVs.

Can we modify the Snowflake data loading test such that it loads a uncompressed CSV with MULTI_LINE=FALSE and COMPRESSION=NONE?

https://medium.com/snowflake/recap-of-snowflake-ingestion-cost-and-performance-improvements-large-csv-demo-911e6588d626?source=friends_link&sk=38a754b71aa06f51f269c6974b24abd8

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Finde den Snowflake-Test zum Laden von Daten und vergleiche seine aktuelle Eingabeverarbeitung mit duckdb/benchmark.sh in Zeile 18. Aktualisiere den Test so, dass er eine unkomprimierte CSV-Datei mit MULTI_LINE=FALSE und COMPRESSION=NONE lädt, und überprüfe anschließend, dass der Benchmark mit diesen Einstellungen weiterhin ausgeführt wird.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
shell
Bereich
databases
Issue-Typ
Feature
Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
35/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.