ClickHouse / ClickHouse/ClickBench
Snowflake CSV - use parallel scan settings for uncompressed CSV
- 主要言語
- Shell
- スター
- 1.1k
- フォーク
- 313
- 平均マージ
- 2時間 43分
- マージ済み PR(30日)
- 598
説明
I noticed that for duckdb the CSV file is first uncompressed before loading. https://github.com/ClickHouse/ClickBench/blob/main/duckdb/benchmark.sh#L18C1-L18C5
For Snowflake, we also support faster parallel scanning of uncompressed CSVs.
Can we modify the Snowflake data loading test such that it loads a uncompressed CSV with MULTI_LINE=FALSE and COMPRESSION=NONE?
https://medium.com/snowflake/recap-of-snowflake-ingestion-cost-and-performance-improvements-large-csv-demo-911e6588d626?source=friends_link&sk=38a754b71aa06f51f269c6974b24abd8
コントリビューションガイド
このリポジトリのコントリビューションガイドは索引されていません
調査の方向性
Snowflake のデータ読み込みテストを見つけ、現在の入力処理を duckdb/benchmark.sh の 18 行目と比較してください。テストを更新して、MULTI_LINE=FALSE と COMPRESSION=NONE を使用して非圧縮 CSV を読み込むようにし、その設定でベンチマークが引き続き実行されることを確認してください。
索引モデルが issue の本文から書いたものです。
評価
- 技術スタック
- shell
- 領域
- databases
- issue の種類
- 機能追加
- 難易度
- 3/5
- 見積もり時間
- 1〜2日
- 活発さ
- 停滞
- 明瞭さ
- おおむね明確
- 初心者へのやさしさ
- 35/100