ClickHouse / ClickHouse/ClickBench

Snowflake CSV - use parallel scan settings for uncompressed CSV

オープン
#408 コメント 1 件 リアクション 0 件 担当者 0 名 GitHub で見る
主要言語
Shell
スター
1.1k
フォーク
313
平均マージ
2時間 43分
マージ済み PR(30日)
598

説明

I noticed that for duckdb the CSV file is first uncompressed before loading. https://github.com/ClickHouse/ClickBench/blob/main/duckdb/benchmark.sh#L18C1-L18C5

For Snowflake, we also support faster parallel scanning of uncompressed CSVs.

Can we modify the Snowflake data loading test such that it loads a uncompressed CSV with MULTI_LINE=FALSE and COMPRESSION=NONE?

https://medium.com/snowflake/recap-of-snowflake-ingestion-cost-and-performance-improvements-large-csv-demo-911e6588d626?source=friends_link&sk=38a754b71aa06f51f269c6974b24abd8

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

調査の方向性

Snowflake のデータ読み込みテストを見つけ、現在の入力処理を duckdb/benchmark.sh の 18 行目と比較してください。テストを更新して、MULTI_LINE=FALSE と COMPRESSION=NONE を使用して非圧縮 CSV を読み込むようにし、その設定でベンチマークが引き続き実行されることを確認してください。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
shell
領域
databases
issue の種類
機能追加
難易度
3/5
見積もり時間
1〜2日
活発さ
停滞
明瞭さ
おおむね明確
初心者へのやさしさ
35/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。