ClickHouse / ClickHouse/ClickBench
Snowflake CSV - use parallel scan settings for uncompressed CSV
- Lenguaje dominante
- Shell
- Estrellas
- 1.1k
- Forks
- 313
- Merge medio
- 2 h 43 min
- PR fusionados (30 d)
- 598
Descripción
I noticed that for duckdb the CSV file is first uncompressed before loading. https://github.com/ClickHouse/ClickBench/blob/main/duckdb/benchmark.sh#L18C1-L18C5
For Snowflake, we also support faster parallel scanning of uncompressed CSVs.
Can we modify the Snowflake data loading test such that it loads a uncompressed CSV with MULTI_LINE=FALSE and COMPRESSION=NONE?
https://medium.com/snowflake/recap-of-snowflake-ingestion-cost-and-performance-improvements-large-csv-demo-911e6588d626?source=friends_link&sk=38a754b71aa06f51f269c6974b24abd8
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
Localiza la prueba de carga de datos de Snowflake y compara su gestión actual de la entrada con duckdb/benchmark.sh en la línea 18. Actualiza la prueba para que cargue un CSV sin comprimir usando MULTI_LINE=FALSE y COMPRESSION=NONE, y verifica que el benchmark siga ejecutándose con esa configuración.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- shell
- Área
- databases
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 3/5
- Tiempo estimado
- 1-2 días
- Estado de actividad
- Estancado
- Claridad
- Bastante claro
- Aptitud para principiantes
- 35/100