ClickHouse / ClickHouse/ClickBench

Snowflake CSV - use parallel scan settings for uncompressed CSV

Abierto
#408 1 comentario 0 reacciones 0 asignados Ver en GitHub
Lenguaje dominante
Shell
Estrellas
1.1k
Forks
313
Merge medio
2 h 43 min
PR fusionados (30 d)
598

Descripción

I noticed that for duckdb the CSV file is first uncompressed before loading. https://github.com/ClickHouse/ClickBench/blob/main/duckdb/benchmark.sh#L18C1-L18C5

For Snowflake, we also support faster parallel scanning of uncompressed CSVs.

Can we modify the Snowflake data loading test such that it loads a uncompressed CSV with MULTI_LINE=FALSE and COMPRESSION=NONE?

https://medium.com/snowflake/recap-of-snowflake-ingestion-cost-and-performance-improvements-large-csv-demo-911e6588d626?source=friends_link&sk=38a754b71aa06f51f269c6974b24abd8

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Línea de trabajo

Localiza la prueba de carga de datos de Snowflake y compara su gestión actual de la entrada con duckdb/benchmark.sh en la línea 18. Actualiza la prueba para que cargue un CSV sin comprimir usando MULTI_LINE=FALSE y COMPRESSION=NONE, y verifica que el benchmark siga ejecutándose con esa configuración.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
shell
Área
databases
Tipo de issue
Nueva funcionalidad
Dificultad
3/5
Tiempo estimado
1-2 días
Estado de actividad
Estancado
Claridad
Bastante claro
Aptitud para principiantes
35/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.