NPE in ParquetInputFormat.getSplits when no .parquet files exist
- Lenguaje dominante
- Java
- Estrellas
- 3.1k
- Forks
- 1.6k
- Merge medio
- 3 d 12 h
- PR fusionados (30 d)
- 33
Descripción
```Java
JavaSparkContext context = ...
JavaRDD rdd1 = context.parallelize(ImmutableList. of());
SQLContext sqlContext = new SQLContext(context);
StructType schema = DataTypes.createStructType(ImmutableList.of(DataTypes.createStructField("col1", DataTypes.StringType, true)));
DataFrame df = sqlContext.createDataFrame(rdd1, schema);
String url = "file:///tmp/emptyRDD";
df.saveAsParquetFile(url);
Configuration configuration = SparkHadoopUtil.get().newConfiguration(context.getConf());
JobConf jobConf = new JobConf(configuration);
ParquetInputFormat.setReadSupportClass(jobConf, RowReadSupport.class);
FileInputFormat.setInputPaths(jobConf, url);
JavaRDD rdd2 = context.newAPIHadoopRDD(
jobConf, ParquetInputFormat.class, Void.class, Row.class).values();
rdd2.count();
df = sqlContext.createDataFrame(rdd2, schema);
url = "file:///tmp/emptyRDD2";
df.saveAsParquetFile(url);
FileInputFormat.setInputPaths(jobConf, url);
JavaRDD rdd3 = context.newAPIHadoopRDD(
jobConf, ParquetInputFormat.class, Void.class, Row.class).values();
rdd3.count();
```
The NPE happens here:
```Java
java.lang.NullPointerException
at parquet.hadoop.ParquetInputFormat.getSplits(ParquetInputFormat.java:263)
at parquet.hadoop.ParquetInputFormat.getSplits(ParquetInputFormat.java:245)
at org.apache.spark.rdd.NewHadoopRDD.getPartitions(NewHadoopRDD.scala:95)
```
This stems from ParquetFileWriter.getGlobalMetaData returning null when there are no footers to read.
**Reporter**: [Paul Nepywoda](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=pnepywoda)
**Note**: *This issue was originally created as [PARQUET-294](https://issues.apache.org/jira/browse/PARQUET-294). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Línea de trabajo
Comienza con ParquetInputFormat.getSplits y sigue cómo se gestiona ParquetFileWriter.getGlobalMetaData cuando no se encuentran footers. Reproduce la secuencia empty-RDD proporcionada y verifica que tanto rdd2.count() como rdd3.count() se completen sin una NullPointerException.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- java
- Área
- data-engineering
- Tipo de issue
- Error
- Dificultad
- 3/5
- Tiempo estimado
- 1-2 días
- Estado de actividad
- Estancado
- Claridad
- Bien especificado
- Aptitud para principiantes
- 35/100