OutOfMemoryError in job commit / ParquetMetadataConverter
- Lingua principale
- Java
- Stelle
- 3.1k
- Fork
- 1.6k
- Merge medio
- 3g 12h
- PR unite (30g)
- 33
Descrizione
We're trying to write some 14B rows (about 3.6 TB in parquets) to parquet files. When our ETL job finishes, it throws this exception, and the status is "died in job commit".
2015-05-14 09:24:28,158 FATAL [CommitterEvent Processor #4] org.apache.hadoop.yarn.YarnUncaughtExceptionHandler: Thread Thread[CommitterEvent Processor #4,5,main] threw an Error. Shutting down now...
java.lang.OutOfMemoryError: GC overhead limit exceeded
at java.nio.ByteBuffer.wrap(ByteBuffer.java:373)
at java.nio.ByteBuffer.wrap(ByteBuffer.java:396)
at parquet.format.Statistics.setMin(Statistics.java:237)
at parquet.format.converter.ParquetMetadataConverter.toParquetStatistics(ParquetMetadataConverter.java:243)
at parquet.format.converter.ParquetMetadataConverter.addRowGroup(ParquetMetadataConverter.java:167)
at parquet.format.converter.ParquetMetadataConverter.toParquetMetadata(ParquetMetadataConverter.java:79)
at parquet.hadoop.ParquetFileWriter.serializeFooter(ParquetFileWriter.java:405)
at parquet.hadoop.ParquetFileWriter.writeMetadataFile(ParquetFileWriter.java:433)
at parquet.hadoop.ParquetFileWriter.writeMetadataFile(ParquetFileWriter.java:423)
at parquet.hadoop.ParquetOutputCommitter.writeMetaDataFile(ParquetOutputCommitter.java:58)
at parquet.hadoop.mapred.MapredParquetOutputCommitter.commitJob(MapredParquetOutputCommitter.java:43)
at org.apache.hadoop.mapred.OutputCommitter.commitJob(OutputCommitter.java:259)
at org.apache.hadoop.mapreduce.v2.app.commit.CommitterEventHandler$EventProcessor.handleJobCommit(CommitterEventHandler.java:253)
at org.apache.hadoop.mapreduce.v2.app.commit.CommitterEventHandler$EventProcessor.run(CommitterEventHandler.java:216)
at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1142)
at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:617)
at java.lang.Thread.run(Thread.java:745)
This seems to have something to do with the _metadata file creation, as the parquet files are perfectly fine and usable. Also I'm not sure how to alleviate this (i.e. add more heap space) since the crash is outside the Map/Reduce tasks themselves but seems in the job/application controller itself.
**Environment**: CentOS, MapR,. Scalding
**Reporter**: [hy5446](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=hy5446)
**Note**: *This issue was originally created as [PARQUET-282](https://issues.apache.org/jira/browse/PARQUET-282). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Direzione di ricerca
Inizia con parquet.hadoop.ParquetOutputCommitter.commitJob e ParquetFileWriter.writeMetadataFile, quindi segui ParquetMetadataConverter.toParquetMetadata e toParquetStatistics. Riproduci il fallimento con un numero elevato di row group e ispeziona il percorso _metadata generato; il lavoro è completato quando il commit del job termina senza l’OutOfMemoryError segnalato e i file Parquet rimangono utilizzabili.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- java
- Ambito
- data-engineering
- Tipo di issue
- Bug
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Stato di attività
- Ferma
- Chiarezza
- Da chiarire
- Idoneità per principianti
- 25/100