apache / apache/parquet-java

Parquet Writer doesn't support to write list of Groups directly into hadoop

Aperta
#2,331 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Component: Java Component: Parquet Priority: Blocker Type: bug
Lingua principale
Java
Stelle
3.1k
Fork
1.6k
Merge medio
3g 12h
PR unite (30g)
33

Descrizione

**Problem :-**  Parquet Writer doesn't support to write list of Groups directly into hadoop.

Cause of Problem :- Suitable classes are not available
Constructors are not visible

**All possible solution which i tried -**
- ParquetWriter
- ParquetFileWriter
- ExampleParquetWriter
- ParquetRecordWriter

**Gradle dependency**
> compile group: 'org.apache.parquet', name: 'parquet-hadoop', version: '1.10.1'
 

**Is there any way to writer parquet file into Hadoop with GroupSupport?**

 

**Problem description**

I am trying to create the object of ParquetWriter class which accepts the argument (OutputFile, Mode, WriteSupport, CompressionCodecName, int, boolean, Configuration, int, ParquetProperties). But this constructor has default access modifier. I can't able to access it.

 I also used ParquetFileWriter class but it doesn't show any group support.

 

**ParquetWriter**

**![image-2019-05-31-10-41-45-674.png](https://issues.apache.org/jira/secure/attachment/12970426/image-2019-05-31-10-41-45-674.png)**

 **ParquetFileWriter**
```java

ParquetFileWriter writer = new ParquetFileWriter(HadoopOutputFile.fromPath(writePathFile, configuration), schema, Mode.CREATE, DEFAULT_BLOCK_SIZE, MAX_PADDING_SIZE_DEFAULT) ;
writer.start();
```
 

 It creates  to create parquet file in hadoop but can't facilitates to write  List of Groups in parquet file

 

**ExampleParquetWriter**
```java

ParquetWriter writer = ExampleParquetWriter.builder(writePathFile).withConf(configuration).withType(getSchema()).build();
System.out.println("Number of groups to write:" + groups.size());
for (Group g : groups) {
writer.write(g);

```
 Doesn't support for writing  parquet file in hadoop

 

 

 

 

**Reporter**: [Udit Joshi](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=udit0612)
#### Original Issue Attachments:
- [image-2019-05-31-10-41-45-674.png](https://issues.apache.org/jira/secure/attachment/12970426/image-2019-05-31-10-41-45-674.png)

**Note**: *This issue was originally created as [PARQUET-1587](https://issues.apache.org/jira/browse/PARQUET-1587). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Iniziare esaminando ParquetWriter, ParquetFileWriter, ExampleParquetWriter e ParquetRecordWriter nell’API parquet-hadoop 1.10.1, insieme all’utilizzo mostrato di ExampleParquetWriter. Determinare come dovrebbe funzionare GroupSupport con l’output di Hadoop e se il costruttore inaccessibile faccia parte del percorso necessario. Il lavoro è completato quando è disponibile e dimostrato un modo supportato per scrivere un elenco di Groups in un file Parquet di Hadoop.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
java
Ambito
data-engineering
Tipo di issue
Funzionalità
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
25/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.