apache / apache/parquet-java

Parquet Writer doesn't support to write list of Groups directly into hadoop

Offen
#2,331 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: Java Component: Parquet Priority: Blocker Type: bug
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

**Problem :-**  Parquet Writer doesn't support to write list of Groups directly into hadoop.

Cause of Problem :- Suitable classes are not available
Constructors are not visible

**All possible solution which i tried -**
- ParquetWriter
- ParquetFileWriter
- ExampleParquetWriter
- ParquetRecordWriter

**Gradle dependency**
> compile group: 'org.apache.parquet', name: 'parquet-hadoop', version: '1.10.1'
 

**Is there any way to writer parquet file into Hadoop with GroupSupport?**

 

**Problem description**

I am trying to create the object of ParquetWriter class which accepts the argument (OutputFile, Mode, WriteSupport, CompressionCodecName, int, boolean, Configuration, int, ParquetProperties). But this constructor has default access modifier. I can't able to access it.

 I also used ParquetFileWriter class but it doesn't show any group support.

 

**ParquetWriter**

**![image-2019-05-31-10-41-45-674.png](https://issues.apache.org/jira/secure/attachment/12970426/image-2019-05-31-10-41-45-674.png)**

 **ParquetFileWriter**
```java

ParquetFileWriter writer = new ParquetFileWriter(HadoopOutputFile.fromPath(writePathFile, configuration), schema, Mode.CREATE, DEFAULT_BLOCK_SIZE, MAX_PADDING_SIZE_DEFAULT) ;
writer.start();
```
 

 It creates  to create parquet file in hadoop but can't facilitates to write  List of Groups in parquet file

 

**ExampleParquetWriter**
```java

ParquetWriter writer = ExampleParquetWriter.builder(writePathFile).withConf(configuration).withType(getSchema()).build();
System.out.println("Number of groups to write:" + groups.size());
for (Group g : groups) {
writer.write(g);

```
 Doesn't support for writing  parquet file in hadoop

 

 

 

 

**Reporter**: [Udit Joshi](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=udit0612)
#### Original Issue Attachments:
- [image-2019-05-31-10-41-45-674.png](https://issues.apache.org/jira/secure/attachment/12970426/image-2019-05-31-10-41-45-674.png)

**Note**: *This issue was originally created as [PARQUET-1587](https://issues.apache.org/jira/browse/PARQUET-1587). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Beginnen Sie mit der Überprüfung von ParquetWriter, ParquetFileWriter, ExampleParquetWriter und ParquetRecordWriter in der parquet-hadoop 1.10.1 API sowie der gezeigten Verwendung von ExampleParquetWriter. Ermitteln Sie, wie GroupSupport voraussichtlich mit Hadoop-Ausgaben funktioniert und ob der nicht zugängliche Konstruktor Teil des erforderlichen Pfads ist. Als erledigt gilt, wenn eine unterstützte Möglichkeit zum Schreiben einer Liste von Groups in eine Hadoop Parquet-Datei verfügbar ist und demonstriert wird.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
java
Bereich
data-engineering
Issue-Typ
Feature
Schwierigkeit
5/5
Geschätzter Aufwand
Über eine Woche
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
25/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.