apache / apache/parquet-java

Question on pig loader read parquet file

Offen
#2,106 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: Java Component: Parquet Component: Pig Priority: Major Type: bug
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

When I use spark save parquet file, schema like this

```

optional group attref (LIST) {
repeated group list {
optional group element {
optional binary nid (UTF8);
optional binary nss (UTF8);
}
}
}
```

And then use parquet-pig-bundle to read this file, the read function can work, but when i need to access "nid" it have some problem

If I read other file save by pig-storer, and need nid list, pig command is:
```

B = foreach A generate value.addr.clientIp_bag.clientIp, value.guid , value.attref.nid;
```
but read spark save version I need use this:
```

B = foreach M generate value.addr.clientIp, value.guid , flatten(value.attref);
C = foreach B generate clientIp, guid, attref::element.nid;
```
and this command will flatten column

My question is pig loader have some problem when loading parquet file(save by spark)

**Reporter**: [abel_ke](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=abel_ke)

**Note**: *This issue was originally created as [PARQUET-1172](https://issues.apache.org/jira/browse/PARQUET-1172). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Der Bericht nennt parquet-pig-bundle und stellt ein von Spark geschriebenes LIST-Schema der Ausgabe von Pig-storer gegenüber; beginne damit, beide Lesevorgänge zu reproduzieren und nachzuverfolgen, wie der Loader attref und nid bereitstellt. Erledigt ist die Aufgabe, wenn die von Spark erzeugte Datei den vorgesehenen Zugriff auf nid ohne unerwünschtes Flattening ermöglicht und es eine Abdeckung für das gemeldete Schema und die Befehle gibt.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Bereich
data-engineering
Issue-Typ
Bug
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
25/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.