apache / apache/parquet-java

Question on pig loader read parquet file

Aperta
#2,106 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub
Component: Java Component: Parquet Component: Pig Priority: Major Type: bug
Lingua principale
Java
Stelle
3.1k
Fork
1.6k
Merge medio
3g 12h
PR unite (30g)
33

Descrizione

When I use spark save parquet file, schema like this

```

optional group attref (LIST) {
repeated group list {
optional group element {
optional binary nid (UTF8);
optional binary nss (UTF8);
}
}
}
```

And then use parquet-pig-bundle to read this file, the read function can work, but when i need to access "nid" it have some problem

If I read other file save by pig-storer, and need nid list, pig command is:
```

B = foreach A generate value.addr.clientIp_bag.clientIp, value.guid , value.attref.nid;
```
but read spark save version I need use this:
```

B = foreach M generate value.addr.clientIp, value.guid , flatten(value.attref);
C = foreach B generate clientIp, guid, attref::element.nid;
```
and this command will flatten column

My question is pig loader have some problem when loading parquet file(save by spark)

**Reporter**: [abel_ke](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=abel_ke)

**Note**: *This issue was originally created as [PARQUET-1172](https://issues.apache.org/jira/browse/PARQUET-1172). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Il report cita parquet-pig-bundle e mette a confronto uno schema LIST scritto da Spark con l’output di Pig-storer; inizia riproducendo entrambe le letture e tracciando il modo in cui il loader espone attref e nid. Il lavoro è completato quando il file prodotto da Spark consente l’accesso previsto a nid senza un flattening indesiderato, con una copertura per lo schema e i comandi segnalati.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Ambito
data-engineering
Tipo di issue
Bug
Difficoltà
4/5
Tempo stimato
3-5 giorni
Stato di attività
Ferma
Chiarezza
Da chiarire
Idoneità per principianti
25/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.