Document how a schema can have columns splitted over different files
- Vorherrschende Sprache
- Java
- Sterne
- 3.1k
- Forks
- 1.6k
- Ø Merge
- 3 T. 12 Std.
- Gemergte PRs (30 T.)
- 33
Beschreibung
In the design overview is stated that the format supports that columns of a given schema are splitted over several files .
To date ,other than the reference in the parquet homepage there are no other references to these feature , not even if it is actually implemented.
As it currently stands , I believe that for a given row group you cannot have some columns in one file and other column group in another file belonging to the same schema .
If these feature was actually implemented it would open the door to faster data updates which affect a single column in very wide tables, which is typical on big data use cases .
**Reporter**: [Carlos Diogo](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=cdiogo79)
**Note**: *This issue was originally created as [PARQUET-1987](https://issues.apache.org/jira/browse/PARQUET-1987). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Rechercherichtung
Beginne mit der Designübersicht und der vorhandenen Referenz auf der Parquet-Homepage. Untersuche anschließend die Implementierung, um festzustellen, ob Spalten aus einem Schema innerhalb eines Row Groups auf mehrere Dateien aufgeteilt werden können. Dokumentiere das unterstützte Verhalten oder stelle die Einschränkung klar fest, falls dies nicht implementiert ist, einschließlich aller relevanten Einschränkungen für Aktualisierungen breiter Tabellen.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- java
- Bereich
- documentation
- Issue-Typ
- Dokumentation
- Schwierigkeit
- 4/5
- Geschätzter Aufwand
- 3-5 Tage
- Aktivitätsstatus
- Veraltet
- Klarheit
- Muss geklärt werden
- Anfängerfreundlichkeit
- 30/100