apache / apache/parquet-java

Concurrent read micro benchmarks

Offen
#2,108 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: Java Component: Parquet Priority: Minor Type: enhancement
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

parquet-benchmarks only contain read and write benchmarks with a single thread.
I add concurrent Parquet file scans like typical data-parallel computing.

**Reporter**: [Takeshi Yoshimura](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=tyos)
#### PRs and other links:
- [PR440](https://github.com/apache/parquet-mr/pull/440)

**Note**: *This issue was originally created as [PARQUET-1174](https://issues.apache.org/jira/browse/PARQUET-1174). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Beginne damit, die bestehenden Lese- und Schreibbenchmarks von parquet-benchmarks sowie PR440 zu prüfen, auf den im Issue verlinkt wird. Das gewünschte Ergebnis sind nebenläufige Microbenchmarks zum Scannen von Parquet-Dateien, die Data-Parallel Computing statt ausschließlich single-threaded Reads abbilden.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
java
Bereich
data-engineering, performance
Issue-Typ
Feature
Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
35/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.