apache / apache/arrow

[Parquet][C++] Support month_day_nano_interval type in Parquet

Offen
#36,799 12 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: C++ Component: Parquet Component: Python Type: enhancement
Vorherrschende Sprache
C++
Sterne
17.1k
Forks
4.3k
Ø Merge
3 T. 23 Std.
Gemergte PRs (30 T.)
101

Beschreibung

### Describe the usage question you have. Please include as many useful details as possible.

I want to generate a parquet file including type month_day_nano_interval.
This is my python code:

import pyarrow as pa
import pyarrow.parquet as pq

# Define Schema
schema = pa.schema([
('itv', pa.month_day_nano_interval())
])

# Prepare data
itv = pa.array([(1 , 15, -30),
(0 , 0, 0),
(13,25,1000),
(13,25,1000000),
(13,25,1000000000)
],
type = pa.month_day_nano_interval())

# Generate Parquet data
batch = pa.RecordBatch.from_arrays( [itv], schema = schema )
table = pa.Table.from_batches([batch])

# Write Parquet file pqtpitvl.parquet
pq.write_table(table, 'pqtpitvl.parquet')

it was failed and display error:
pyarrow.lib.ArrowNotImplementedError: Unhandled type for Arrow to Parquet schema conversion: month_day_nano_interval

Beitragsleitfaden

Beitragsleitfaden öffnen

Rechercherichtung

Beginnen Sie, indem Sie die bereitgestellte Python-Reproduktion ausführen und den durch den Fehler month_day_nano_interval identifizierten Konvertierungspfad vom Arrow- zum Parquet-Schema nachverfolgen. Prüfen Sie, wie dieser Typ an der Parquet-Grenze dargestellt wird; abgeschlossen ist die Aufgabe, wenn das Beispiel eine Parquet-Datei ohne den gemeldeten ArrowNotImplementedError schreibt.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
cpp, python
Bereich
data-engineering
Issue-Typ
Feature
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
45/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.