apache / apache/parquet-java

Filtering dictionary data types using dplyr in Arrow package

Offen
#2,562 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: Parquet Priority: Major Type: bug
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

Is there any way where we can filter the dictionary data types using dplyr. Below is the example for illustration 

test %>% dplyr::filter(cols %in% c("A","B","C") %>collect(). It gives me following error

Error in dataset___Scanner__ToTable(self) :   NotImplemented: Function is_in has no kernel matching input types (array[dictionary])

Here cols is dictionary type value

**Reporter**: [Soumya Ranjan Prusty](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=prustys)

**Note**: *This issue was originally created as [PARQUET-1962](https://issues.apache.org/jira/browse/PARQUET-1962). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Beginne damit, das dplyr-Filterbeispiel mit dem dictionary-typisierten cols-Wert zu reproduzieren, und untersuche die Arrow-Verarbeitung, die meldet, dass kein passender is_in-Kernel vorhanden ist. Erledigt ist die Aufgabe, wenn das Filtern von dictionary-Datentypen mit den angegebenen Werten ohne den NotImplemented-Fehler abgeschlossen wird.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
r
Bereich
data
Issue-Typ
Bug
Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Aktivitätsstatus
Veraltet
Klarheit
Muss geklärt werden
Anfängerfreundlichkeit
25/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.