apache / apache/parquet-java

Expected distinct numbers is not parsed correctly

Offen
#2,451 2 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Component: Java Component: Parquet Priority: Critical Type: bug
Vorherrschende Sprache
Java
Sterne
3.1k
Forks
1.6k
Ø Merge
3 T. 12 Std.
Gemergte PRs (30 T.)
33

Beschreibung

In the bloom filter feature, when I pass the expected distinct numbers as below, I got null values instead of 1000 and 200.
```java

import org.apache.hadoop.conf.Configuration;

Configuration conf = new Configuration();

conf.set("parquet.bloom.filter.column.names", "content,line"); conf.set("parquet.bloom.filter.expected.ndv","1000,200");
```
 
The issue is coming from getting the system property of expected distinct numbers through [Long.getLong(expectedNDVs[i])|https://github.com/apache/parquet-mr/blob/a737141a571e3cb6cee2c252dc4406e26e6c1177/parquet-hadoop/src/main/java/org/apache/parquet/hadoop/ParquetOutputFormat.java#L251].

 

It's possible to fix it by parsing the string with Long.parseLong(expectedNDVs[i]).

 

**Reporter**: [Walid Gara](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=garawalid) / @garawalid
**Assignee**: [Walid Gara](https://issues.apache.org/jira/secure/ViewProfile.jspa?name=garawalid) / @garawalid
#### PRs and other links:
- [GitHub Pull Request #753](https://github.com/apache/parquet-mr/pull/753)

**Note**: *This issue was originally created as [PARQUET-1787](https://issues.apache.org/jira/browse/PARQUET-1787). Please see the [migration documentation](https://issues.apache.org/jira/browse/PARQUET-2502) for further details.*

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Öffne parquet-hadoop/src/main/java/org/apache/parquet/hadoop/ParquetOutputFormat.java um Zeile 251 herum und verfolge, wie parquet.bloom.filter.expected.ndv aus der Konfiguration gelesen wird. Reproduziere das Beispiel mit den Werten 1000 und 200 und überprüfe anschließend, dass die erwarteten unterschiedlichen Zahlen beibehalten werden, statt zu null zu werden.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
java
Bereich
data
Issue-Typ
Bug
Schwierigkeit
1/5
Geschätzter Aufwand
Unter einer Stunde
Aktivitätsstatus
Veraltet
Klarheit
Klar beschrieben
Anfängerfreundlichkeit
25/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.