apache / apache/datafusion

Json inference of multiple files is brittle

Offen
#486 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
bug
Vorherrschende Sprache
Rust
Sterne
9.3k
Forks
2.4k
Ø Merge
3 T. 11 Std.
Gemergte PRs (30 T.)
362

Beschreibung

Currently, we run the inference on a per file basis, and limit the number of records over all files. This means that if the first file has 1000 entries and the second 1000, and we run the inference with a max of 1000 rows, the whole inference will be based on the first file alone.

IMO we should distribute the rows at least evenly with the number of files we are inferring. In the case above, this would correspond to 500 lines for each file.

Beitragsleitfaden

Beitragsleitfaden öffnen

Rechercherichtung

Im Issue ist keine Datei und kein Test genannt. Beginne damit, den Einstiegspunkt für die dateiweise JSON-Inferenz und die Tests zu finden, die das maximale Zeilenlimit abdecken; erledigt ist die Aufgabe, wenn die Inferenz das Limit auf mehrere Dateien verteilt, anstatt es allein aus der ersten Datei zu verbrauchen.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
rust
Bereich
data-engineering
Issue-Typ
Feature
Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
45/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.