Kaggle / Kaggle/kaggle-sdk-python

Shouldn't API client pass stream = True to the requests when downloading datasets?

Offen
#10 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Vorherrschende Sprache
Python
Sterne
10
Forks
7
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

Linking to the issue of the same name in kaggle-api:

https://github.com/Kaggle/kaggle-api/issues/754

I'm raising it here since the problematic code is now maintained in kagglesdk ([KaggleHttpClient.call](https://github.com/Kaggle/kagglesdk/blob/main/kagglesdk/kaggle_http_client.py#L73) is where I think this could be fixed).

TL;DR Not using `stream=True` in `requests` is causing entire datasets to be materialized in memory which makes it impossible to download anything of even a modest size.

I refer to the linked issue for more details but happy to expand the conversation here.

Tagging @leoauri and @i-aki-y for their visibility.

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Rechercherichtung

Beginnen Sie in kagglesdk/kaggle_http_client.py bei KaggleHttpClient.call und lesen Sie anschließend das verknüpfte kaggle-api-Issue zu den Details des Dataset-Downloads. Bestätigen Sie das Download-Verhalten des Clients für größere Datensätze und überprüfen Sie, dass Antworten verarbeitet werden, ohne den gesamten Datensatz im Speicher zu materialisieren.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
python
Bereich
api, backend
Issue-Typ
Bug
Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Aktivitätsstatus
Veraltet
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
45/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.