Kaggle / Kaggle/kaggle-sdk-python

Shouldn't API client pass stream = True to the requests when downloading datasets?

Ouverte
#10 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub
Langage dominant
Python
Étoiles
10
Forks
7
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

Linking to the issue of the same name in kaggle-api:

https://github.com/Kaggle/kaggle-api/issues/754

I'm raising it here since the problematic code is now maintained in kagglesdk ([KaggleHttpClient.call](https://github.com/Kaggle/kagglesdk/blob/main/kagglesdk/kaggle_http_client.py#L73) is where I think this could be fixed).

TL;DR Not using `stream=True` in `requests` is causing entire datasets to be materialized in memory which makes it impossible to download anything of even a modest size.

I refer to the linked issue for more details but happy to expand the conversation here.

Tagging @leoauri and @i-aki-y for their visibility.

Guide de contribution

Aucun guide de contribution indexé pour ce dépôt

Piste de recherche

Commencez dans kagglesdk/kaggle_http_client.py, au niveau de KaggleHttpClient.call, puis consultez l’issue kaggle-api liée pour les détails du téléchargement du dataset. Confirmez le comportement de téléchargement du client pour les datasets volumineux et vérifiez que les réponses sont traitées sans matérialiser l’intégralité du dataset en mémoire.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Évaluation

Stack technique
python
Domaine
api, backend
Type d'issue
Bug
Difficulté
3/5
Temps estimé
1-2 jours
Activité
À l'abandon
Clarté
Plutôt claire
Accessibilité débutants
45/100

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.