alteryx / alteryx/evalml

Large datasets consumes excessive amounts of memory when fitting ensemble pipelines

Ouverte
#3,108 0 commentaires 1 réaction 1 personne assignée Réclamée par @christopherbunn Voir sur GitHub
performance
Langage dominant
Python
Étoiles
850
Forks
96
Métriques de merge des PR
Aucune PR mergée en 30 j

Description

When running nyc_taxi.csv dataset through AutoML search (which has ~1.5M rows and 19 columns), it uses up more than 30 GB of memory when fitting an ensembling pipeline. This excessive memory consumption causes AutoML search to crash, which prevents performance test runs from properly finishing.

This issue tracks finding the root cause of this memory consumption and potential fixes to mitigate this.

![image.png](https://images.zenhubusercontent.com/5d7a7c0116b8a20001cd5e9b/1fc20700-fdc0-42fd-816b-e3a9f90e3e9c)

Guide de contribution

Ouvrir le guide de contribution

Évaluation

Cette issue n'a pas encore été évaluée.

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.