Implement some more data loading utilities
- Dominant language
- Python
- Stars
- 951
- Forks
- 262
- PR merge metrics
- No merged PRs in 30d
Description
Real data:
* http://scikit-learn.org/stable/modules/generated/sklearn.datasets.fetch_mldata.html#sklearn.datasets.fetch_mldata
* http://scikit-learn.org/stable/modules/generated/sklearn.datasets.fetch_rcv1.html#sklearn.datasets.fetch_rcv1
Synthetic data:
* http://scikit-learn.org/stable/modules/generated/sklearn.datasets.make_low_rank_matrix.html#sklearn.datasets.make_low_rank_matrix
* http://scikit-learn.org/stable/modules/generated/sklearn.datasets.make_sparse_spd_matrix.html#sklearn.datasets.make_sparse_spd_matrix
This would be useful: too often I make my test matrices with `da.random.normal`, which is far from a realistic test. These are a little better, and would be a lot easier to implement.
I don't have any pressing need for real datasets I've listed, but the http://mldata.org one is very general and the RCV1 could be useful (many features, many examples, sparse dataset).
Contributor guide
Assessment
This issue has not been assessed yet.