awslabs / awslabs/python-deequ

[Feature Request]DuckDB as another analytic engine for Deequ

Aperta
#128 5 commenti 1 reazione 0 assegnatari Vedi su GitHub
enhancement feature request
Lingua principale
Jupyter Notebook
Stelle
826
Fork
158
Merge medio
9g 22h
PR unite (30g)
3

Descrizione

**Is your feature request related to a problem? Please describe.**
Today, PyDeequ is a PySpark binding for Deequ which is in Scala and Spark only. While it is a good fit for DEs, Spark is not a great fit for many DS use-cases who will have datasets fit in memory and do not want to setup Spark.

See initial ideas here https://youtu.be/fvKFOfaLwBA?t=1393 from @sscdotopen.

**Describe the solution you'd like**

As discussed in above video, it would be good to create the proper abstractions to support another analytic engine. DuckDB who has gained popularity recently can be another analytic engine. The designs need more thoughts/discussion.

Guida per i contributori

Apri la guida per i contributori

Direzione di ricerca

Inizia esaminando la relazione esistente tra PyDeequ e PySpark/Scala, quindi studia il video collegato per le idee iniziali sulle astrazioni dei motori. Esplora cosa sarebbe necessario per supportare DuckDB come motore analitico alternativo. Il lavoro è completato quando il design è concordato ed esiste un piano di implementazione chiaro per usare Deequ senza Spark.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python, scala
Ambito
data-engineering, databases
Tipo di issue
Funzionalità
Difficoltà
5/5
Tempo stimato
Più di una settimana
Stato di attività
Tranquilla
Chiarezza
Da chiarire
Idoneità per principianti
25/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.