ClickHouse / ClickHouse/JSONBench

Add "needle in the haystack" queries

Aperta
#8 1 commento 2 reazioni 0 assegnatari Vedi su GitHub
Lingua principale
Shell
Stelle
182
Fork
33
Metriche di merge delle PR
Nessuna PR unita negli ultimi 30g

Descrizione

The JSONBench dataset contains fields with big number of unique values (aka high-cardinality fields):

- did (aka user_id)
- commit.cid (aka commit_id)
- commit.record.subject.cid

Sometimes it is needed to find all the rows for the particular rarely seen value of some field. For example, to find all the rows generated by some user. Then the following query can be used for JSONBench data:

```sql
SELECT count(*) FROM bluesky WHERE data.did = 'did:plc:stwikwzlk2mepaagokthylry'
```

Another practical query is to select a row for the given commit_id:

```sql
SELECT * FROM bluesky WHERE data.commit.cid = 'bafyreielfqkpggsdqwtbtg5tyh7iqytp64paevfjbeufnw6kc7sgmjemhm'
```

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Direzione di ricerca

Inizia individuando dove sono archiviate le definizioni delle query di JSONBench. Aggiungi le due query di lookup ad alta cardinalità descritte nell’issue: un conteggio per data.did e una ricerca di riga per data.commit.cid. Il lavoro è completato quando entrambe le query sono incluse nel benchmark e restituiscono le righe corrispondenti previste.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
sql
Ambito
databases
Tipo di issue
Funzionalità
Difficoltà
2/5
Tempo stimato
1-3 ore
Stato di attività
Ferma
Chiarezza
Abbastanza chiara
Idoneità per principianti
35/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.