ClickHouse / ClickHouse/JSONBench
Add "needle in the haystack" queries
- Lingua principale
- Shell
- Stelle
- 182
- Fork
- 33
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Descrizione
The JSONBench dataset contains fields with big number of unique values (aka high-cardinality fields):
- did (aka user_id)
- commit.cid (aka commit_id)
- commit.record.subject.cid
Sometimes it is needed to find all the rows for the particular rarely seen value of some field. For example, to find all the rows generated by some user. Then the following query can be used for JSONBench data:
```sql
SELECT count(*) FROM bluesky WHERE data.did = 'did:plc:stwikwzlk2mepaagokthylry'
```
Another practical query is to select a row for the given commit_id:
```sql
SELECT * FROM bluesky WHERE data.commit.cid = 'bafyreielfqkpggsdqwtbtg5tyh7iqytp64paevfjbeufnw6kc7sgmjemhm'
```
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Direzione di ricerca
Inizia individuando dove sono archiviate le definizioni delle query di JSONBench. Aggiungi le due query di lookup ad alta cardinalità descritte nell’issue: un conteggio per data.did e una ricerca di riga per data.commit.cid. Il lavoro è completato quando entrambe le query sono incluse nel benchmark e restituiscono le righe corrispondenti previste.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- sql
- Ambito
- databases
- Tipo di issue
- Funzionalità
- Difficoltà
- 2/5
- Tempo stimato
- 1-3 ore
- Stato di attività
- Ferma
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 35/100