anoni-net / anoni-net/docs

觀察報告:OONI Run v2 全量普查與被低估的高槓桿用法(發想與過程紀錄)

Abierto
#83 1 comentario 0 reacciones 0 asignados Ver en GitHub
documentation enhancement
Lenguaje dominante
JavaScript
Estrellas
47
Forks
7
Merge medio
2 h 51 min
PR fusionados (30 d)
288

Descripción

## 這個 issue 想做什麼

這是一份發想與過程的紀錄,想讓社群成員都知道我們做了一件事。為了佐證 #78 的測量模式提案,我們盤點了 OONI Run v2 上全部存活的清單,逐條取得生涯檢測量。結論對 #78 是正面的,所以把觀察與後續整理攤在這裡,邀請社群與 OONI 團隊一起看。

## 我們做了什麼

以 2026-06-01 為快照,我們盤點了 OONI Run v2 上全部存活的 336 條 link,透過 OONI 的 aggregation API(以 `ooni_run_link_id` 篩選)逐條取得每條 link 的生涯檢測量,再依清單主題分群。資料解讀都以這個快照為準。

## 主要發現

- 全球 Run v2 自 2024-04-24 啟用至今約 26 個月,總共只建立過 337 條 link(現存 336)。
- 全部生涯檢測量 14,171,627 筆,但分佈極不平均,**Gini 0.981**。
- 產量最少的 90% link 只佔 0.93% 檢測量,最前面 4 條就吃下約 79.5%。
- 112 條(33%)生涯檢測量為 0,193 條(57%)不到 100 筆,中位數只有 27。
- 按使用情境分群,少數幾群驅動了幾乎全部資料:

| 使用情境 | link 數 | 佔全網檢測量 |
|---|---:|---:|
| DW 國際媒體監測 | 3 | 72.4% |
| 西班牙 LaLiga 封鎖觀測 | 13 | 10.8% |
| 委內瑞拉 VSF 封鎖觀測 | 4 | 6.5% |
| 烏拉圭 UCU 研究團隊 | 49 | 6.1% |
| 其他長尾 | 199 | 2.1% |

- 清單大小(input 數)與生涯檢測量幾乎無相關。DW 的 #10004 只有 15 個 input 卻有 58 萬筆,UCU 的 #10158 塞了 4,635 個 input 也才 73 萬筆。槓桿在持續運行的後端,不在清單堆多大。

這幾群高產量使用者的共同做法,是把一條清單對準一個明確的審查或封鎖現象,配上一個持續運行的測量後端。這正是「大家不知道還可以怎麼用」的高槓桿用法。

## 社群自己的對照

我們社群先後建了兩條 Run v2,剛好示範了兩種樣態,兩條都揭露不挑好的講。

- **10238**(2025-09-15,7 個 input)生涯只跑 14 筆,落在「建了沒持續跑」的多數人那一類。
- **10328**(2026-05-15,10 個 input)配上自營節點後,半個月累積 4,659 筆,排名 39/336,進前 12%。

同一個社群、同一份清單雛形,差別只在有沒有持續運行的後端。

## 跟 #78 的關係

這份普查直接佐證 #78 的設計。真正產出資料的那一小群,做的事跟 #78 提案一模一樣,策展清單加專屬現象加持續運行的後端。死掉的 57% 缺的正是「自營節點骨幹」這塊。aggregation API 支援 `ooni_run_link_id` 篩選這件事也順帶證實了 #78 工程規劃裡的一個待測風險,之後做 dashboard collector 可以直接用。

## 接下來

- 整理成 blog:[我們普查了 336 條 OONI Run v2 清單:被低估的高槓桿用法](https://anoni.net/docs/blog/2026/06/2026-ooni-run-v2-usage-patterns/)
- 歡迎社群與 OONI 團隊在這裡留言,或到 Matrix 的 anoni-net 公開空間討論。

---

## English summary (for the OONI team)

**TL;DR.** We ran a full census of every live OONI Run v2 link to sanity-check the
measurement model proposed in #78, using OONI's public aggregation API
(filtered by `ooni_run_link_id`), snapshot 2026-06-01.

**What we found (snapshot 2026-06-01):**

- 337 links ever created over ~26 months; 336 live. 332/336 are `web_connectivity`.
- 14,171,627 lifetime measurements total, but **Gini 0.981** — extreme concentration.
- The least 90% of links account for 0.93% of measurements; the top 4 ≈ 79.5%; 3 DW links alone = 72.4%.
- 33% of links have zero measurements; 57% have <100; median = 27.
- List size barely predicts volume — the leverage is a continuously-running vantage point, not a bigger list.

**Why it matters for #78.** The high-output cohorts (DW, conexionsegura/LaLiga,
vesinfiltro) already do exactly what #78 proposes: a curated list aimed at one
censorship phenomenon, driven by a continuous backend. Our own two links
illustrate both sides honestly — `10238` (built, 14 measurements) vs `10328`
(continuously run, 4,659, top 12%).

We would welcome any pitfalls you see in this reading, and any interest in
collaborating on the data side. Full proposal context is in #78.

Guía de contribución

Abrir la guía de contribución

Evaluación

Este issue todavía no se ha evaluado.

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.