anoni-net / anoni-net/docs

需求調查:服務對象日常會用的網頁工具,六組角色的彙整

Abierto
#512 1 comentario 0 reacciones 0 asignados Ver en GitHub
enhancement
Lenguaje dominante
JavaScript
Estrellas
47
Forks
7
Merge medio
2 h 51 min
PR fusionados (30 d)
288

Descripción

## 為什麼做這份調查

小工具區的分組整理完(#510、#511)之後,往下想「還缺什麼」。第一輪從站上文章反推,結論全落在安全工具,實用性不足。第二輪改問另一個問題:**這個角色每天打開瀏覽器要做完哪一件事**,日常雜事跟安全工具同等看待。

分六組角色各自獨立調查,指示裡有三條硬性要求:來源附 URL 與原句、找不到就講找不到、不要產出「某地區的某類人用某個產品」那種描述(理由是那種句子等於幫監控方縮小範圍)。

## 六組獨立指到同一批任務

| 任務 | 幾組指到 | 站上現況 |
|---|---|---|
| PDF 合併、分割、壓縮、轉檔 | 4(記者、一般讀者、公民監督、NGO) | 只有 metadata 清除 |
| 錄音轉逐字稿 | 3(記者、受害者協助、NGO) | 無 |
| 掃描檔轉文字(OCR) | 3(記者、一般讀者、公民監督) | 無 |
| 影像與人臉去識別化 | 3(NGO、受害者協助、記者) | 截圖遮蔽,手動拉框、只吃靜態圖 |
| 遮蔽有沒有真的生效 | 2(記者、公民監督) | 無 |
| 名單與 CSV 的清理、比對、套版 | 2(NGO、公民監督) | 無。2026-09-11 重查後決定不做,見下方留言 |
| 文字與文件版本比對 | 2(一般讀者、NGO) | 無 |

沒有一組把安全工具排在第一。六組的第一名全部是雜事。

## 訓練現場的判準

數位安全訓練師那一組給的不是工具清單,是判準。公開的訓練準備指南寫,要讓學員裝新工具就得預留 90 分鐘,場勘要先確認網路與插座。新聞編輯室安全課的密碼那一堂 90 分鐘裡有 30 分鐘耗在安裝密碼管理器。學術實驗裡十組人用一小時互傳一封 PGP 加密信,只有一組完成。

也就是說,小工具區「開瀏覽器就能用、不用裝、離線也能跑」這個特性本身就是稀缺資源,而目前只用在安全工具上。

(這一組的引述尚未逐條查證,屬於輔助論證,不作為實作依據。)

## 已經查證過的證據

以下每條都自己抓過原文核對:

- **iLovePDF 隱私政策**:`will delete the files of your Content within TWO (2) HOURS of being processed`,並明寫不拿內容訓練 AI。政策乾淨,但兩小時內完整檔案在對方伺服器上
- **PDF 遮蔽失效**:activePDF 執行長 Tim Sullivan 談美國司法部報告,`Using Acrobat, I'm actually able to move the black boxes around. The text is still there.`([Cornell CS 存檔](https://www.cs.cornell.edu/info/people/gries/howbushoperates/justicecensoring.html))
- **貼上型工具站的外洩**:watchTowr Labs 指出 JSONFormatter.org 與 CodeBeautify.org 的 Recent Links 頁面是設計上就公開的,網址可預測,下載到 80,000+ 份提交、5GB+ 內容,光 JSONFormatter 自開站累計約 350,000 份。埋的假 AWS 金鑰在上傳後 48 小時被試用,那是連結過期後 24 小時([原始報告](https://labs.watchtowr.com/stop-putting-your-passwords-into-random-websites-yes-seriously-you-are-the-problem/))
- **轉錄服務的資料用途**:Rev `By default, Rev does leverage user data to train its AI models`,Descript 與 Otter 也各自寫明會用使用者音檔訓練([Freedom of the Press Foundation](https://freedom.press/digisec/blog/how-secure-are-journalists-favorite-transcription-tools/))
- **使用頻率**:Cision State of the Media 調查近 1,900 位記者、19 個市場,轉錄與摘要 41%、發想題目 48%、查證 43%([Press Gazette](https://pressgazette.co.uk/comment-analysis/how-journalists-are-using-ai-2026/))
- **文字比對服務**:Diffchecker 隱私政策收使用者提交的文件內容,沒有寫保留期限,保留 `aggregate, combine with other information, conduct data analytics` 的權利,政策裡沒有任何一句聲稱比對內容不儲存

## 查不到而丟掉的

| 丟掉的 | 理由 |
|---|---|
| iLovePDF 的月造訪量 | 抓不到原始頁面,不引用未驗證的數字 |
| 某大型企業在反壟斷案的遮蔽失誤 | 來源是販售遮蔽產品的部落格,沒有一手佐證 |
| 另一家 PDF 服務的一小時保留 | 調查者自陳是第三方轉述,沒讀到原文 |
| 現場多人回報彙整、即時計票 | 本質上需要共同收件端,純本機做不到 |
| 社群影片下載保存 | 跨網域被 CORS 擋,繞過去只是把第三方換成平台本身 |

## 一則需要更正的法律陳述

調查過程中出現「民事訴訟法第 363 條第 2 項要求錄音證據必須附逐字稿」的說法。查證法條原文後確認並非如此:

> 文書或前項物件,須以科技設備始能呈現其內容或提出原件有事實上之困難者,**得**僅提出呈現其內容之書面並證明其內容與原件相符。

是「得」不是「應」,條文給的是允許用書面代替原件的選項,條件是證明書面與原件相符。實務上法院可能要求逐字稿,那是慣例不是明文。這條記在這裡,避免之後有人照著寫進文章。

## 後續

拆成兩張實作 issue:
- PDF 整理與外洩檢查
- 自動臉部遮蔽

名單與 CSV 那一列,2026-09-11 重問了一輪。上面「已經查證過的證據」六條裡沒有一條是關於 CSV 的,那一列只有「兩組角色提到」這個計數撐著,所以分四個角度重查:NGO 的名單工作、公開資料核對的流程、線上 CSV 工具的資料流向、純瀏覽器處理的技術邊界。結論是不做,需求真實但形狀不對。完整的引用與理由寫在留言裡,摘要三點:有證據的那一塊是模糊比對同一個實體,而每一個認真做這件事的工具都要求人逐筆確認,超出小工具的互動成本上限。「不上傳」在這一塊已經不是差異化,五個獨立網域的原句都聲稱純瀏覽器端處理。這個利基的產品形態有人做過(dedupe.io),已經收掉。

逐字稿與 OCR 兩項需求真實,但都要載入機器學習模型。語音辨識模型的量級(數十 MB)比站上全部離線內容(41.6 MB)還大,只能做成「要用再下載」,那會打破索引頁寫明的「存進裝置之後沒有網路也能用」。這是規則要不要開例外的問題,先不做。

Guía de contribución

Abrir la guía de contribución

Evaluación

Este issue todavía no se ha evaluado.

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.