需求調查:服務對象日常會用的網頁工具,六組角色的彙整
- Vorherrschende Sprache
- JavaScript
- Sterne
- 47
- Forks
- 7
- Ø Merge
- 2 Std. 51 Min.
- Gemergte PRs (30 T.)
- 288
Beschreibung
## 為什麼做這份調查
小工具區的分組整理完(#510、#511)之後,往下想「還缺什麼」。第一輪從站上文章反推,結論全落在安全工具,實用性不足。第二輪改問另一個問題:**這個角色每天打開瀏覽器要做完哪一件事**,日常雜事跟安全工具同等看待。
分六組角色各自獨立調查,指示裡有三條硬性要求:來源附 URL 與原句、找不到就講找不到、不要產出「某地區的某類人用某個產品」那種描述(理由是那種句子等於幫監控方縮小範圍)。
## 六組獨立指到同一批任務
| 任務 | 幾組指到 | 站上現況 |
|---|---|---|
| PDF 合併、分割、壓縮、轉檔 | 4(記者、一般讀者、公民監督、NGO) | 只有 metadata 清除 |
| 錄音轉逐字稿 | 3(記者、受害者協助、NGO) | 無 |
| 掃描檔轉文字(OCR) | 3(記者、一般讀者、公民監督) | 無 |
| 影像與人臉去識別化 | 3(NGO、受害者協助、記者) | 截圖遮蔽,手動拉框、只吃靜態圖 |
| 遮蔽有沒有真的生效 | 2(記者、公民監督) | 無 |
| 名單與 CSV 的清理、比對、套版 | 2(NGO、公民監督) | 無。2026-09-11 重查後決定不做,見下方留言 |
| 文字與文件版本比對 | 2(一般讀者、NGO) | 無 |
沒有一組把安全工具排在第一。六組的第一名全部是雜事。
## 訓練現場的判準
數位安全訓練師那一組給的不是工具清單,是判準。公開的訓練準備指南寫,要讓學員裝新工具就得預留 90 分鐘,場勘要先確認網路與插座。新聞編輯室安全課的密碼那一堂 90 分鐘裡有 30 分鐘耗在安裝密碼管理器。學術實驗裡十組人用一小時互傳一封 PGP 加密信,只有一組完成。
也就是說,小工具區「開瀏覽器就能用、不用裝、離線也能跑」這個特性本身就是稀缺資源,而目前只用在安全工具上。
(這一組的引述尚未逐條查證,屬於輔助論證,不作為實作依據。)
## 已經查證過的證據
以下每條都自己抓過原文核對:
- **iLovePDF 隱私政策**:`will delete the files of your Content within TWO (2) HOURS of being processed`,並明寫不拿內容訓練 AI。政策乾淨,但兩小時內完整檔案在對方伺服器上
- **PDF 遮蔽失效**:activePDF 執行長 Tim Sullivan 談美國司法部報告,`Using Acrobat, I'm actually able to move the black boxes around. The text is still there.`([Cornell CS 存檔](https://www.cs.cornell.edu/info/people/gries/howbushoperates/justicecensoring.html))
- **貼上型工具站的外洩**:watchTowr Labs 指出 JSONFormatter.org 與 CodeBeautify.org 的 Recent Links 頁面是設計上就公開的,網址可預測,下載到 80,000+ 份提交、5GB+ 內容,光 JSONFormatter 自開站累計約 350,000 份。埋的假 AWS 金鑰在上傳後 48 小時被試用,那是連結過期後 24 小時([原始報告](https://labs.watchtowr.com/stop-putting-your-passwords-into-random-websites-yes-seriously-you-are-the-problem/))
- **轉錄服務的資料用途**:Rev `By default, Rev does leverage user data to train its AI models`,Descript 與 Otter 也各自寫明會用使用者音檔訓練([Freedom of the Press Foundation](https://freedom.press/digisec/blog/how-secure-are-journalists-favorite-transcription-tools/))
- **使用頻率**:Cision State of the Media 調查近 1,900 位記者、19 個市場,轉錄與摘要 41%、發想題目 48%、查證 43%([Press Gazette](https://pressgazette.co.uk/comment-analysis/how-journalists-are-using-ai-2026/))
- **文字比對服務**:Diffchecker 隱私政策收使用者提交的文件內容,沒有寫保留期限,保留 `aggregate, combine with other information, conduct data analytics` 的權利,政策裡沒有任何一句聲稱比對內容不儲存
## 查不到而丟掉的
| 丟掉的 | 理由 |
|---|---|
| iLovePDF 的月造訪量 | 抓不到原始頁面,不引用未驗證的數字 |
| 某大型企業在反壟斷案的遮蔽失誤 | 來源是販售遮蔽產品的部落格,沒有一手佐證 |
| 另一家 PDF 服務的一小時保留 | 調查者自陳是第三方轉述,沒讀到原文 |
| 現場多人回報彙整、即時計票 | 本質上需要共同收件端,純本機做不到 |
| 社群影片下載保存 | 跨網域被 CORS 擋,繞過去只是把第三方換成平台本身 |
## 一則需要更正的法律陳述
調查過程中出現「民事訴訟法第 363 條第 2 項要求錄音證據必須附逐字稿」的說法。查證法條原文後確認並非如此:
> 文書或前項物件,須以科技設備始能呈現其內容或提出原件有事實上之困難者,**得**僅提出呈現其內容之書面並證明其內容與原件相符。
是「得」不是「應」,條文給的是允許用書面代替原件的選項,條件是證明書面與原件相符。實務上法院可能要求逐字稿,那是慣例不是明文。這條記在這裡,避免之後有人照著寫進文章。
## 後續
拆成兩張實作 issue:
- PDF 整理與外洩檢查
- 自動臉部遮蔽
名單與 CSV 那一列,2026-09-11 重問了一輪。上面「已經查證過的證據」六條裡沒有一條是關於 CSV 的,那一列只有「兩組角色提到」這個計數撐著,所以分四個角度重查:NGO 的名單工作、公開資料核對的流程、線上 CSV 工具的資料流向、純瀏覽器處理的技術邊界。結論是不做,需求真實但形狀不對。完整的引用與理由寫在留言裡,摘要三點:有證據的那一塊是模糊比對同一個實體,而每一個認真做這件事的工具都要求人逐筆確認,超出小工具的互動成本上限。「不上傳」在這一塊已經不是差異化,五個獨立網域的原句都聲稱純瀏覽器端處理。這個利基的產品形態有人做過(dedupe.io),已經收掉。
逐字稿與 OCR 兩項需求真實,但都要載入機器學習模型。語音辨識模型的量級(數十 MB)比站上全部離線內容(41.6 MB)還大,只能做成「要用再下載」,那會打破索引頁寫明的「存進裝置之後沒有網路也能用」。這是規則要不要開例外的問題,先不做。
Beitragsleitfaden
Bewertung
Dieses Issue wurde noch nicht bewertet.