openzim / openzim/python-scraperlib

Pass proper user-agent in `stream_file` when host is `upload.wikimedia.org`

オープン
#214 コメント 1 件 リアクション 0 件 担当者 0 名 GitHub で見る

まだ誰も着手していません。

enhancement question
主要言語
Python
スター
31
フォーク
27
平均マージ
3日 7時間
マージ済み PR(30日)
2

説明

For files hosted on upload.wikimedia.org, we must comply with their User-Agent policy at https://meta.wikimedia.org/wiki/User-Agent_policy

Doing so at scraperlib level in stream_file (main methods using in many scraper to download files / assets) would help avoid having to do so in every scraper (and forget about it over and over).

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

はじめの一歩

  1. issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
  2. 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
  3. リポジトリをフォークし、ブランチを切って変更します。
  4. issue 番号を参照したプルリクエストを送ります。

調査の方向性

stream_file の実装を特定し、upload.wikimedia.org に対するダウンロードをどのように処理しているか確認してください。リンクされている Wikimedia の User-Agent ポリシーを読み、そのうえで、そのホストへのリクエストが各 scraper に変更を加えることなく準拠した User-Agent を使用していることを検証してください。Issue では特定のテストファイルに言及していないため、既存の stream_file テストがある場所でカバレッジを追加または更新してください。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
python
領域
backend
issue の種類
機能追加
難易度
2/5
見積もり時間
1〜3時間
活発さ
停滞
明瞭さ
おおむね明確
初心者へのやさしさ
45/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。