EmailMessage.get_filename() not unquoting url encodings
オープン
まだ誰も着手していません。
stdlib
topic-email
type-bug
- 主要言語
- Python
- スター
- 77.2k
- フォーク
- 35.9k
- PR マージ指標
- PR 指標を取得中
説明
Bug report
Bug description:
import requests
from email.message import EmailMessage
def get_filename_from_url(url, url_response=None):
if url_response == None:
url_response = requests.get(url)
url_response.raise_for_status()
content_disposition = url_response.headers.get("Content-Disposition")
if content_disposition:
email_message = EmailMessage()
email_message["Content-Disposition"] = content_disposition
return email_message.get_filename()
url = "https://www.gsi.gov.in/webcenter/ShowProperty;jsessionid=yv2xehEKwHR0ZHf64V2sMbrFzRSeSGCvcxDVr9F4_rbXBVtcgKbl!1598077039!1556223610?nodeId=%2FUCM%2FDCPORT1GSIGOVI063041%2F%2FidcPrimaryFile&revision=latestreleased"
get_filename_from_url(url)
output
annoncement_of%20computer%20application%20_rti_er%20_16122014.pdf
if i use
from urllib.parse import unquote
unquote(email_message.get_filename())
i am getting unquoted output
annoncement_of computer application _rti_er _16122014.pdf
why a different unquote function is used in EmailMessage.get_filename() ?
CPython versions tested on:
CPython main branch
Operating systems tested on:
Windows
コントリビューションガイド
はじめの一歩
- issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
- 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
- リポジトリをフォークし、ブランチを切って変更します。
- issue 番号を参照したプルリクエストを送ります。
調査の方向性
エントリポイント EmailMessage.get_filename() から開始し、提供された URL とヘッダー値を使って、報告された Content-Disposition の動作を再現します。そのデコード動作を urllib.parse.unquote と比較し、続いて期待されるファイル名の扱いを明らかにし、issue でバグが確認された場合は回帰テストを追加または更新します。
索引モデルが issue の本文から書いたものです。
評価
- 技術スタック
- python
- 領域
- backend
- issue の種類
- バグ
- 難易度
- 3/5
- 見積もり時間
- 1〜2日
- 活発さ
- 停滞
- 明瞭さ
- おおむね明確
- 初心者へのやさしさ
- 35/100