maniac-tech / maniac-tech/Web-Crawling-using-Python

HTMLPARSER error in "usingHtmlParser.py"

オープン
#1 コメント 0 件 リアクション 0 件 担当者 0 名 GitHub で見る

まだ誰も着手していません。

help wanted
主要言語
HTML
スター
0
フォーク
1
PR マージ指標
30日以内にマージされた PR はありません

説明

Traceback (most recent call last):
File "usingHtmlParser.py", line 17, in
lParser.feed(urllib.urlopen(thisurl).read())
File "E:\Python27\lib\HTMLParser.py", line 108, in feed
self.goahead(0)
File "E:\Python27\lib\HTMLParser.py", line 148, in goahead
k = self.parse_starttag(i)
File "E:\Python27\lib\HTMLParser.py", line 229, in parse_starttag
endpos = self.check_for_whole_start_tag(i)
File "E:\Python27\lib\HTMLParser.py", line 304, in check_for_whole_start_tag
self.error("malformed start tag")
File "E:\Python27\lib\HTMLParser.py", line 115, in error
raise HTMLParseError(message, self.getpos())
HTMLParser.HTMLParseError: malformed start tag, at line 620, column 54

コントリビューションガイド

このリポジトリのコントリビューションガイドは索引されていません

はじめの一歩

  1. issue を最後まで読み、次にプロジェクトのコントリビューションガイドを読みます。
  2. 着手することを issue にコメントします — 二人が同じ作業をするのを防げます。
  3. リポジトリをフォークし、ブランチを切って変更します。
  4. issue 番号を参照したプルリクエストを送ります。

調査の方向性

まず17行目のusingHtmlParser.pyを使い、同じ取得済みページに対するHTMLParserの失敗を再現します。パーサーが不正な開始タグを報告している620行目、54列目付近の入力を調べます。パースの失敗が解消されるか、問題のある入力が明確に特定できれば完了です。

索引モデルが issue の本文から書いたものです。

評価

技術スタック
python
領域
backend
issue の種類
バグ
難易度
3/5
見積もり時間
1〜2日
活発さ
停滞
明瞭さ
説明が足りない
初心者へのやさしさ
30/100

新しい issue をメールで受け取る

初心者向けの GitHub issue を短くまとめたダイジェスト。