maniac-tech / maniac-tech/Web-Crawling-using-Python

get_text error in webCrawling.py

未關閉
#2 0 則留言 0 個 reaction 已指派 0 人 在 GitHub 檢視

還沒有人認領這個 Issue。

bug help wanted
主要語言
HTML
星號
0
分支
1
PR 合併指標
30 天內沒有已合併 PR

描述

Traceback (most recent call last):
File "webCrawling.py", line 42, in
blog_posts = get_blog_posts(fp)
File "webCrawling.py", line 35, in get_blog_posts
'content': cleanHtml(content.value),
File "webCrawling.py", line 11, in cleanHtml
return BeautifulStoneSoup(get_text(html),
NameError: global name 'get_text' is not defined

貢獻指南

這個儲存庫沒有索引到貢獻指南

從這裡開始

  1. 先讀完整個 Issue,再讀專案的貢獻指南。
  2. 在 Issue 下留言說明你要接手 —— 這能避免兩個人做同樣的事。
  3. Fork 儲存庫,在一個分支上完成修改。
  4. 送出 Pull Request,並在描述裡引用這個 Issue 編號。

研究方向

從 webCrawling.py 的第 11 行和第 35 行開始,接著檢查 HTML 文字擷取預期如何運作,以及是否已定義或匯入 get_text。使用相同的輸入重新執行 crawler,並確認它在沒有 NameError 的情況下完成且產生 content 欄位。

由索引模型根據 Issue 內容生成。

評估

技術堆疊
python
領域
web-dev
Issue 類型
缺陷
難度
2/5
預估耗時
1-3 小時
活躍度
停滯
描述清晰度
基本清楚
新手友好度
58/100

把新 issue 寄到你的電子郵件信箱

精選適合新手參與的 GitHub issue 摘要。