maniac-tech / maniac-tech/Web-Crawling-using-Python
get_text error in webCrawling.py
未关闭
还没有人认领这个 Issue。
bug
help wanted
- 主要语言
- HTML
- 星标
- 0
- 派生
- 1
- PR 合并指标
- 30 天内没有已合并 PR
描述
Traceback (most recent call last):
File "webCrawling.py", line 42, in
blog_posts = get_blog_posts(fp)
File "webCrawling.py", line 35, in get_blog_posts
'content': cleanHtml(content.value),
File "webCrawling.py", line 11, in cleanHtml
return BeautifulStoneSoup(get_text(html),
NameError: global name 'get_text' is not defined
贡献指南
这个仓库没有索引到贡献指南
从这里开始
- 先读完整个 Issue,再读项目的贡献指南。
- 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
- Fork 仓库,在一个分支上完成修改。
- 提交 Pull Request,并在描述里引用这个 Issue 编号。
调研方向
从 webCrawling.py 的第 11 行和第 35 行开始,然后检查 HTML 文本提取预期如何工作,以及是否定义或导入了 get_text。使用相同的输入重新运行 crawler,并验证它在没有 NameError 的情况下完成且生成 content 字段。
由索引模型根据 Issue 内容生成。
评估
- 技术栈
- python
- 领域
- web-dev
- Issue 类型
- 缺陷
- 难度
- 2/5
- 预计耗时
- 1-3 小时
- 活跃度
- 停滞
- 描述清晰度
- 基本清楚
- 新手友好度
- 58/100