maniac-tech / maniac-tech/Web-Crawling-using-Python

get_text error in webCrawling.py

未关闭
#2 0 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看

还没有人认领这个 Issue。

bug help wanted
主要语言
HTML
星标
0
派生
1
PR 合并指标
30 天内没有已合并 PR

描述

Traceback (most recent call last):
File "webCrawling.py", line 42, in
blog_posts = get_blog_posts(fp)
File "webCrawling.py", line 35, in get_blog_posts
'content': cleanHtml(content.value),
File "webCrawling.py", line 11, in cleanHtml
return BeautifulStoneSoup(get_text(html),
NameError: global name 'get_text' is not defined

贡献指南

这个仓库没有索引到贡献指南

从这里开始

  1. 先读完整个 Issue,再读项目的贡献指南。
  2. 在 Issue 下留言说明你要接手 —— 这能避免两个人做同样的事。
  3. Fork 仓库,在一个分支上完成修改。
  4. 提交 Pull Request,并在描述里引用这个 Issue 编号。

调研方向

从 webCrawling.py 的第 11 行和第 35 行开始,然后检查 HTML 文本提取预期如何工作,以及是否定义或导入了 get_text。使用相同的输入重新运行 crawler,并验证它在没有 NameError 的情况下完成且生成 content 字段。

由索引模型根据 Issue 内容生成。

评估

技术栈
python
领域
web-dev
Issue 类型
缺陷
难度
2/5
预计耗时
1-3 小时
活跃度
停滞
描述清晰度
基本清楚
新手友好度
58/100

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。