maniac-tech / maniac-tech/Web-Crawling-using-Python
get_text error in webCrawling.py
Dieses Issue hat noch niemand übernommen.
- Vorherrschende Sprache
- HTML
- Sterne
- 0
- Forks
- 1
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
Traceback (most recent call last):
File "webCrawling.py", line 42, in
blog_posts = get_blog_posts(fp)
File "webCrawling.py", line 35, in get_blog_posts
'content': cleanHtml(content.value),
File "webCrawling.py", line 11, in cleanHtml
return BeautifulStoneSoup(get_text(html),
NameError: global name 'get_text' is not defined
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Rechercherichtung
Beginnen Sie bei den Zeilen 11 und 35 von webCrawling.py und untersuchen Sie anschließend, wie die Extraktion von HTML-Text vorgesehen ist und ob get_text definiert oder importiert wird. Führen Sie den Crawler mit derselben Eingabe erneut aus und überprüfen Sie, dass er ohne den NameError abgeschlossen wird und das Feld content erzeugt.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python
- Bereich
- web-dev
- Issue-Typ
- Bug
- Schwierigkeit
- 2/5
- Geschätzter Aufwand
- 1-3 Stunden
- Aktivitätsstatus
- Veraltet
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 58/100