openzim / openzim/python-scraperlib

Add utility to index ePub documents content

Offen
#333 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen

Dieses Issue hat noch niemand übernommen.

enhancement
Vorherrschende Sprache
Python
Sterne
31
Forks
27
Ø Merge
3 T. 7 Std.
Gemergte PRs (30 T.)
2

Beschreibung

Content of ePub documents is not indexed for full text search, while on some ZIM it is the "core" of the ZIM.

Extracting ePub info would be beneficial to multiple scrapers and should thus ideally be exposed in scraperlib, just like we did for PDFs in https://github.com/openzim/python-scraperlib/pull/182

See https://github.com/openzim/gutenberg/issues/95

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Erste Schritte

  1. Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
  2. Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
  3. Forke das Repository und arbeite in einem Branch.
  4. Öffne einen Pull Request, der die Issue-Nummer nennt.

Rechercherichtung

Beginnen Sie mit der Durchsicht der PDF-Extraktionsarbeit im pull request 182 von python-scraperlib und des zugehörigen Gutenberg issue 95. Identifizieren Sie den wiederverwendbaren scraperlib-Einstiegspunkt, der für die ePub-Extraktion benötigt wird, und definieren Sie den Abschluss so, dass ePub-Inhalte und -Metadaten bereitgestellt werden, damit Scraper sie für die Volltextindizierung verwenden können.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Bewertung

Tech-Stack
python
Bereich
search
Issue-Typ
Feature
Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Aktivitätsstatus
Ruhig
Klarheit
Größtenteils klar
Anfängerfreundlichkeit
55/100

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.