openzim / openzim/python-scraperlib
Add utility to index ePub documents content
Dieses Issue hat noch niemand übernommen.
- Vorherrschende Sprache
- Python
- Sterne
- 31
- Forks
- 27
- Ø Merge
- 3 T. 7 Std.
- Gemergte PRs (30 T.)
- 2
Beschreibung
Content of ePub documents is not indexed for full text search, while on some ZIM it is the "core" of the ZIM.
Extracting ePub info would be beneficial to multiple scrapers and should thus ideally be exposed in scraperlib, just like we did for PDFs in https://github.com/openzim/python-scraperlib/pull/182
Beitragsleitfaden
Für dieses Repository ist kein Beitragsleitfaden indexiert
Erste Schritte
- Lies das ganze Issue und danach den Beitragsleitfaden des Projekts.
- Schreib ins Issue, dass du es übernimmst — das erspart doppelte Arbeit.
- Forke das Repository und arbeite in einem Branch.
- Öffne einen Pull Request, der die Issue-Nummer nennt.
Rechercherichtung
Beginnen Sie mit der Durchsicht der PDF-Extraktionsarbeit im pull request 182 von python-scraperlib und des zugehörigen Gutenberg issue 95. Identifizieren Sie den wiederverwendbaren scraperlib-Einstiegspunkt, der für die ePub-Extraktion benötigt wird, und definieren Sie den Abschluss so, dass ePub-Inhalte und -Metadaten bereitgestellt werden, damit Scraper sie für die Volltextindizierung verwenden können.
Vom Indexierungsmodell aus dem Issue-Text verfasst.
Bewertung
- Tech-Stack
- python
- Bereich
- search
- Issue-Typ
- Feature
- Schwierigkeit
- 3/5
- Geschätzter Aufwand
- 1-2 Tage
- Aktivitätsstatus
- Ruhig
- Klarheit
- Größtenteils klar
- Anfängerfreundlichkeit
- 55/100