openzim / openzim/python-scraperlib
Add utility to index ePub documents content
Nessuno ha ancora preso questa issue.
- Lingua principale
- Python
- Stelle
- 31
- Fork
- 27
- Merge medio
- 3g 7h
- PR unite (30g)
- 2
Descrizione
Content of ePub documents is not indexed for full text search, while on some ZIM it is the "core" of the ZIM.
Extracting ePub info would be beneficial to multiple scrapers and should thus ideally be exposed in scraperlib, just like we did for PDFs in https://github.com/openzim/python-scraperlib/pull/182
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Direzione di ricerca
Inizia esaminando il lavoro di estrazione PDF nel pull request 182 di python-scraperlib e il relativo issue 95 di Gutenberg. Identifica l’entry point riutilizzabile di scraperlib necessario per l’estrazione ePub e definisci il completamento come l’esposizione dei contenuti e dei metadati ePub, in modo che gli scraper possano usarli per l’indicizzazione full-text.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Valutazione
- Stack tecnologico
- python
- Ambito
- search
- Tipo di issue
- Funzionalità
- Difficoltà
- 3/5
- Tempo stimato
- 1-2 giorni
- Stato di attività
- Tranquilla
- Chiarezza
- Abbastanza chiara
- Idoneità per principianti
- 55/100