openzim / openzim/python-scraperlib

Add utility to index ePub documents content

Aperta
#333 0 commenti 0 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

enhancement
Lingua principale
Python
Stelle
31
Fork
27
Merge medio
3g 7h
PR unite (30g)
2

Descrizione

Content of ePub documents is not indexed for full text search, while on some ZIM it is the "core" of the ZIM.

Extracting ePub info would be beneficial to multiple scrapers and should thus ideally be exposed in scraperlib, just like we did for PDFs in https://github.com/openzim/python-scraperlib/pull/182

See https://github.com/openzim/gutenberg/issues/95

Guida per i contributori

Nessuna guida per i contributori indicizzata per questo repository

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Direzione di ricerca

Inizia esaminando il lavoro di estrazione PDF nel pull request 182 di python-scraperlib e il relativo issue 95 di Gutenberg. Identifica l’entry point riutilizzabile di scraperlib necessario per l’estrazione ePub e definisci il completamento come l’esposizione dei contenuti e dei metadati ePub, in modo che gli scraper possano usarli per l’indicizzazione full-text.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Valutazione

Stack tecnologico
python
Ambito
search
Tipo di issue
Funzionalità
Difficoltà
3/5
Tempo stimato
1-2 giorni
Stato di attività
Tranquilla
Chiarezza
Abbastanza chiara
Idoneità per principianti
55/100

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.