openzim / openzim/python-scraperlib
Add utility to index ePub documents content
Personne n'a encore pris cette issue.
- Langage dominant
- Python
- Étoiles
- 31
- Forks
- 27
- Merge moyen
- 3 j 7 h
- PR mergées (30 j)
- 2
Description
Content of ePub documents is not indexed for full text search, while on some ZIM it is the "core" of the ZIM.
Extracting ePub info would be beneficial to multiple scrapers and should thus ideally be exposed in scraperlib, just like we did for PDFs in https://github.com/openzim/python-scraperlib/pull/182
Guide de contribution
Aucun guide de contribution indexé pour ce dépôt
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Piste de recherche
Commencez par examiner le travail d’extraction PDF dans le pull request 182 de python-scraperlib ainsi que l’issue 95 associée de Gutenberg. Identifiez le point d’entrée réutilisable de scraperlib nécessaire à l’extraction ePub et définissez l’achèvement comme la mise à disposition du contenu et des métadonnées ePub afin que les scrapers puissent les utiliser pour l’indexation en texte intégral.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Évaluation
- Stack technique
- python
- Domaine
- search
- Type d'issue
- Fonctionnalité
- Difficulté
- 3/5
- Temps estimé
- 1-2 jours
- Activité
- Calme
- Clarté
- Plutôt claire
- Accessibilité débutants
- 55/100