openzim / openzim/python-scraperlib
Add utility to index ePub documents content
Nadie ha tomado este issue todavía.
- Lenguaje dominante
- Python
- Estrellas
- 31
- Forks
- 27
- Merge medio
- 3 d 7 h
- PR fusionados (30 d)
- 2
Descripción
Content of ePub documents is not indexed for full text search, while on some ZIM it is the "core" of the ZIM.
Extracting ePub info would be beneficial to multiple scrapers and should thus ideally be exposed in scraperlib, just like we did for PDFs in https://github.com/openzim/python-scraperlib/pull/182
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Línea de trabajo
Comienza revisando el trabajo de extracción de PDF en el pull request 182 de python-scraperlib y el issue 95 relacionado de Gutenberg. Identifica el punto de entrada reutilizable de scraperlib necesario para la extracción de ePub y define la finalización como la exposición del contenido y los metadatos de ePub para que los scrapers puedan usarlos para la indexación de texto completo.
Escrito por el modelo de indexación a partir del texto del issue.
Evaluación
- Stack tecnológico
- python
- Área
- search
- Tipo de issue
- Nueva funcionalidad
- Dificultad
- 3/5
- Tiempo estimado
- 1-2 días
- Estado de actividad
- Tranquilo
- Claridad
- Bastante claro
- Aptitud para principiantes
- 55/100