openzim / openzim/python-scraperlib

Add utility to index ePub documents content

Abierto
#333 0 comentarios 0 reacciones 0 asignados Ver en GitHub

Nadie ha tomado este issue todavía.

enhancement
Lenguaje dominante
Python
Estrellas
31
Forks
27
Merge medio
3 d 7 h
PR fusionados (30 d)
2

Descripción

Content of ePub documents is not indexed for full text search, while on some ZIM it is the "core" of the ZIM.

Extracting ePub info would be beneficial to multiple scrapers and should thus ideally be exposed in scraperlib, just like we did for PDFs in https://github.com/openzim/python-scraperlib/pull/182

See https://github.com/openzim/gutenberg/issues/95

Guía de contribución

No hay ninguna guía de contribución indexada para este repositorio

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Línea de trabajo

Comienza revisando el trabajo de extracción de PDF en el pull request 182 de python-scraperlib y el issue 95 relacionado de Gutenberg. Identifica el punto de entrada reutilizable de scraperlib necesario para la extracción de ePub y define la finalización como la exposición del contenido y los metadatos de ePub para que los scrapers puedan usarlos para la indexación de texto completo.

Escrito por el modelo de indexación a partir del texto del issue.

Evaluación

Stack tecnológico
python
Área
search
Tipo de issue
Nueva funcionalidad
Dificultad
3/5
Tiempo estimado
1-2 días
Estado de actividad
Tranquilo
Claridad
Bastante claro
Aptitud para principiantes
55/100

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.