docling-project / docling-project/docling

Using DocumentExtractor with accelerator

Open
#2,280 3 comments 0 reactions 0 assignees View on GitHub
question
Dominant language
Python
Stars
66.4k
Forks
4.8k
Avg merge
2d 21h
Merged PRs (30d)
84

Description

### Question
Trying to use DocumentExtractor with CUDA accelerators, but running into issues such as I have to define a backend when using ExtractionFormatOption. Can anyone give an example for using the same?

```
from docling.datamodel.base_models import InputFormat
from docling.document_extractor import DocumentExtractor
from docling.datamodel.accelerator_options import AcceleratorOptions, AcceleratorDevice
from docling.document_extractor import ExtractionFormatOption
from docling.datamodel.pipeline_options import VlmExtractionPipelineOptions
from docling.backend.abstract_backend import AbstractDocumentBackend
from docling.datamodel.document import InputDocument

pdf_options = AcceleratorOptions(num_threads=16, device=AcceleratorDevice.CUDA)
pdf_opt = ExtractionFormatOption(
pipeline_options=VlmExtractionPipelineOptions(accelerator_options=pdf_options),
backend = ???
)

extractor = DocumentExtractor(
allowed_formats=[InputFormat.PDF],
extraction_format_options={InputFormat.PDF: pdf_opt, InputFormat.PDF: pdf_opt}
)
```

Contributor guide

Open the contributing guide

Assessment

This issue has not been assessed yet.

Get new issues in your inbox

A short digest of beginner-friendly GitHub issues.