docling-project / docling-project/docling
Using DocumentExtractor with accelerator
- Dominant language
- Python
- Stars
- 66.4k
- Forks
- 4.8k
- Avg merge
- 2d 21h
- Merged PRs (30d)
- 84
Description
### Question
Trying to use DocumentExtractor with CUDA accelerators, but running into issues such as I have to define a backend when using ExtractionFormatOption. Can anyone give an example for using the same?
```
from docling.datamodel.base_models import InputFormat
from docling.document_extractor import DocumentExtractor
from docling.datamodel.accelerator_options import AcceleratorOptions, AcceleratorDevice
from docling.document_extractor import ExtractionFormatOption
from docling.datamodel.pipeline_options import VlmExtractionPipelineOptions
from docling.backend.abstract_backend import AbstractDocumentBackend
from docling.datamodel.document import InputDocument
pdf_options = AcceleratorOptions(num_threads=16, device=AcceleratorDevice.CUDA)
pdf_opt = ExtractionFormatOption(
pipeline_options=VlmExtractionPipelineOptions(accelerator_options=pdf_options),
backend = ???
)
extractor = DocumentExtractor(
allowed_formats=[InputFormat.PDF],
extraction_format_options={InputFormat.PDF: pdf_opt, InputFormat.PDF: pdf_opt}
)
```
Contributor guide
Assessment
This issue has not been assessed yet.