Как лучше исправить ошибку с Docling?
Запускаю пример кода изПо вводным: оффициальной документации:
from docling.document_converter import DocumentConverter # Change this to a local path or another URL if desired. # Note: using the default URL requires network access; if offline, provide a # local file path (e.g., Path("/path/to/file.pdf")). source = "https://arxiv.org/pdf/2408.09869" converter = DocumentConverter() result = converter.convert(source) # Print Markdown to stdout. print(result.document.export_to_markdown())
Сейчас ситуация такая: на что сразу же получаю ошибку:
Traceback (most recent call last):
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling\datamodel\document.py", line 171, in __init__
self._init_doc(backend, path_or_stream)
~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling\datamodel\document.py", line 215, in _init_doc
self._backend = backend(self, path_or_stream=path_or_stream)
~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling\backend\docling_parse_v4_backend.py", line 206, in __init__
self.parser = DoclingPdfParser(loglevel="fatal")
~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling_parse\pdf_parser.py", line 579, in __init__
self.parser = pdf_parser_v2(level=loglevel)
~~~~~~~~~~~~~^^^^^^^^^^^^^^^^
RuntimeError: filename does not exists: C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling_parse\pdf_resources_v2/glyphs//standard/additional.dat
2025-10-28 20:18:53,881 - INFO - Going to convert document batch...
Traceback (most recent call last):
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\docling_test\docling1.py", line 10, in
result = converter.convert(source)
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\pydantic\_internal\_validate_call.py", line 39, in wrapper_function
return wrapper(*args, **kwargs)
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\pydantic\_internal\_validate_call.py", line 136, in __call__
res = self.__pydantic_validator__.validate_python(pydantic_core.ArgsKwargs(args, kwargs))
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling\document_converter.py", line 237, in convert
return next(all_res)
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling\document_converter.py", line 260, in convert_all
for conv_res in conv_res_iter:
^^^^^^^^^^^^^
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling\document_converter.py", line 332, in _convert
for item in map(
~~~^
process_func,
^^^^^^^^^^^^^
input_batch,
^^^^^^^^^^^^
):
^
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling\document_converter.py", line 379, in _process_document
conv_res = self._execute_pipeline(in_doc, raises_on_error=raises_on_error)
File "C:\Users\Макс\Desktop\VS Code Projects\RAG\.venv\Lib\site-packages\docling\document_converter.py", line 415, in _execute_pipeline
raise ConversionError(f"Input document {in_doc.file} is not valid.")
docling.exceptions.ConversionError: Input document 2408.09869v5.pdf is not valid.
-> Cannot close object, library is destroyed. This may cause a memory leak!
Сейчас ситуация такая: выполнял этот же код на другом компьютере -- все работает. Подскажите, в чем может быть проблема
Опишите проблему, и специалист поможет с настройкой, исправлением ошибки или доработкой сайта. Подберём понятный план работ без лишней переписки.
Пока нет других ответов. Будьте первым, кто поможет автору.
Ответить на вопрос
С Docling чаще всего проблема не в самом примере из документации, а в окружении: версия Python, зависимости, доступ к URL, права на загрузку PDF или отсутствие системных библиотек. В вашем примере используется PDF по внешнему URL, поэтому первым делом надо разделить две вещи: конвертер не работает вообще или он не может скачать/прочитать конкретный файл.
Сначала проверьте версии:
python --version python -m pip show docling python -m pip check
Затем попробуйте локальный PDF вместо URL. Так вы исключите сетевые ошибки, TLS, прокси и блокировки:
from pathlib import Path from docling.document_converter import DocumentConverter source = Path('test.pdf') converter = DocumentConverter() result = converter.convert(source) print(result.document.export_to_markdown())
Если локальный файл работает, а URL нет — проблема в доступе к сети или загрузке документа. Тогда скачивайте PDF заранее:
curl -L -o test.pdf https://arxiv.org/pdf/2408.09869
Если не работает даже локальный файл, пересоздайте окружение:
python -m venv .venv .venvScriptsactivate python -m pip install -U pip python -m pip install -U docling
Ещё проверьте, что вы не назвали свой файл
docling.pyи не создали папкуdoclingрядом со скриптом. Это частая причина странных импортов.Если ошибка связана с конкретным PDF, попробуйте другой файл. Некоторые PDF содержат сканы, повреждённую структуру, нестандартные шрифты или огромные изображения. Для них может потребоваться OCR или предварительная обработка.
Итог: начните с локального PDF, чистого venv и проверки зависимостей. Если локальный файл конвертируется, исправляйте загрузку URL. Если не конвертируется ничего, проблема в окружении или версии Docling.