Docling: open-source обработка документов

источник ↗ ·

Docling — инструмент с MIT-лицензией, который конвертирует PDF, Office, HTML, изображения и аудио в структурированные данные с сохранением таблиц, формул, порядка чтения и OCR.

privacy

Эта заметка участвует в semantic memory.

AI Summary

  1. Короткий обзор сути: Docling — это локальная open-source библиотека, которая превращает «хаотичные» документы (PDF, DOCX, PPTX, XLSX, HTML, изображения, аудио) в структурированный формат DoclingDocument, сохраняя таблицы, формулы, порядок чтения, OCR и метаданные.

🔑 Ключевые факты • MIT-лицензия, полностью оффлайн, Python 3.10+; • Поддерживает DocLayNet — датасет для анализа layout; • Сравнение моделей: YOLO показывает 76.8 mAP (All), MRCNN 72.4, FRCNN 73.4; • Читает двухколоночные страницы, восстанавливая логический порядок; • Выход: Markdown, HTML, JSON, DocLang; • Сохраняет provenance: page, bbox, origin.binary_hash; • Поддерживает RAG с визуальной привязкой и MCP-интеграцию для агентов.

📌 Важные детали • HybridChunker + contextualize(chunk) для RAG; • MCP-сервер: uvx --from docling-mcp docling-mcp-server; • CLI: docling https://arxiv.org/pdf/2206.01062 --to md --to json; • Три уровня развёртывания: локальная библиотека, Docling Serve, IBM watsonx managed; • Нет аккаунта, нет загрузки, нет проприетарного SDK.

💡 Вывод и значение • Установить: pip install docling; • from docling.document_converter import DocumentConverter; result = converter.convert("report.pdf"); print(result.document.export_to_markdown()); • Для агентов подключить MCP-сервер и использовать schema-based extraction; • Перейти на Docling Serve или IBM watsonx при необходимости масштабирования.

Мои мысли

graph

Карта связей