Docling: open-source обработка документов
Docling — инструмент с MIT-лицензией, который конвертирует PDF, Office, HTML, изображения и аудио в структурированные данные с сохранением таблиц, формул, порядка чтения и OCR.
privacy
Эта заметка участвует в semantic memory.
AI Summary
- Короткий обзор сути: Docling — это локальная open-source библиотека, которая превращает «хаотичные» документы (PDF, DOCX, PPTX, XLSX, HTML, изображения, аудио) в структурированный формат DoclingDocument, сохраняя таблицы, формулы, порядок чтения, OCR и метаданные.
🔑 Ключевые факты • MIT-лицензия, полностью оффлайн, Python 3.10+; • Поддерживает DocLayNet — датасет для анализа layout; • Сравнение моделей: YOLO показывает 76.8 mAP (All), MRCNN 72.4, FRCNN 73.4; • Читает двухколоночные страницы, восстанавливая логический порядок; • Выход: Markdown, HTML, JSON, DocLang; • Сохраняет provenance: page, bbox, origin.binary_hash; • Поддерживает RAG с визуальной привязкой и MCP-интеграцию для агентов.
📌 Важные детали • HybridChunker + contextualize(chunk) для RAG; • MCP-сервер: uvx --from docling-mcp docling-mcp-server; • CLI: docling https://arxiv.org/pdf/2206.01062 --to md --to json; • Три уровня развёртывания: локальная библиотека, Docling Serve, IBM watsonx managed; • Нет аккаунта, нет загрузки, нет проприетарного SDK.
💡 Вывод и значение • Установить: pip install docling; • from docling.document_converter import DocumentConverter; result = converter.convert("report.pdf"); print(result.document.export_to_markdown()); • Для агентов подключить MCP-сервер и использовать schema-based extraction; • Перейти на Docling Serve или IBM watsonx при необходимости масштабирования.