Unlimited-OCR от Baidu
Модель baidu/Unlimited-OCR для однокадрового парсинга документов и OCR с поддержкой Transformers, vLLM, SGLang и Docker.
privacy
Эта заметка участвует в semantic memory.
AI Summary
🚀 TL;DR
baidu/Unlimited-OCR — это новая модель OCR от Baidu, развивающая Deepseek-OCR. Она предназначена для однокадрового (one-shot) парсинга длинных документов, PDF и изображений с высоким качеством извлечения текста и структуры.
📖 Что это такое
Unlimited-OCR — это мультимодальная модель image-text-to-text, опубликованная Baidu на Hugging Face. Модель доступна под именем baidu/Unlimited-OCR и ориентирована на задачи document parsing, включая работу с многостраничными PDF.
🔑 Ключевые факты
- Модель развивает Deepseek-OCR и Deepseek-OCR-2
- Поддерживает два режима: gundam (base_size=1024, image_size=640, crop_mode=True) и base (base_size=1024, image_size=1024, crop_mode=False)
- Максимальная длина генерации: 32768 токенов
- Параметры no_repeat_ngram_size=35 и ngram_window (128 для single image, 1024 для multi-page)
- Доступна на Baidu Cloud, ModelScope и Hugging Face Spaces
- Бумага: arXiv 2606.23050 (2026)
- Авторы: Youyang Yin, Huanhuan Liu и др.
- Оценка: ParseBench (LlamaIndex) — 46.17 (mean), 86.81 (text content), 0.97 (text formatting)
⚙️ Как это работает / применить
Transformers (локально):
pipe = pipeline("image-text-to-text", model="baidu/Unlimited-OCR", trust_remote_code=True)
model = AutoModel.from_pretrained("baidu/Unlimited-OCR", trust_remote_code=True, dtype="auto")
vLLM:
pip install vllm
vllm serve "baidu/Unlimited-OCR"
Docker: docker model run hf.co/baidu/Unlimited-OCR
SGLang:
python3 -m sglang.launch_server --model-path "baidu/Unlimited-OCR" --host 0.0.0.0 --port 30000
Пример вызова (Transformers):
model.infer(
tokenizer,
prompt='document parsing.',
image_file='your_image.jpg',
base_size=1024,
image_size=640,
crop_mode=True,
max_length=32768,
no_repeat_ngram_size=35,
ngram_window=128,
save_results=True
)
Для PDF:
- Конвертация страниц в PNG через PyMuPDF (dpi=300)
- Использование
model.infer_multiилиgenerate()с image_mode="base" и ngram_window=1024
Docker-образы vLLM:
vllm/vllm-openai:unlimited-ocrvllm/vllm-openai:unlimited-ocr-cu129
SGLang (детали):
- kernels==0.11.7, pymupdf==1.27.2.2
- attention-backend=fa3, page-size=1, mem-fraction-static=0.8, context-length=32768
💡 Вывод и значение
Unlimited-OCR предлагает высококачественный парсинг документов в одном проходе, с поддержкой длинного контекста и структурированного вывода. Модель интегрируется в существующие фреймворки (Transformers, vLLM, SGLang) и подходит для production-задач извлечения текста из PDF и изображений.
Благодарности: Deepseek-OCR, Deepseek-OCR-2, PaddleOCR
Дата обновлений:
- 2026/07/03 — доступна на Baidu Cloud
- 2026/06/28 — поддержка vLLM
- 2026/06/24 — демо на HF Spaces
- 2026/06/23 — arXiv и ModelScope
- 2026/06/22 — релиз модели