Unlimited-OCR от Baidu

источник ↗ ·

Модель baidu/Unlimited-OCR для однокадрового парсинга документов и OCR с поддержкой Transformers, vLLM, SGLang и Docker.

privacy

Эта заметка участвует в semantic memory.

AI Summary

🚀 TL;DR

baidu/Unlimited-OCR — это новая модель OCR от Baidu, развивающая Deepseek-OCR. Она предназначена для однокадрового (one-shot) парсинга длинных документов, PDF и изображений с высоким качеством извлечения текста и структуры.

📖 Что это такое

Unlimited-OCR — это мультимодальная модель image-text-to-text, опубликованная Baidu на Hugging Face. Модель доступна под именем baidu/Unlimited-OCR и ориентирована на задачи document parsing, включая работу с многостраничными PDF.

🔑 Ключевые факты

  • Модель развивает Deepseek-OCR и Deepseek-OCR-2
  • Поддерживает два режима: gundam (base_size=1024, image_size=640, crop_mode=True) и base (base_size=1024, image_size=1024, crop_mode=False)
  • Максимальная длина генерации: 32768 токенов
  • Параметры no_repeat_ngram_size=35 и ngram_window (128 для single image, 1024 для multi-page)
  • Доступна на Baidu Cloud, ModelScope и Hugging Face Spaces
  • Бумага: arXiv 2606.23050 (2026)
  • Авторы: Youyang Yin, Huanhuan Liu и др.
  • Оценка: ParseBench (LlamaIndex) — 46.17 (mean), 86.81 (text content), 0.97 (text formatting)

⚙️ Как это работает / применить

Transformers (локально):

pipe = pipeline("image-text-to-text", model="baidu/Unlimited-OCR", trust_remote_code=True)
model = AutoModel.from_pretrained("baidu/Unlimited-OCR", trust_remote_code=True, dtype="auto")

vLLM:

pip install vllm
vllm serve "baidu/Unlimited-OCR"

Docker: docker model run hf.co/baidu/Unlimited-OCR

SGLang:

python3 -m sglang.launch_server --model-path "baidu/Unlimited-OCR" --host 0.0.0.0 --port 30000

Пример вызова (Transformers):

model.infer(
    tokenizer,
    prompt='document parsing.',
    image_file='your_image.jpg',
    base_size=1024,
    image_size=640,
    crop_mode=True,
    max_length=32768,
    no_repeat_ngram_size=35,
    ngram_window=128,
    save_results=True
)

Для PDF:

  • Конвертация страниц в PNG через PyMuPDF (dpi=300)
  • Использование model.infer_multi или generate() с image_mode="base" и ngram_window=1024

Docker-образы vLLM:

  • vllm/vllm-openai:unlimited-ocr
  • vllm/vllm-openai:unlimited-ocr-cu129

SGLang (детали):

  • kernels==0.11.7, pymupdf==1.27.2.2
  • attention-backend=fa3, page-size=1, mem-fraction-static=0.8, context-length=32768

💡 Вывод и значение

Unlimited-OCR предлагает высококачественный парсинг документов в одном проходе, с поддержкой длинного контекста и структурированного вывода. Модель интегрируется в существующие фреймворки (Transformers, vLLM, SGLang) и подходит для production-задач извлечения текста из PDF и изображений.

Благодарности: Deepseek-OCR, Deepseek-OCR-2, PaddleOCR

Дата обновлений:

  • 2026/07/03 — доступна на Baidu Cloud
  • 2026/06/28 — поддержка vLLM
  • 2026/06/24 — демо на HF Spaces
  • 2026/06/23 — arXiv и ModelScope
  • 2026/06/22 — релиз модели

Мои мысли

graph

Карта связей