Vision-плагин, который даёт текстовым моделям DeepSeek и GLM возможность читать изображения напрямую в чате без сохранения файлов.
источник ↗#multimodal
3 записейМодель baidu/Unlimited-OCR для однокадрового парсинга документов и OCR с поддержкой Transformers, vLLM, SGLang и Docker.
источник ↗Marlin-2B — это 2-миллиардная мультимодальная модель от NemoStation, доступная на Hugging Face под лицензией Apache 2.0.
источник ↗