LFM2.5-VL-3B: мультимодальная модель для edge
LFM2.5-VL-3B — 3-миллиардная гибридная vision-language модель Liquid AI, оптимизированная для on-device инференса с поддержкой текста и изображений.
privacy
Эта заметка участвует в semantic memory.
AI Summary
LFM2.5-VL-3B — это мультимодальная версия семейства LFM2.5, построенная на базе LFM2.5-2.6B (языковая модель) и SigLIP2 NaFlex (визионный энкодер 400M). Модель обрабатывает изображения и текст, поддерживает grounding, OCR с layout-аннотацией и tool-calling. Ключевые характеристики: 32K контекст, словарь 128K, 16 языков, нативное разрешение через 512×512 патчи. Производительность: 228 tok/s на Apple M5 Max, 116 tok/s на AMD Ryzen AI Max+, 20 tok/s на Galaxy S26 Ultra, <3.3 GB RAM. Форматы: native, GGUF, ONNX, MLX. Рекомендуется для single-turn задач: realtime object detection, OCR документов, on-device перевод. Не подходит для long-context reasoning. Поддерживает ChatML-подобный шаблон и function calling в 4 шага. Benchmarks показывают значительное улучшение над LFM2-VL-3B: ScreenSpot-v2 80.7, RefCOCO 87.9, ToolSandBox 59.5. Layout annotation — экспериментальный формат с 25 типами регионов и нормализованными координатами [0,1000].