DFlash 2 — обновление метода параллельного speculative decoding, которое даёт +16–25 % acceptance length при 1 % overhead и сохраняет точность оригинальной модели.
источник ↗#vllm
4 записейLocal Studio — это all-in-one приложение, которое объединяет модели, рантайм и железо для запуска ИИ на домашнем устройстве без облачных провайдеров.
источник ↗Модель baidu/Unlimited-OCR для однокадрового парсинга документов и OCR с поддержкой Transformers, vLLM, SGLang и Docker.
источник ↗Marlin — 2B-параметровая видео-VLM, которая извлекает структурированные описания сцен и событий с точными таймкодами и находит временные интервалы по естественному языку.
источник ↗