Высокопроизводительный API поиска по 100B+ документам с p95 <250ms и ценой от $1 за 1000 запросов.
источник ↗#low-latency
4 записейKAME — tandem-архитектура, соединяющая S2S-модель с асинхронным backend-LLM для одновременного быстрого ответа и глубокого рассуждения.
источник ↗ZeroEntropy разрабатывает лёгкие, быстрые и точные rerankers, embeddings и кастомные модели, заменяющие generalist-решения в production AI-системах.
источник ↗Открытая многоязычная TTS-модель с 0.1B параметров для реального времени на CPU от MOSI.AI и OpenMOSS.
источник ↗