Rapid-MLX: локальный сервер LLM на Apple Silicon

источник ↗ ·

Высокопроизводительный OpenAI-совместимый сервер для запуска LLM на Mac с Apple Silicon, построенный на MLX.

privacy

Эта заметка участвует в semantic memory.

AI Summary

🚀 TL;DR: Rapid-MLX — это высокопроизводительный сервер для локального запуска LLM на Apple Silicon, предоставляющий OpenAI-совместимый API на localhost:8000/v1. 2) Ключевые тезисы: поддерживает 221 модель из 18 семейств (Qwen 3.6, Gemma 4, DeepSeek, GPT-OSS), достигает 261 ток/с aggregate throughput и 0.08 с time-to-first-token с prompt caching; работает только на M1+ macOS 14+; полностью бесплатен и open-source под Apache 2.0. 3) Важные детали и нюансы: continuous batching, KV-trimming, RNN state snapshots, 17 MLX-моделей протестированы на coding/reasoning/tool-calling; поддержка vision/audio/video (Wan 2.2, CogVideoX-Fun, 41 аудио-алиасов); 3300+ unit-тестов; 17 parsers с recovery при квантизации; интеграция с Cursor, Claude Code, Aider, Continue, LangChain, GitHub Copilot. 4) Практические выводы: установка одной командой curl, запуск rapid-mlx serve , выбор модели по объёму RAM (16 GB → Qwen3.5-4B 147 tok/s; 128 GB → DeepSeek V4 Flash 158B 31–56 tok/s); не работает на Intel Mac.

Мои мысли

graph

Карта связей