DwarfStar — локальный inference-движок DeepSeek V4
Самодостаточный inference-движок, заточенный под DeepSeek V4 Flash/PRO, с поддержкой Metal, CUDA, ROCm, SSD-streaming, распределённого запуска и встроенного агента.
privacy
Эта заметка участвует в semantic memory.
AI Summary
DwarfStar — узкоспециализированный, полностью самостоятельный inference-движок для DeepSeek V4 Flash и PRO. Он не является обёрткой над llama.cpp или другим рантаймом, а реализует собственный путь загрузки GGUF, рендеринга промптов, tool-calling, KV-кэша (в RAM и на диске), HTTP-сервера и встроенного coding-агента. Основные цели — максимальная производительность на высокопроизводительных персональных машинах (MacBook 96/128 ГБ+, DGX Spark, Strix Halo) и «готовность к использованию» модели end-to-end.
Ключевые факты: • Поддерживаемые бэкенды: Metal (основной), NVIDIA CUDA (в т.ч. DGX Spark), ROCm (Strix Halo). • Модели: DeepSeek V4 Flash (q2-imatrix, q2-q4-imatrix, q4-imatrix) и PRO (q2-imatrix, q4 split). • 2-битные кванты асимметричны: routed MoE эксперты — IQ2_XXS / Q2_K, остальные компоненты оставлены в более высоком качестве. • SSD-streaming: не-routed веса в памяти, routed эксперты кэшируются и подгружаются с диска при промахе. • Распределённый inference: слои делятся между машинами по TCP; префилл можно ускорить, генерация замедляется. • MTP (speculative decoding) поддерживается, но пока экспериментален. • Код частично основан на llama.cpp / GGML (MIT), но ds4.c не линкуется с GGML. • Проект создан с сильной помощью GPT-5.5; авторы предупреждают, что код beta-качества.
Как запустить / применить:
• Сборка: make (Metal), make cuda-spark, make cuda-generic, make cpu.
• Скачивание моделей: ./download_model.sh q2-imatrix, q4-imatrix, pro-q2-imatrix, pro-q4-layers00-30 + pro-q4-layers31-output.
• CLI: ./ds4 -m ./ds4flash.gguf --ctx 32768 --nothink.
• SSD-streaming: --ssd-streaming --ssd-streaming-cache-experts 32GB (или автоматический бюджет).
• Распределённый запуск: один координатор (--role coordinator --layers 0:30 --listen IP:port), остальные воркеры (--role worker --layers 31:output --coordinator IP:port).
• Сервер: ./ds4-server --ctx 100000 --kv-disk-dir /tmp/ds4-kv --kv-disk-space-mb 8192 (OpenAI/Anthropic/Responses-совместим).
• Агент: ds4-agent — нативный, без API-границ, сессии хранятся в ~/.ds4/kvcache.
• Бенчмарки и тесты: ds4-bench, ds4-eval (92 вопроса: GPQA Diamond, SuperGPQA, AIME 2025, COMPSEC).
• KV-кэш на диске: формат KVC + DSV4, с точным replay tool calls.
Вывод и значение: DwarfStar — это попытка сделать одну конкретную open-weight модель «законченной» локально: от GGUF до агента и сервера, с проверкой на официальных логитах и реальных задачах. Проект узко фокусируется на DeepSeek V4, но готов сменить модель, если появится лучшая в том же классе размера. Код beta-качества, активно развивается, рекомендуется читать CONTRIBUTING.md и sub-README перед контрибуцией.