DwarfStar — локальный inference-движок DeepSeek V4

источник ↗ ·

Самодостаточный inference-движок, заточенный под DeepSeek V4 Flash/PRO, с поддержкой Metal, CUDA, ROCm, SSD-streaming, распределённого запуска и встроенного агента.

privacy

Эта заметка участвует в semantic memory.

AI Summary

DwarfStar — узкоспециализированный, полностью самостоятельный inference-движок для DeepSeek V4 Flash и PRO. Он не является обёрткой над llama.cpp или другим рантаймом, а реализует собственный путь загрузки GGUF, рендеринга промптов, tool-calling, KV-кэша (в RAM и на диске), HTTP-сервера и встроенного coding-агента. Основные цели — максимальная производительность на высокопроизводительных персональных машинах (MacBook 96/128 ГБ+, DGX Spark, Strix Halo) и «готовность к использованию» модели end-to-end.

Ключевые факты: • Поддерживаемые бэкенды: Metal (основной), NVIDIA CUDA (в т.ч. DGX Spark), ROCm (Strix Halo). • Модели: DeepSeek V4 Flash (q2-imatrix, q2-q4-imatrix, q4-imatrix) и PRO (q2-imatrix, q4 split). • 2-битные кванты асимметричны: routed MoE эксперты — IQ2_XXS / Q2_K, остальные компоненты оставлены в более высоком качестве. • SSD-streaming: не-routed веса в памяти, routed эксперты кэшируются и подгружаются с диска при промахе. • Распределённый inference: слои делятся между машинами по TCP; префилл можно ускорить, генерация замедляется. • MTP (speculative decoding) поддерживается, но пока экспериментален. • Код частично основан на llama.cpp / GGML (MIT), но ds4.c не линкуется с GGML. • Проект создан с сильной помощью GPT-5.5; авторы предупреждают, что код beta-качества.

Как запустить / применить: • Сборка: make (Metal), make cuda-spark, make cuda-generic, make cpu. • Скачивание моделей: ./download_model.sh q2-imatrix, q4-imatrix, pro-q2-imatrix, pro-q4-layers00-30 + pro-q4-layers31-output. • CLI: ./ds4 -m ./ds4flash.gguf --ctx 32768 --nothink. • SSD-streaming: --ssd-streaming --ssd-streaming-cache-experts 32GB (или автоматический бюджет). • Распределённый запуск: один координатор (--role coordinator --layers 0:30 --listen IP:port), остальные воркеры (--role worker --layers 31:output --coordinator IP:port). • Сервер: ./ds4-server --ctx 100000 --kv-disk-dir /tmp/ds4-kv --kv-disk-space-mb 8192 (OpenAI/Anthropic/Responses-совместим). • Агент: ds4-agent — нативный, без API-границ, сессии хранятся в ~/.ds4/kvcache. • Бенчмарки и тесты: ds4-bench, ds4-eval (92 вопроса: GPQA Diamond, SuperGPQA, AIME 2025, COMPSEC). • KV-кэш на диске: формат KVC + DSV4, с точным replay tool calls.

Вывод и значение: DwarfStar — это попытка сделать одну конкретную open-weight модель «законченной» локально: от GGUF до агента и сервера, с проверкой на официальных логитах и реальных задачах. Проект узко фокусируется на DeepSeek V4, но готов сменить модель, если появится лучшая в том же классе размера. Код beta-качества, активно развивается, рекомендуется читать CONTRIBUTING.md и sub-README перед контрибуцией.

Мои мысли

graph

Карта связей