DeepSeek-V4-Flash-0731 локальный запуск

источник ↗ ·

Руководство по запуску open-weight модели DeepSeek-V4-Flash-0731 (284B параметров, 13B активных) с 1M контекстом и улучшенным шаблоном чата.

privacy

Эта заметка участвует в semantic memory.

AI Summary

🚀 TL;DR: DeepSeek-V4-Flash-0731 — новая open-weight модель (284B/13B active) с 1M контекстом, оптимизированная для кода, агентов и чата; доступна в lossless UD-Q8_K_XL (162 GB) и 3-bit UD-IQ3_XXS (103 GB). 🔑 Ключевые факты: UD-Q8_K_XL — единственный полностью lossless квантизатор (100% bit-exact, KL≈0); UD-Q4_K_XL сохраняет MXFP4-эксперты и близок по качеству; рекомендуемые параметры — temperature=1.0, top-p=1.0 (0.95 для агентов); reasoning_effort: high/max/off. 📌 Важные детали: требуется ≥110 GB RAM для 3-bit, ≥169 GB для Q8; контекст для Think Max ≥384K; шаблон чата добавляет reasoning_content и system prompt; есть готовые GGUF на HF: unsloth/DeepSeek-V4-Flash-0731-GGUF. 💡 Вывод и значение: для lossless используйте UD-Q8_K_XL; для 128 GB RAM — UD-IQ3_XXS; инструкции по установке через Unsloth Studio или llama.cpp; ссылки на бенчмарки и квантизацию в документации.

Мои мысли

graph

Карта связей