DFlash 2: ускорение параллельного драфтинга
DFlash 2 — обновление метода параллельного speculative decoding, которое даёт +16–25 % acceptance length при 1 % overhead и сохраняет точность оригинальной модели.
privacy
Эта заметка участвует в semantic memory.
AI Summary
- Короткий обзор сути: DFlash 2 улучшает speculative decoding, делая драфтинг полностью параллельным и добавляя лёгкий path-selector + двух-таповую динамическую свёртку, чтобы повысить coherence и снизить suffix decay. 🔑 Ключевые факты: Recall@16 на 99.5 % в начале блока, acceptance length растёт с 4.27 → 6.79 (oracle), +21 % acceptance length vs DFlash, +1.05 токена vs DSpark; overhead 1.3 % latency, 3 % параметров. 📌 Важные детали: selector использует 256-dim embeddings и low-rank bilinear attention; convolution — 2-tap dynamic depthwise; suffix decay решается локально, а не увеличением глубины; поддержка в SGLang, vLLM, llama.cpp, Ollama, oMLX. 💡 Вывод и значение: pip-команды и конфиги для Qwen3.8-27B и Muse Glimmer уже доступны; throughput 2.7–4.6× vs autoregressive; для оценки — писать contact@inco.ai; цитирование: @misc{inco2026dflash2}.