Qwen3.8-27B на 16 ГБ VRAM
Практическое руководство по запуску Qwen3.8-27B на видеокарте с 16 ГБ VRAM с помощью llama.cpp и агрессивной квантизации.
privacy
Эта заметка участвует в semantic memory.
AI Summary
- Короткий обзор сути: автор, несмотря на скептицизм к AI, сумел запустить 27B-параметровую модель Qwen3.8 на 16 ГБ VRAM, используя llama.cpp и экстремальную квантизацию.
🔑 Ключевые факты
- Официально модель требует 32 ГБ+, но с UD-IQ3_XXS и KV-квантизацией q4_0 она помещается в 16 ГБ.
- Скорость генерации достигает 20–30 токенов/с.
- Qwen3.8 отличается долгим «мышлением» и «пещерным» стилем рассуждений.
📌 Важные детали
- Команда запуска: llama serve с флагами --n-gpu-layers all, --cache-type-k q4_0, --cache-type-v q4_0, --ctx-size 32000, --spec-type draft-mtp,ngram-mod.
- Для Q5_K_M доступно только 24 слоя на GPU.
- Модель доступна в квантах Unsloth: UD-IQ3_XXS (основной), UD-Q5_K_M (резервный).
- Рекомендуемые параметры сэмплинга: top-p 0.95, top-k 20, temp 1.0.
- KV-квантизация даёт прирост контекста до 128k, но снижает качество.
💡 Вывод и значение
- Для повышения качества можно попробовать q8_0 KV-кэш при наличии свободной VRAM.
- Контекст лучше поднимать постепенно (16k → 32k → 64k → 128k) в зависимости от задачи.
- Мониторинг: btop / nvidia-smi.
- Автор ищет более точные/быстрые конфигурации для 16 ГБ.