Qwen3.8-27B на 16 ГБ VRAM

источник ↗ ·

Практическое руководство по запуску Qwen3.8-27B на видеокарте с 16 ГБ VRAM с помощью llama.cpp и агрессивной квантизации.

privacy

Эта заметка участвует в semantic memory.

AI Summary

  1. Короткий обзор сути: автор, несмотря на скептицизм к AI, сумел запустить 27B-параметровую модель Qwen3.8 на 16 ГБ VRAM, используя llama.cpp и экстремальную квантизацию.

🔑 Ключевые факты

  • Официально модель требует 32 ГБ+, но с UD-IQ3_XXS и KV-квантизацией q4_0 она помещается в 16 ГБ.
  • Скорость генерации достигает 20–30 токенов/с.
  • Qwen3.8 отличается долгим «мышлением» и «пещерным» стилем рассуждений.

📌 Важные детали

  • Команда запуска: llama serve с флагами --n-gpu-layers all, --cache-type-k q4_0, --cache-type-v q4_0, --ctx-size 32000, --spec-type draft-mtp,ngram-mod.
  • Для Q5_K_M доступно только 24 слоя на GPU.
  • Модель доступна в квантах Unsloth: UD-IQ3_XXS (основной), UD-Q5_K_M (резервный).
  • Рекомендуемые параметры сэмплинга: top-p 0.95, top-k 20, temp 1.0.
  • KV-квантизация даёт прирост контекста до 128k, но снижает качество.

💡 Вывод и значение

  • Для повышения качества можно попробовать q8_0 KV-кэш при наличии свободной VRAM.
  • Контекст лучше поднимать постепенно (16k → 32k → 64k → 128k) в зависимости от задачи.
  • Мониторинг: btop / nvidia-smi.
  • Автор ищет более точные/быстрые конфигурации для 16 ГБ.

Мои мысли

graph

Карта связей