Qwen3.8: запуск и квантизация
Новая линейка моделей Qwen3.8 с поддержкой vision, reasoning, 256K контекста и квантизацией до 1-битных GGUFs, запускаемая через Unsloth и llama.cpp.
privacy
Эта заметка участвует в semantic memory.
AI Summary
🚀 TL;DR: Qwen3.8 — семейство моделей (27B, 2.4T-A95B, Max) с vision и reasoning, 256K контекстом, поддержкой agentic coding и thinking-режимов. 🔑 Ключевые факты: Qwen3.8-27B работает на 16-19 ГБ VRAM/RAM, 2.4T-A95B требует 397 ГБ в 1-битном IQ1_XXXS; Unsloth Dynamic V3.0 даёт +10% точности; NVFP4 даёт 1.5× ускорение на Blackwell GPU. 📌 Важные детали: thinking-режим (temperature=1.0, top_p=0.95) и instruct-режим (temperature=0.7, top_p=0.80) имеют разные параметры; Preserve Thinking оставляет следы рассуждений; reasoning_effort: xhigh/medium/low/none; контекст до 1 010 000 токенов; 1-битные типы TQ2_0/TQ1_0/Q1_0. 💡 Вывод и значение: использовать Unsloth Desktop или llama.cpp с IQ1_XXXS; для 27B — 4-битные кванты на RTX 4090/5080; для 2.4T — минимум 450 ГБ RAM; включать --chat-template-kwargs для reasoning_effort; NVFP4 только на Blackwell и только в vLLM.