Новая линейка моделей Qwen3.8 с поддержкой vision, reasoning, 256K контекста и квантизацией до 1-битных GGUFs, запускаемая через Unsloth и llama.cpp.
источник ↗#moe
4 записейEdge-native система для локального запуска больших MoE-моделей на обычных пользовательских машинах без дата-центра.
источник ↗Интерактивный гайд по выбору бэкенда, модели, квантизации и флагов llama.cpp под ограничения VRAM, RAM и скорости памяти.
источник ↗Одноядерный CUDA-мегакернел (NBLK=188, NTHR=512) для декодирования Kimi-Linear W4A16: выполняет все 4 слоя (KDA×3 + MLA), int4-GEMV без материализации весов, gated-delta KDA, MLA с поглощением q_nope и двухпроходным вниманием, MoE top-8 + 9 экспертов, RMSNorm и residual за один запуск.
источник ↗