Одноядерный CUDA-мегакернел (NBLK=188, NTHR=512) для декодирования Kimi-Linear W4A16: выполняет все 4 слоя (KDA×3 + MLA), int4-GEMV без материализации весов, gated-delta KDA, MLA с поглощением q_nope и двухпроходным вниманием, MoE top-8 + 9 экспертов, RMSNorm и residual за один запуск.
источник ↗