Полная инженерная заметка о реализации inference 2.78-триллионной модели Kimi K3 в чистом C99 на одном CPU без GPU, BLAS и фреймворков, с измеренным минимумом 8.24 ГБ RAM и byte-identical выводом на всех бюджетах от 8 до 224 ГБ.
источник ↗#mla
2 записейОдноядерный CUDA-мегакернел (NBLK=188, NTHR=512) для декодирования Kimi-Linear W4A16: выполняет все 4 слоя (KDA×3 + MLA), int4-GEMV без материализации весов, gated-delta KDA, MLA с поглощением q_nope и двухпроходным вниманием, MoE top-8 + 9 экспертов, RMSNorm и residual за один запуск.
источник ↗