Полная инженерная заметка о реализации inference 2.78-триллионной модели Kimi K3 в чистом C99 на одном CPU без GPU, BLAS и фреймворков, с измеренным минимумом 8.24 ГБ RAM и byte-identical выводом на всех бюджетах от 8 до 224 ГБ.
источник ↗#cpu-inference
2 записейОткрытая многоязычная TTS-модель с 0.1B параметров для реального времени на CPU от MOSI.AI и OpenMOSS.
источник ↗