#low-memory

1 записей

Полная инженерная заметка о реализации inference 2.78-триллионной модели Kimi K3 в чистом C99 на одном CPU без GPU, BLAS и фреймворков, с измеренным минимумом 8.24 ГБ RAM и byte-identical выводом на всех бюджетах от 8 до 224 ГБ.

источник ↗