Встраиваемый on-device speech-to-text для русского языка: один Rust-бинарник, GigaAM v3 INT8 через ONNX Runtime, без облака и ключей.
источник ↗#streaming
2 записейПолная инженерная заметка о реализации inference 2.78-триллионной модели Kimi K3 в чистом C99 на одном CPU без GPU, BLAS и фреймворков, с измеренным минимумом 8.24 ГБ RAM и byte-identical выводом на всех бюджетах от 8 до 224 ГБ.
источник ↗