Gated 7B-модель NVIDIA для speech-to-speech и audio-to-audio задач на базе Moshi с весами 16.7 ГБ.
источник ↗#speech-to-speech
2 записейKAME — tandem-архитектура, соединяющая S2S-модель с асинхронным backend-LLM для одновременного быстрого ответа и глубокого рассуждения.
источник ↗