KAME: Tandem-архитектура для S2S AI
KAME — tandem-архитектура, соединяющая S2S-модель с асинхронным backend-LLM для одновременного быстрого ответа и глубокого рассуждения.
privacy
Эта заметка участвует в semantic memory.
AI Summary
-
Короткий обзор сути: KAME (Knowledge-Augmented Moshi Extension) — tandem-система, где фронтенд S2S (на базе Moshi) отвечает мгновенно, а backend-LLM (gpt-4.1, claude-opus-4-1, gemini-2.5-flash) работает асинхронно и по мере накопления транскрипта пользователя выдаёт «oracle»-сигналы, позволяя модели «говорить, пока думает».
-
Ключевые тезисы: S2S-системы быстры, но ограничены в знаниях; каскадные STT+LLM+TTS — знающие, но с задержкой; KAME снимает trade-off, сохраняя низкую латентность и повышая информированность ответа; backend можно менять без изменения интерфейса взаимодействия.
-
Важные детали и нюансы: сравнение проводится на MT-Bench (вопросы → TTS → оценка LLM-judge); Moshi обучен как обычный SFT, KAME-фронтенд — с приёмом oracle-сигналов; claude-opus-4-1 лучше на reasoning, gpt-4.1 — на humanities; примеры включают как корректные, так и намеренно запутанные ответы (David’s sisters riddle, superposition/entanglement, Japanese business etiquette, argument evaluation).
-
Практические выводы/следующие шаги: код инференса — github.com/SakanaAI/kame, файнтюна — github.com/SakanaAI/kame_finetune, модель — huggingface.co/SakanaAI/kame; статья принята на ICASSP 2026 (arxiv.org/abs/2510.02327); рекомендуется тестировать разные backend-LLM под конкретные задачи.