KAME: Tandem-архитектура для S2S AI

источник ↗ ·

KAME — tandem-архитектура, соединяющая S2S-модель с асинхронным backend-LLM для одновременного быстрого ответа и глубокого рассуждения.

privacy

Эта заметка участвует в semantic memory.

AI Summary

  1. Короткий обзор сути: KAME (Knowledge-Augmented Moshi Extension) — tandem-система, где фронтенд S2S (на базе Moshi) отвечает мгновенно, а backend-LLM (gpt-4.1, claude-opus-4-1, gemini-2.5-flash) работает асинхронно и по мере накопления транскрипта пользователя выдаёт «oracle»-сигналы, позволяя модели «говорить, пока думает».

  2. Ключевые тезисы: S2S-системы быстры, но ограничены в знаниях; каскадные STT+LLM+TTS — знающие, но с задержкой; KAME снимает trade-off, сохраняя низкую латентность и повышая информированность ответа; backend можно менять без изменения интерфейса взаимодействия.

  3. Важные детали и нюансы: сравнение проводится на MT-Bench (вопросы → TTS → оценка LLM-judge); Moshi обучен как обычный SFT, KAME-фронтенд — с приёмом oracle-сигналов; claude-opus-4-1 лучше на reasoning, gpt-4.1 — на humanities; примеры включают как корректные, так и намеренно запутанные ответы (David’s sisters riddle, superposition/entanglement, Japanese business etiquette, argument evaluation).

  4. Практические выводы/следующие шаги: код инференса — github.com/SakanaAI/kame, файнтюна — github.com/SakanaAI/kame_finetune, модель — huggingface.co/SakanaAI/kame; статья принята на ICASSP 2026 (arxiv.org/abs/2510.02327); рекомендуется тестировать разные backend-LLM под конкретные задачи.

Мои мысли

graph

Карта связей