MOSS-TTS-Nano: Компактная TTS-модель

источник ↗ ·

Открытая многоязычная TTS-модель с 0.1B параметров для реального времени на CPU от MOSI.AI и OpenMOSS.

AI Summary

🚀 Обзор: MOSS-TTS-Nano — открытая многоязычная модель генерации речи (0.1B параметров) от MOSI.AI и OpenMOSS, оптимизирована для реального времени на CPU без GPU. Поддерживает 20 языков (кит., англ. и др.), voice cloning, стриминговую генерацию, длинные тексты. Простая установка, CLI/веб-демо, ONNX-версия (2x быстрее), браузерный ридер. Скоро MOSS-TTS 2.0 с сбором фидбека. Репо: GitHub/OpenMOSS/MOSS-TTS-Nano, демо: openmoss.github.io/MOSS-TTS-Nano-Demo/.

Ключевые тезисы: • 📏 Размер: 0.1B параметров, 48kHz/2ch аудио, авторегрессивная (Audio Tokenizer + LLM). • ⚡ CPU-friendly: работает на 4-ядерном CPU, ONNX-версия ~2x быстрее (MacBook Air M4). • 🌐 20 языков, voice cloning, стриминг с низкой задержкой, chunking для длинных текстов. • 🛠️ Установка: conda/python 3.12, pip -e ., infer.py/app.py, CLI: moss-tts-nano generate/serve. • 🔄 Обновления: 17.04 — ONNX CPU; 16.04 — finetuning; 14.04 — браузерный MOSS-TTS-Nano-Reader; 10.04 — релиз. • 📊 Скоро 2.0: форма фидбека для оптимизации.

Мои мысли

graph

Карта связей