NVIDIA Personaplex-7B-v1 на Hugging Face

источник ↗ ·

Gated 7B-модель NVIDIA для speech-to-speech и audio-to-audio задач на базе Moshi с весами 16.7 ГБ.

privacy

Эта заметка участвует в semantic memory.

AI Summary

  1. Короткий обзор сути: страница модели NVIDIA Personaplex-7B-v1 на Hugging Face — это gated-репозиторий с 7-миллиардной моделью для преобразования речи в речь и аудио в аудио, основанной на фреймворке Moshi.
  2. Ключевые тезисы: модель доступна только после принятия NVIDIA Open Model License и CC-BY-4.0; требует логина; веса 16.7 ГБ в safetensors; токенизатор 32k; 8 codebooks Mimi-кодека; лицензия nvidia-open-model-license.
  3. Важные детали и нюансы: файлы включают model.safetensors (16.7 GB), tokenizer-e351c8d8-checkpoint125.safetensors (385 MB), tokenizer_spm_32k_3.model (553 kB), voices.tgz (6.1 MB), dist.tgz (598 kB), а также документы bias.md, privacy.md, safety.md, explainability.md; запуск через python -m moshi.server --hf-repo "nvidia/personaplex-7b-v1" или код с loaders.CheckpointInfo.from_hf_repo и mimi.set_num_codebooks(8).
  4. Практические выводы/следующие шаги: для использования нужно войти в аккаунт Hugging Face и принять условия; затем установить moshi, загрузить чекпоинт и запустить веб-сервер на localhost:8998 или интегрировать в код с CUDA.

Мои мысли

graph

Карта связей