GigaAM v3 Transcriber

источник ↗ ·

Полноценный workflow для транскрибации, диаризации и LLM-постобработки русской речи на базе GigaAM-v3 с пятью интерфейсами.

privacy

Эта заметка участвует в semantic memory.

AI Summary

  1. Короткий обзор сути: GigaAM Transcriber — это не просто обёртка над моделью, а полноценный сервисный слой с Desktop GUI, CLI, REST API, Web GUI и TUI для пакетной транскрибации, экспорта, диаризации и LLM-постобработки. 🔑 Ключевые факты: поддержка форматов txt/srt/vtt/md с настраиваемым разбиением субтитров; выбор диаризации (pyannote, ONNX PyAnnote+WeSpeaker, NVIDIA Sortformer v2.1); интеллектуальная предобработка аудио (DeepFilterNet, нормализация, high-pass); LLM-постобработка через OpenAI-compatible API, Claude, Codex и CLI; ускорение MLX/ONNX/CUDA; офлайн-сборки без сети и HF_TOKEN. 📌 Важные детали: GIGAAM_DATA_DIR перенаправляет все модели и runtime; DeepFilterNet запускается отдельным Rust binary 0.5.6 с проверкой SHA-256; Sortformer требует CUDA или MPS и работает с максимум 4 спикерами; ONNX backend не импортирует PyTorch; Web UI требует WEB_SECRET и монтирует GIGAAM_DATA_DIR как /data; при обновлении Docker Compose нужно сохранять тома, а не копировать модели внутрь контейнера. 💡 Вывод и значение: клонировать репозиторий, скопировать .env.example, принять условия pyannote-моделей, установить зависимости и запустить python app.py; для офлайн-работы скачать *-offline.zip и распаковать целиком; для Web UI выполнить docker compose up -d --build gigaam-web и проверить /health; при необходимости добавить requirements-sortformer.txt и выбрать --diarization-backend sortformer.

Мои мысли

graph

Карта связей