Imbutus
← Все новости
28 Jul 2026, 11:28

Голосовые бандлы реорганизованы

У четырёх голосовых бандлов теперь по одной понятной задаче, общий набор имён воркфлоу и более быстрый старт.

  • Fish Audio S2 — выбор для дубляжа. Синтез речи и клонирование голоса на 80+ языках, а голос-в-SRT и SRT-в-голос сохраняют исходный тайминг.
  • CosyVoice 3 — выбор для смены голоса. Нативное преобразование сохраняет исходные слова, паузы и подачу и меняет только тембр, без промежуточной транскрипции.
  • Qwen3-TTS — полностью Qwen-бандл. Клонирование голоса по трёхсекундному образцу и дизайн голоса, и это единственный бандл с Qwen3-ASR в качестве второго движка распознавания.
  • WhisperX теперь используется для распознавания везде. На практике он точнее, а отказ от второго движка в остальных трёх бандлах убрал около 3,7 ГБ из каждого пода — голосовые поды готовы быстрее.
  • Два воркфлоу, которых раньше не было. common-align-script-to-srt теперь есть в каждом голосовом бандле: вставьте сценарий с пустой строкой между блоками, и он выровняет их по вашей озвучке в SRT. У CosyVoice 3 появился полноценный cosyvoice3-voice-clone.

Часть имён в папке _examples изменилась — ищите новые: *-tts-clone стал *-voice-clone, *-audio-to-srt стал common-audio-to-srt, а qwen3tts-change-voice стал qwen3tts-redub-voice: он расшифровывает и переозвучивает слова, а не преобразует голос, поэтому для сохранения подачи используйте CosyVoice 3.

На странице Docs теперь перечислены все бандлы с их моделями и все воркфлоу, которые они содержат, — с теми же пояснениями, что вы видите на холсте ComfyUI.