28 Jul 2026, 11:28
Голосовые бандлы реорганизованы
У четырёх голосовых бандлов теперь по одной понятной задаче, общий набор имён воркфлоу и более быстрый старт.
- Fish Audio S2 — выбор для дубляжа. Синтез речи и клонирование голоса на 80+ языках, а голос-в-SRT и SRT-в-голос сохраняют исходный тайминг.
- CosyVoice 3 — выбор для смены голоса. Нативное преобразование сохраняет исходные слова, паузы и подачу и меняет только тембр, без промежуточной транскрипции.
- Qwen3-TTS — полностью Qwen-бандл. Клонирование голоса по трёхсекундному образцу и дизайн голоса, и это единственный бандл с Qwen3-ASR в качестве второго движка распознавания.
- WhisperX теперь используется для распознавания везде. На практике он точнее, а отказ от второго движка в остальных трёх бандлах убрал около 3,7 ГБ из каждого пода — голосовые поды готовы быстрее.
- Два воркфлоу, которых раньше не было.
common-align-script-to-srtтеперь есть в каждом голосовом бандле: вставьте сценарий с пустой строкой между блоками, и он выровняет их по вашей озвучке в SRT. У CosyVoice 3 появился полноценныйcosyvoice3-voice-clone.
Часть имён в папке _examples изменилась — ищите новые: *-tts-clone стал *-voice-clone, *-audio-to-srt стал common-audio-to-srt, а qwen3tts-change-voice стал qwen3tts-redub-voice: он расшифровывает и переозвучивает слова, а не преобразует голос, поэтому для сохранения подачи используйте CosyVoice 3.
На странице Docs теперь перечислены все бандлы с их моделями и все воркфлоу, которые они содержат, — с теми же пояснениями, что вы видите на холсте ComfyUI.