28 Jul 2026, 11:28
语音套件已重新整理
四个语音套件现在各有明确分工,共用一套工作流命名,启动也更快。
- Fish Audio S2 —— 配音首选。 支持 80+ 种语言的文本转语音与声音克隆,语音转 SRT 和 SRT 转语音都保留原始时间轴。
- CosyVoice 3 —— 变声首选。 原生语音转换保留原有的词句、停顿和语气,只替换音色,中间无需转录。
- Qwen3-TTS —— 全 Qwen 套件。 三秒声音克隆和声音设计,也是唯一附带 Qwen3-ASR 作为第二识别引擎的套件。
- WhisperX 现已成为各套件统一的识别引擎。 实测精度更高;其余三个套件去掉第二个引擎后,每个实例少下载约 3.7 GB,语音实例更快就绪。
- 两个此前没有的工作流。
common-align-script-to-srt现已进入每个语音套件:粘贴用空行分段的文稿,它会按你的旁白对齐并生成 SRT。CosyVoice 3 也新增了完整的cosyvoice3-voice-clone。
_examples 文件夹中的部分名称已更改,请查找新名称:*-tts-clone 改为 *-voice-clone,*-audio-to-srt 改为 common-audio-to-srt,qwen3tts-change-voice 改为 qwen3tts-redub-voice —— 它是转录后重新朗读,而非转换音色,若要保留原有语气请使用 CosyVoice 3。
Docs 页面现在列出了每个套件及其模型,以及它附带的每个工作流,并附有与 ComfyUI 画布上相同的说明。