Imbutus

新闻

04 Aug 2026, 15:00

MiniMaxDirector:为 H3 打造的时间线

我为 MiniMax H3 写了一个 ComfyUI 节点并开源发布:MiniMaxDirector。与其把整部片子塞进一个提示词框,不如把它铺在时间线上 —— 画面里发生什么、镜头如何运动、听到什么 —— 节点会将其编译成 H3 真正读取的那个结构化提示词。

它能为你做什么:

  • 三条轨道。 镜头、摄影机与音频,每个片段都有自己的文本和时间范围。
  • 剪辑时间点自动计算,模型会被准确告知每个镜头从何时开始。
  • 只使用合法时长。 片段会被对齐到 H3 接受的长度,生成不会因为算术问题而失败。
  • 把文件附加到片段上,它会自动成为提示词中带编号的引用,无需手动输入标记。

它已经装在你的 GPU 上了。 启动 MiniMax H3 套装,打开 Docs → Media → MiniMax H3 → MiniMaxDirector 工作流;该图已可直接运行,无需安装。

在你自己的机器上,它已发布到 ComfyUI 注册表,名称为 minimax-director:可在 ComfyUI Manager 中搜索,或执行 comfy node install minimax-director。源码与问题反馈:github.com/imbutus/ComfyUI-MiniMaxDirector。MIT 许可。

03 Aug 2026, 18:00

MiniMax H3 教程

MiniMax H3 套装现已在 Docs 页面提供完整教程,提供英语、俄语和中文版本,并附字幕。

视频完整演示了第一个片段的制作:

  • 工作流在哪里,以及应该先打开哪一个。
  • 把声音写进提示词 —— 描述什么,以及模型会如何处理。
  • 合法的片段时长 —— 为什么任意时长会被对齐,以及哪些数字正好是整秒。
  • 附加参考素材,让主体在镜头之间保持一致。

YouTube 观看,或打开 Docs → Media → MiniMax H3。

03 Aug 2026, 15:00

MiniMax H3 已上线

Media 页面新增了一个视频套装:MiniMax H3,一个全模态模型,在一次生成中同时产出画面与声音 —— 音频不是事后配上的,而是与视频同源生成。

开始第一个片段前值得了解的几点:

  • 声音是模型的一部分。 像描述画面一样描述声音,它会与镜头一起生成。立体声,无需单独的配音步骤。
  • 参考图像、音频与视频。 附加它们并在提示词中指向它们;模型会据此在多个镜头间保持主体或风格一致。
  • 片段时长不是任意的。 H3 在 24 fps 下只接受固定格点上的长度,工作流会把你要求的时长对齐到最近的合法值。正好为整秒的是 8 秒、25 秒和 42 秒。
  • 一个提示词,多个镜头。 模型会读取带有剪辑时间点的镜头列表,因此单次生成可以包含多个镜头,而不只是一个连续长镜头。

打开 Media → Video → MiniMax H3 即可启动。

28 Jul 2026, 11:28

语音套件已重新整理

四个语音套件现在各有明确分工,共用一套工作流命名,启动也更快。

  • Fish Audio S2 —— 配音首选。 支持 80+ 种语言的文本转语音与声音克隆,语音转 SRT 和 SRT 转语音都保留原始时间轴。
  • CosyVoice 3 —— 变声首选。 原生语音转换保留原有的词句、停顿和语气,只替换音色,中间无需转录。
  • Qwen3-TTS —— 全 Qwen 套件。 三秒声音克隆和声音设计,也是唯一附带 Qwen3-ASR 作为第二识别引擎的套件。
  • WhisperX 现已成为各套件统一的识别引擎。 实测精度更高;其余三个套件去掉第二个引擎后,每个实例少下载约 3.7 GB,语音实例更快就绪。
  • 两个此前没有的工作流。 common-align-script-to-srt 现已进入每个语音套件:粘贴用空行分段的文稿,它会按你的旁白对齐并生成 SRT。CosyVoice 3 也新增了完整的 cosyvoice3-voice-clone

_examples 文件夹中的部分名称已更改,请查找新名称:*-tts-clone 改为 *-voice-clone*-audio-to-srt 改为 common-audio-to-srtqwen3tts-change-voice 改为 qwen3tts-redub-voice —— 它是转录后重新朗读,而非转换音色,若要保留原有语气请使用 CosyVoice 3。

Docs 页面现在列出了每个套件及其模型,以及它附带的每个工作流,并附有与 ComfyUI 画布上相同的说明。

26 Jul 2026, 14:49

Sulphur-2 视频教程

Sulphur-2 套装现已在 Docs 页面提供完整教程 —— 时长将近八分钟,提供英语、俄语和中文三个版本,并附字幕。

视频完整演示了 LTX Director 工作流:

  • 图像 → 视频 —— 让照片中的人说出你给定的文本。
  • 图像 + 音频 → 视频 —— 传入你在 Fish Audio S2 中准备好的语音片段,画面中的人就会说出这段录音。
  • 延长片段 —— 把已有视频放在时间线的开头或结尾,让模型生成缺失的部分。帧率必须与源视频一致,否则结果会跑偏。
  • fp8 与 bf16 —— 它们是不同的模型,而不是画质预设。fp8 是压缩版:占用资源更少,但效果更差。

视频还讲到:为什么在完整渲染之前先用短时间段测试、为什么把提示词拆成短时间区间生成得更准确,以及时长设置不当会让模型产生幻觉。声音本身之后可以用 CosyVoice3 替换。

打开 Docs → Media → Video tutorial 即可观看。

26 Jul 2026, 08:32

SCAIL-2 已可正式使用

SCAIL-2 已完成全面测试并退出 Beta 阶段。两项功能均已跑通,套餐卡片上的 Beta 标记也已移除。

  • 角色动画 — 用任意片段的动作驱动你自己的角色。背景会重新生成,不保留驱动视频的场景。
  • 角色替换 — 替换现有视频中的某一个人,原场景、背景和其他人物保持不变。
  • 双角色同时处理 — 一张同时包含两个角色的参考照片,配合一段有两个运动主体的片段。

每个工作流现在都在 ComfyUI 内附有分步说明:需要填写哪些输入、画面中有多人时如何让追踪器只锁定一人、长时间渲染前该在遮罩预览里检查什么,以及如何突破默认的五秒时长。

开始前有两点需要注意。渲染结果没有声音——SCAIL-2 只生成画面,请在视频剪辑软件中后期添加。参考图必须是真实照片:双角色时需要一张两人同框的照片,而不是把两张图拼在一起。

视频教程稍后推出。

24 Jul 2026, 06:25

自定义自动停止超时

GPU 在一段时间无活动后会自动停止,您不会为忘记关闭的机器付费。以前这个超时对所有人都一样,现在由您自己设定。

  • Settings 页面分别设置 LLMMedia 的超时。
  • 可选 5 分钟以上的任意数值 —— 或为长任务彻底关闭自动停止。
  • Media 将繁忙的 ComfyUI 队列视为活动,因此长达数小时的渲染会保持 Pod 运行。队列清空后才开始计时。
  • LLM 按您自己的会话计时,您的超时不会影响其他人。

余额耗尽时 GPU 一定会停止,与您的设置无关。

22 Jul 2026, 08:34

查看您的用量与花费

现在您可以直接在 Monitor 页面上准确查看自己使用了多少 GPU 时间以及花费了多少。

  • 每个 LLM媒体(图像 / 视频 / 语音)会话都会列出其时长价格
  • 合计行显示您的累计花费,并按 LLM 与媒体分开统计。

从顶部菜单打开 Monitor,随时查看您的用量。

18 Jul 2026, 15:00

预设的 OSINT 工作流

现在您可以直接在聊天中触发预设的 OSINT 查询 — 无需了解该运行哪些工具、按什么顺序运行。

触发命令:

  • osint:email <地址> — 检查该邮箱在哪些平台上注册过账户,并进行域名/MX 查询
  • osint:person <姓名> — 在各平台上枚举公开资料和可能的用户名
  • osint:company <公司名> — 将公司名称解析为官方域名,然后分析其基础设施和组织信息
  • osint:domain <域名> — whois、子域名枚举、DNS 记录
  • 单独发送 osint 可再次查看完整列表

每个工作流都会在您租用的 Kali Linux 主机上运行真实工具(whois、dig、holehe、sherlock、theHarvester、crt.sh) — 如果还没有主机,请在 Virtual Machines 部分租用一台。如果没有主机,模型会直接告知您,而不会猜测或编造结果。

18 Jul 2026, 15:00

推出新闻页面

这个页面——也就是您现在正在阅读的这个。关于新功能和变更的简短公告,提供英语、俄语和中文版本。

很简单:新文章发布后会显示在这里,最新的排在最前面。

Page 1