你是否曾为 AI 视频生成中「音画不同步」「对白不清晰」「长视频续写断裂」等问题头疼?T8mars 开发的 comfyui-minimax-h3-audio-T8 插件,专为 ComfyUI 用户打造,首次在 MiniMax H3 模型生态中实现音频与画面的原生级协同控制——它不止是“加个音轨”,而是从采样时序、条件注入、分段合成到语音链管理的全链路音频工程支持。
核心功能
- 精准音画条件绑定:严格遵循 `
` / ` - 双时钟稳定采样:独创视频宏步(24fps)+音频微步联合采样机制,兼顾画面流畅性与语音细节还原,支持实验性多速率同步
- 对白安全分轨混音:自动识别对白边界,隔离人声/背景音/环境音三轨,支持 ADR(自动对白替换)与显式音色库调用,避免语音被背景淹没
- 长视频断点续写:支持总时长编排、原子化分段 manifest、已接受上下文继承,真正实现 5 分钟以上视频的可靠分段生成与无缝拼接
- Ref2VA 静态语义编辑:单图或多图参考下,不改动原始采样链即可调节画面语义强度,适用于配音重绘、角色口型匹配等精细化场景
- 异常释放保护机制:语音链全程监控 ASR 状态与身份一致性,遇中断自动回滚至安全帧,保障长文本生成不崩溃、不丢帧
适合哪些人用
本插件面向进阶 ComfyUI 视频创作者:包括独立动画师、AI 影视实验者、播客内容生成者、教育类短视频开发者,以及所有需要将语音驱动、对白控制、音画节奏纳入工作流的专业用户。如果你已在使用 MiniMax H3 模型,并希望摆脱“先出画面再配声”的低效流程,转而实现“音画同构、条件共治”的下一代 AI 视频创作,这就是你等待已久的工具。
快速上手
安装极简:下载项目代码,将整个文件夹重命名为 minimax-h3-audio-T8,放入 ComfyUI 的 custom_nodes/ 目录下;重启 ComfyUI 后,节点将自动出现在侧边栏的 T8/MiniMax H3/... 七大菜单中(含 54 个节点)。基础功能无需额外依赖——PyTorch、torchaudio 和 MiniMax H3 模型均已复用 ComfyUI 原生环境;如需语音校验(ASR/音色识别),可按需安装 faster-whisper 或 transformers,缺失时插件仍完整加载、零报错降级运行。兼容 ComfyUI v0.31.0+(Python 3.10+),旧版工作流完全向前兼容,新增节点仅追加、不破坏。
项目信息
584
Stars
30
Forks
Python
NOASSERTION
编程语言:Python|GitHub Star 数:584|开源协议:NOASSERTION(请使用者自行确认合规性)|GitHub 项目地址
这不是一个“锦上添花”的小工具,而是为 MiniMax H3 生态补上关键一环的音画协同基础设施——让 AI 视频真正听懂你的声音,也让你的声音真正指挥画面的呼吸。


