h3-metal 是一个专为苹果 Silicon(M1/M2/M3/M5 系列芯片)深度优化的开源 AI 视频生成推理引擎,它能让你的 Mac 无需联网、不依赖云端服务,直接在本地运行 MiniMax 公司发布的 H3 多模态大模型,实现“文字→视频/音频”的端到端生成。它不是简单的模型移植,而是从 Metal 图形框架底层重构的高性能推理实现,真正释放 Apple 芯片的 GPU 与神经引擎潜力——告别卡顿等待,一部 M3 Max 笔记本就能流畅生成 512×512 分辨率、6 步扩散的创意短视频。
核心功能
- 原生 Metal 加速:完全绕过 CPU 推理瓶颈,所有计算(包括 DiT 视频扩散、BF16 条件编码、VAE 解码)均通过 Apple 的 Metal Performance Shaders 高效调度,显著提升帧率与内存带宽利用率
- 交互式视频创作:启动即进入类 Iris 的命令行交互会话,支持实时输入文本提示、动态调整时长(
!seconds 2)、切换随机种子(!seed random)、预览(!show)与一键保存(!save output.mp4) - 智能条件控制:支持首帧/末帧图像引导生成(first/last-frame conditioning),让视频开头或结尾严格匹配你提供的参考图,大幅提升可控性
- 有序多模态参考:可按顺序注入图像、视频、音频作为 Ref2VA 参考源(ordered references),实现“图+音+文”混合驱动的精准生成
- 内存智能复用:首次提示处理后,Prompt 编码器、DiT 主干网络和视频解码器常驻显存,重复生成相同提示仅需重采样随机种子,耗时降低 70%+
- 轻量诊断与调试:提供
--info模式快速校验模型结构、权重布局与 Metal 设备识别结果,不加载全部参数即可确认环境兼容性
适合哪些人用
这款工具特别适合三类用户:一是创意工作者(设计师、短视频编导、独立动画师),需要在离线环境快速验证视觉概念;二是AI 研究者与开发者,希望深入理解多模态扩散模型在 Metal 上的底层调度机制,或基于其架构二次开发;三是苹果生态技术爱好者,乐于探索 M 系列芯片在生成式 AI 领域的真实性能边界——无需 NVIDIA 显卡,也不用折腾 Docker 或复杂 Python 环境,纯 C + Metal 就是全部依赖。
快速上手
只需四步即可运行:
- 从 Hugging Face 下载 MiniMax-H3 模型快照(如
MiniMax-H3文件夹),置于项目根目录 - 确保系统已安装 FFmpeg 和 FFprobe(可通过
brew install ffmpeg安装) - 执行
make -j8编译(自动适配当前 Mac 的 Metal 版本),生成./h3可执行文件 - 运行交互模式:
./h3 -d ./MiniMax-H3 --width 512 --height 512 --steps 6,输入任意中文或英文提示词,回车即开始生成
提示:首次运行建议先用 ./h3 --info -d ./MiniMax-H3 确认模型路径与设备识别无误;生成过程中输入 !help 可查看全部快捷指令。
项目信息
MiniMax H3 inference engine for Mac computers
391
Stars
18
Forks
C
MIT
编程语言:C|GitHub Star 数:391|开源协议:MIT|GitHub 项目地址
如果你有一台 M 系列 Mac,又不想把创意交给云端、不愿忍受 Python 环境的繁琐配置,那么 h3-metal 就是你目前最轻量、最高效、也最“苹果味”的本地 AI 视频生成方案。


