你是否曾为制作一条 60 秒的产品讲解短视频,反复调试口型同步、手动对齐字幕时间轴、反复上传素材到不同平台、担心人物形象或声音版权问题而耗费半天?lanshu-create-ai-presenter-video 正是为此而生——它不是另一个“点一下就出视频”的黑盒 SaaS,而是一套运行在本地 Codex 环境中的、可验证、可审计、完全解耦服务商的 AI 数字人视频生成工作流。只需一份文案 + 一张授权人物图,它就能自动完成文案组织、语音合成、数字人驱动、唇形校准、字幕动效、多轨剪辑与质量验收全流程,并输出带 QA 报告的成品母版。
核心功能
- 零厂商锁定的多模型调度能力:不硬编码 OpenAI、ElevenLabs 或 HeyGen 的 API,而是根据本地环境已配置的能力(如可用 TTS 引擎、数字人生成服务)动态选型,切换模型无需改代码,真正实现“工具随环境走”。
- 以音频为时间基准的精准对齐机制:先生成完整配音音频作为唯一时间轴,后续所有环节(数字人嘴型、字幕出现、关键词高亮、镜头切分)均严格按此音频帧级对齐,彻底规避行业常见的“口型漂移”和“字幕拖拍”问题。
- 分阶段文档驱动式执行:将生成(
generation.md)、剪辑(editing.md)、质检与修复(qa-recovery.md)拆分为三份独立文档,Codex 仅在对应阶段加载所需上下文,大幅降低 token 消耗,提升长流程稳定性。 - 面向生产环境的版权与安全前置检查:强制要求确认“人物图像授权”“成年人物状态”“声音克隆许可”三项法律前提;首次付费调用前自动弹出费用依据、试片方案与重试上限说明,避免隐性扣费与合规风险。
- 结构化任务目录 + 可追溯交付物:通过
init_job.py初始化标准任务目录,自动生成job.json配置文件;最终交付包含母版视频、平台适配版(如抖音竖屏 9:16)、字幕 SRT、QA 验收报告(含口型误差帧数、响度 LUFS 值、静音段检测等技术指标)。 - 关键词驱动的智能动效系统:自动识别文案中核心名词/动词(如“实时渲染”“零延迟”“SaaS 架构”),在对应音频时段触发人物微动作、文字放大、背景色块浮现等轻量动效,无需手动打关键帧。
- 故障导向的 QA 自恢复机制:当生成失败时,优先查询已有任务 ID 避免重复计费;连续三次候选服务失败后自动中止并输出结构化报错摘要(如“TTS 服务超时”“唇动模型返回空帧”),便于快速定位是网络、配额还是提示词问题。
- 隐私优先的本地化设计:全程不上传原始人物图、文案或音频至项目仓库;API 密钥、临时下载链接等敏感信息绝不写入日志;预检报告仅记录相对路径与文件名,杜绝开发者本地绝对路径泄露风险。
技术亮点
- 纯 Python + Shell 协同架构:核心逻辑用 Python(3.9+)编写,保障跨平台可读性与调试便利性;FFmpeg 调用、JSON 配置解析、日志切片等重IO操作交由 Bash +
jq/awk处理,兼顾性能与 Unix 哲学,避免过度封装导致的黑盒化。 - Codex Skill 标准化协议深度集成:严格遵循 Codex 的 Skill 目录规范(
SKILL.md描述接口、agents/openai.yaml定义能力契约),支持与任意兼容 Codex 的本地 Agent(如基于 Ollama 的轻量推理器)无缝协作,非必须依赖云端大模型。 - 模块化参考文档体系:三份 Markdown 文档并非说明文档,而是被 Codex 实时解析的“可执行策略”,例如
generation.md中明确写入“若无声音样本,则从库存库匹配性别/年龄/语速相近的 TTS 模型”,使规则具备机器可读性与可测试性。 - 发布级音视频工程标准:默认导出符合 YouTube/抖音推荐规格(1080×1920, 30fps),音频响度严格控制在 -16 LUFS(EBU R128 标准),支持自动静音段裁剪与电平归一化,告别“声音忽大忽小”的业余感。
- MIT 协议下的真开源实践:仓库不含任何闭源 SDK、混淆代码或隐藏后门;所有生成逻辑透明可见;贡献指南明确鼓励 PR 改进兼容性(如新增 Coqui TTS 支持)或增强 QA 检查项(如增加唇形同步 PSNR 自动评分)。
适合哪些人用
本项目专为重视可控性、可审计性与长期成本的中小团队及技术型创作者设计:
- 企业市场部同事:需批量制作产品功能短视频用于官网/公众号,但不愿将客户人物肖像上传至商业平台。案例:用销售总监授权照片 + 新品发布会讲稿,30 分钟内生成 5 条不同平台尺寸(横屏官网版 + 竖屏朋友圈版 + 方形小红书版)的合规视频,全程数据不出内网。
- 开源项目维护者:想为 GitHub 仓库制作“3 分钟上手教程”视频,但缺乏视频剪辑经验。案例:提供 README 摘要文本 + 个人头像,自动输出带代码关键词高亮、步骤引导字幕、结尾 GitHub 链接动效的讲解视频,无需安装 Premiere 或学习 AE。
快速上手
只需三步启动:
- 安装 Skill:
git clone https://github.com/cclank/lanshu-create-ai-presenter-video.git ~/.codex/skills/lanshu-create-ai-presenter-video - 初始化任务(替换为你的真实路径):
python3 ~/.codex/skills/lanshu-create-ai-presenter-video/scripts/init_job.py --job-dir ~/Videos/my-video --presenter-image ~/Pictures/ceo.jpg --topic "全新AI客服系统上线" --duration 45 --aspect 9:16 --rights-confirmed --adult-presenter-confirmed - 执行预检与生成:
打开生成的~/Videos/my-video/job.json,人工确认“远程上传许可”字段为true后,运行:python3 ~/.codex/skills/lanshu-create-ai-presenter-video/scripts/preflight.py ~/Videos/my-video/job.json
后续流程全自动推进,结果存于 delivery/ 子目录。
同类对比 / 注意事项
不同于 Runway Gen-3、Synthesia 等闭源平台,本项目不提供开箱即用的 Web UI 或云端算力,需自行配置底层能力(如部署 Fish Speech TTS、使用本地版 SadTalker)。优势在于:① 成本透明(你只为实际调用的 API 付费,无订阅制);② 可深度定制(修改 editing.md 即可调整开场动画逻辑);③ 符合等保/GDPR 要求(原始数据自主掌控)。常见注意事项:首次运行需确保 ffmpeg 和 ffprobe 已加入 PATH;若使用国内云服务,需在 agents/ 下补充对应 YAML 配置文件;人物图建议采用纯色背景、正面半身、光照均匀的证件照风格,避免戴眼镜反光或侧脸导致唇形识别失效。
项目信息
cclank/lanshu-create-ai-presenter-video
GitHub
Provider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.
743
Stars
125
Forks
Python
MIT
Python|743 ⭐|GitHub 项目地址|MIT 开源协议
如果你厌倦了被平台绑架、渴望一条真正属于自己的 AI 视频流水线——它不神秘、不封闭、不越权,且每一步都经得起推敲,那么这就是目前中文世界最务实的选择。


