你是否曾为一段直播回放或监控录像中的小瑕疵反复导入导出、逐帧调整?JoyAI-Video-Edit 是京东开源的下一代实时视频编辑系统——它不依赖预设时长,不等待整段视频加载完毕,而是像“视频流上的智能画笔”,在画面持续输入的同时,根据你的中文指令(比如“把左下角的广告牌换成绿色植物”“让主角微笑并增强光线”),即时生成修改后的帧,真正实现“所见即所得”的交互式编辑体验。
核心功能
- 真正的实时流式编辑:支持摄像头直连或视频上传,编辑过程与播放同步进行,无需缓存全片,首帧延迟低至毫秒级
- 自然语言驱动编辑:用日常中文描述修改需求(如“给猫戴上墨镜”“将背景虚化并添加夕阳滤镜”),无需专业术语或时间轴操作
- 因果建模,拒绝未来帧依赖:基于自回归扩散架构,仅利用已到达的帧和历史上下文做决策,确保编辑逻辑符合真实时间流向
- 高吞吐性能表现:在主流消费级显卡(如RTX 4090)上实测达30.19 FPS@720×1280,满足高清直播级流畅体验
- 开箱即用的多模态理解:内置多模态大模型(MLLM)条件编码器,精准解析图文混合指令,理解空间关系与语义意图
- 轻量部署友好:提供Hugging Face一键加载模型(jdopensource/JoyAI-Video-Edit),支持Docker容器化快速部署
适合哪些人用
这款工具特别适合内容创作者、教育工作者、电商直播运营、安防与工业视觉工程师,以及任何需要快速响应视频内容变更的场景。如果你常处理会议录屏、课程视频、商品展示片段或IoT设备流媒体,又厌倦了Premiere的渲染等待、Runway ML的排队限制,JoyAI-Video-Edit 就是为你量身打造的“实时视频智能助手”——它不替代专业剪辑软件,而是填补“即时微调”这一关键空白。
快速上手
项目已提供清晰的本地运行指南:
- 环境要求:Python ≥ 3.10,CUDA 12.x,至少16GB显存GPU
- 安装命令:
pip install -r requirements.txt,自动拉取依赖及预训练模型 - 启动Demo:
python demo/streaming_edit.py --input_source webcam --prompt "增强人物肤色亮度" - 进阶用户可访问在线演示平台,直接拖入视频+输入指令,3秒内看到实时编辑效果
项目信息
[Official Repo] JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
567
Stars
23
Forks
Python
Apache-2.0
编程语言:Python|Star 数:567|开源协议:Apache-2.0|GitHub 项目地址
这不仅是又一个AI视频工具,而是首次将“流式生成”与“语言驱动编辑”深度耦合的开源实践——让视频编辑从“后期工序”真正走向“实时交互”。





