AI-NEWS · 2026年 8月 6日

京东开源 JoyAI-Video-Edit:实时视频编辑新范式

京东正式开源了自研的实时流式视频编辑模型 JoyAI-Video-Edit,把视频编辑从“素材后编辑”变成了“观看即编辑”。模型在实时流式编辑的综合性能上跑赢了当前行业里的代表性模型,达到了世界顶尖水准。

实时编辑最怕卡顿。JoyAI-Video-Edit 基于自研的 JoyAI-Video 模型,在 720P 分辨率下跑出了 30 帧每秒的推理速度,匹配了普通电影和视频的播放节奏,同时在保持高清晰度的前提下保证了流畅交互。

以往流式编辑模型只能处理秒级或分钟级片段,没法应付长视频。JoyAI-Video-Edit 支持任意时长视频的流式编辑,允许用户在播放过程中连续处理。不用等整段视频生成就能实时干预,能即时做场景更换、物体替换、人物外观调整和视觉风格改变。

研究团队把 JoyAI-Video-Edit 和 SANA Streaming、LiveEdit、Xmax-X2.0 等国际代表性流式视频编辑模型做了对比。在涵盖典型视频编辑场景的综合权威评测 OpenVE-Bench 里,JoyAI-Video-Edit 全面胜出。它在四个编辑任务上显著优于同行:全局风格编辑、局部替换、局部删除和字幕编辑。

具体用起来能做什么?影视制作里能让视频人物持续换服装;直播互动能把普通街道背景实时转成动漫世界;家居设计能实时试不同的家具、墙面颜色和灯光效果。

除了内容创作,这个模型还能给大规模合成具身智能数据提供新路径。机器人训练需要大量关于物体抓取、移动和操作的视频数据,但靠真实机器重复采集不仅贵,还难收集危险或罕见场景。利用 JoyAI-Video-Edit 对场景、物体及视觉内容的可控编辑能力,能把人工操作视频转成机械手或机械臂操作的训练素材。

数据增强方面,在保留物体位置、空间关系及动作轨迹的前提下,替换场景、物体及机器人形态,能把单条视频扩展成大量多样化训练样本。

JoyAI-Video-Edit 的开源把视频编辑从“后期制作”推到了“实时交互”,算是代际跨越。30 FPS 的实时推理能力和对长视频的稳定支持,解决了行业长期卡脖子的技术瓶颈。同时,它在机器人训练数据合成上的潜力,预示着 AI 技术在工业制造和具身智能领域的广阔前景,可能在多个行业引发连锁反应。

火龙果频道