AI-NEWS · 2026年 9月 15日

京东发布 EchoWM 与 10 分钟视频生成

9 月 9 日 JDD 大会上,京东探索研究院发布了 JoyAI-Echo 系列的两个新成果:升级版的长视频生成模型 JoyAI-Echo1.5 和新开源的交互式视听世界模型 EchoWM。

JoyAI-Echo1.5 把视频生成的上限从“看”推到了“进”和“探索”。它的核心是用视听记忆库架构,能稳住人物形象、声音和故事线。单次生成时长跨过了 10 分钟大关,推理速度最高提了 7.5 倍。跑 480P 每秒 24 帧只需 2 张 H200 显卡,算下来是实时 1:1 生成。模型里还塞了个智能导演代理,我喂它一句自然语言,它就能把故事构思、镜头规划、生成审核到最终合成全串起来。

EchoWM 解决了世界模型“没自然声音”和“不好持续交互”的问题。它能直接生成 720P 视频,环境音、音乐和人声一起出来,声音会跟着场景和动作变,不再像以前那样视听分离。我测试过它的相机意图机制,支持第一人称导航、第三人称相机跟着主体走,还能多轮次连续探索。在 WBench Navigation 评测里,EchoWM 和它的四步因果流变体 EchoWM-Flash 包揽了前两名,EchoWM 还在涵盖 158 个多轮次导航案例的综合榜单上拿了第一。

京东把这块业务的基础设施铺得挺满。基础模型矩阵 JoyAI 把图像视频生成、多模态理解、实时交互、世界建模、智能语音和具身操作全串起来了,让 AI 从单纯生成内容变成在动态环境里感知、仿真和交互。现场还演示了新的音视频基础模型 JoyAI-Video,主打电商广告、短剧和多镜头连续叙事,打算 10 月正式发布。从真实世界数据采集 EgoLive,到仿真转换工具链 JoyAI-Sim,再到大模型基础设施,京东把从数据到模型再到应用的闭环都搭好了。

火龙果频道