字节跳动刚发布的 Seedance 2.5 把单条视频生成时长从 15 秒拉到了 30 秒,这不仅仅是数字上的翻倍,更像是把 AI 视频从“零散动态图”逼进了能讲完整故事的门槛。
模型会在即梦 AI 和豆包专业版上线,火山方舟那边也准备接 API。应用场景直接切到电影、广告、教育,甚至自动驾驶这种对实时性要求高的地方。
官方给的演示里,30 秒内能跑完一个逻辑自洽的单镜头表演。镜头从红色幕布缝隙推进去,暖光里歌手戴耳机,工作人员喊上台,穿过通道跟搭档互动,最后拉远展示全场观众和荧光棒。这一串动作把铺垫、发展、转折、结局全串起来了。
以前做 AI 视频,最怕开头热闹结尾崩坏,叙事一断就废。Seedance 2.5 这轮没出现断裂,算是把长视频的逻辑自洽问题给堵住了。
它还能基于现有视频无缝续生下一段 30 秒。比如一个男孩跑出地铁车厢手里攥着足球,男主角追上去抓住他,动作连贯得像实拍,没有那种 AI 特有的割裂感。
批量处理素材这块也做了大动作。一次能塞进 30 张图片、10 个视频片段和 10 个音频片段当参考。模型会把这些素材里的构图、场景、风格、人物、道具全吃进去,再按指令生成视频。多人同框时,它能同时还原几个角色的长相和声音,主体稳定性也没掉。官方演示那个 30 秒音乐现场,16:9 横屏电影级风格,钢琴手、大提琴手、小提琴手、主唱、乐团、合唱团加观众全在,群像调度难度不小,模型居然没崩。
这玩意儿把视频创作工具给重构了。以前是创作者逐帧拼素材,现在是给核心概念或素材,AI 自动搞定场面调度(Blocking)和剧情编排。短视频、独立电影甚至影视工业的生产管线可能得重新写。
生成 30 秒具备起承转合的视频,是 AI 视频技术走向成熟的关键节点。以前算力和模型限制,AI 视频很难撑过 10 秒还保持逻辑连贯。Seedance 2.5 在保持视觉风格一致的前提下,把复杂时间轴叙事做出来了,广告营销、虚拟拍摄、内容娱乐这些领域的想象力空间一下子被撑大了。
支持图文音混合输入,30 张图加 10 段视频加 10 段音频,还实现群像一致性,这相当于把“库鲁尔(Culling)”式创作法普及了。非专业创作者不用死磕提示词工程,也能做出好莱坞级别的群像互动视频,创意落地的成本被拉平了。
时长翻倍到 30 秒,让 AI 视频在广告片、电商短视频这些对时长有硬性要求的商业场景里,实用性呈指数级增长。加上火山方舟的 API 服务开放,企业客户能把这模型迅速集成到现有生产工作流里,规模化产出不再是空话。
