AI-NEWS · 2026年 8月 5日

商汤 SenseNova U1.5-Lite:8B 参数跑通 4K 生成与编辑

商汤科技正式开源了 SenseNova U1.5-Lite-Preview,这是一个基于 SenseNova U1 的系统性迭代版本。它没走单纯堆参数的老路,而是把视觉理解、推理、生成与编辑这四件事打包进了一个轻量架构里。

U1.5-Lite 最狠的地方在于极致的参数效率。整套模型只用 8B-MoE(混合专家模型),就能搞定 4K 分辨率图像生成复杂视觉控制

4K 分辨率下,模型能渲染出更精细的局部纹理和更逼真的世界纹理,不像以前那样糊。同时,哪怕参数压得很低,它也能精准执行复杂的视觉指令。

商汤做这版主要是想验证一件事:在保持轻量架构的前提下,能不能把统一多模态模型的能力上限往上调。U1 证明了架构可行,U1.5-Lite 就是冲着这个“轻量级能力天花板”去的。

跟上一代 U1 比,U1.5-Lite 在四个维度的优化肉眼可见

  • 图像生成 (Generation):原生支持 4K 分辨率;纹理细腻度上来,中英文文本生成准确度也高了,复杂布局排版能力更强。
  • 图像编辑 (Editing):编辑稳定性大幅提升,能更好保留原图的主体身份、空间结构以及没被编辑的区域。
  • 技术细节改进
    • 重设计生成头(Generation Head):解决了网格伪影(Grid Artifacts)问题,优化了高分辨率细节建模,降低了视觉 Token 对最终图像造成的负面影响,训练直接扩展至 4K 分辨率。
    • 重组编辑任务:重新组织了编辑数据与训练任务,显著增强了维持原图内容一致性的能力。

实测数据也坐实了这次升级

  • Qwen-Image-Bench (图像生成质量)
    • 47.14 提升至 55.20 (含提示词增强)。
    • 生成质量实现了大幅跨越,接近主流大模型水平。
  • ImgEdit-Bench (图像编辑综合)
    • 3.90 提升至 4.37
  • GEdit-Bench (图像编辑细分)
    • 英文版:从 7.47 提升至 8.17
    • 中文版:从 7.42 提升至 8.05
    • 特别是在图像编辑场景中,模型对指令的遵循度更高,且在修改特定区域时,对原图非编辑区域的保留能力更强,表现更为稳定。

这个模型释放了一个明确的行业信号:模型能力的增长不再单纯依赖参数规模的盲目扩张

商汤通过“架构创新换取能力增长”的策略,证明了轻量级统一多模态模型的巨大潜力。在仅 8B 参数下就能跑通 4K 生成精细编辑,这极大地降低了多模态应用的技术门槛和部署成本。

从数据重组、训练策略到模型结构设计(如重设计生成头),全链路的优化是突破性能瓶颈的关键。

这次开源可能意味着轻量级统一多模态模型刚刚步入“潜力爆发期”。它为行业探索高效、低成本的高分辨率多模态应用提供了新的范本,特别是对于那些对显存敏感但需要高分辨率输出的场景。

火龙果频道