当前位置:
文章详情

把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

2026-08-22 22:09:21 0点赞 0收藏 0评论
把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite作者|樊雅婷**|FFF111f__

以前的 AI 生图,连六根手指、文字乱码、透视错乱这类基本关都过不了,更不用说商用了。

如今模型能力大幅跃升,用户的要求也随之水涨船高。文字渲染、复杂版式、多图参考、局部编辑、原生4K——这些过去需要多个工具协作才能完成的任务,现在正被压缩进同一套模型之中。

但「能力出现」和「能力可用」之间,依然横亘着不小的距离。一张商业海报可能同时包含人物、产品、商标文字、指定数量、前后空间关系、品牌色号以及若干禁改项,任何一个要素被模型遗漏,整张图就要推倒重来。而每一次推倒重来,都意味着新的token消耗。

甲方的无数条修改意见,就这样在反复生成中被放大为高昂的算力成本。

正因如此,当生图模型真正进入创作流程之后,用户的诉求已经非常明确:更快的时间,更好的交付,更低的成本。

8月3日,商汤开源 SenseNova U1.5 Lite Preview,初步展示了原生统一多模态模型在图像生成与编辑上的能力边界。今天,正式版 SenseNova U1.5 Lite 继续向前迈出一步,目标是让这些能力真正融入视觉创作与交付流程。

这一次升级,商汤没有继续在模型规模上做文章。

把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

由 SenseNova U1.5 Lite生成的图书封面

通过精调训练数据、重调后训练流程、优化任务设计,最终打磨出的 SenseNova U1.5 Lite,是一款轻量级、原生统一多模态开源模型。它的目标也非常具体,就是解决用户最真实的诉求,做到更稳、更准、更好。

1

先把分数摆上来

开源生图从来不缺尝试者。难的是在保持模型开放、轻量和可部署的同时,把画质、文字、布局与编辑放进同一个模型,而且每一项都不能成为明显短板。

把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 LiteSenseNova U1.5 Lite 与主流开源、闭源图片模型横向Benchmark

在完整横向评测中,SenseNova U1.5 Lite 在所有维度都位于开源生图模型的领先位置,并且展现了比较均衡的系统能力,在复杂指令、视觉质量和创意生成等维度都表现出较强竞争力。

正式版的提升没有集中在某一项孤立技能上。生成质量、指令执行和编辑能力都在进步。

U1.5 Lite 还能在确保更高性能同时,实现更少的生成延迟。下图显示了测评中,SenseNova U1.5 Lite在 OneIG(EN、ZH)、LongText(EN、ZH)、BizGenEval(Easy、Hard)、CVTG、IGenBench 与 Qwen-Image-Bench 上的生成延迟与平均性能对比。

把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

对于需要批量生成海报、电商图和营销素材的团队,这样带来的意义就很直接。同样的时间和预算,可以支持更多次尝试,也能把生成能力放进更高频的工作流。

不过,Benchmark 终究是一张坐标图。

把这些分数塞进一份真实的设计需求,事情才开始变得有意思。

1

一些实测

一条长Prompt,能不能变成一张完整海报

以前的 AI 生图,提示词太长,模型执行指令时候就会变成金鱼,出现遗忘现象。

所以,第一个测试,是一条长得有些不讲道理的Prompt。

一张竖版2:3复古城市旅行海报,香港维多利亚港,前景是木质红帆船,深红棕色帆面张开,海面有波纹和倒影;中景是现代香港天际线,密集高层建筑,右侧有一栋高耸圆角玻璃摩天楼,左中有带斜向交叉结构的尖顶高楼,建筑背后有灰绿色山体轮廓;远景天空为米白色,右上角有淡橙色柔和小太阳,天空中有几只飞鸟剪影。左上角是巨大的黑色窄长衬线英文标题“HONG KONG”,分两行排列,非常醒目;标题下方有红棕色小号英文副标题“HONG KONG”和几行小字说明。右上角有竖排中文“香港”,红棕色细长宋体,下方有小英文和红色印章式装饰。整体为复古高端旅行海报风格,摄影底图与平面排版结合,低饱和暖色调,米色纸张质感,轻微胶片颗粒,柔和雾气和空气透视,构图左重右轻,留白充足,画面安静怀旧,像高端城市旅游杂志封面。不要出现水印、**、品牌标志、乱码文字,不要现代游艇或快艇,不要高饱和蓝天或强烈夕阳,文字清晰准确。

可以看到效果不错,从真的理解到真的执行。

把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

4K不只是把画布放大

高分辨率生成最容易被误解成像素数量的简单增加。

真正困难的,是画布变大之后,模型还能不能稳住整张图的全局结构。标题、正文、图标和人物之间的关系不能散,局部的文字边缘、材质纹理和光影过渡也不能糊成一片。

U1.5 Lite 正式版原生支持 2K 和 4K 生成。在广告级的画幅下,细节经不经得起推敲,一张图说了不算,放大到 100% 才算。

所以我决定拿时尚封面杂志来试。

前卫高定时装摄影。一位模特身着半透明纸质高定服装,由褶皱、折叠插片、层叠纸板构成。构图上方密集、下方留白,地面有一处红色折纸点缀。配色为绿玉色阴影、阳光黄透光纸边、中国红插片、纯白表面。关键词是摄影,前卫高定时尚大片,纸艺工程,风动感,实验冷静气质。把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

可以看见成片保留要求的同时保留了纸张褶皱、皮肤纹理的真实感。

改一个地方,其他地方不动

第三组测试从一张已经完成的海报开始。

我给的提示词是

把图片中标题的文字样式改为带有噪点和撕纸纹理的复古风格。把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

再来一个更细节的。我给的 prompt 是

保持这个配色,将左侧红框中的图案换成更真实的3d金属设备 红框仅用于定位,输出图像中不要保留红框。其他地方不变。把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

可以看到,这两次海报的局部编辑,除了我的要求,其他地方什么都没改变。

算是高质量的修改交付。

这也对应U1.5 Lite正式版后训练中的一个重要目标:Editing Preservation。

好的编辑需要同时完成两个动作。一边准确执行修改,一边保护原图。该动的地方要动,不该动的地方尽量别动。

当这种保持能力逐渐稳定,图片模型才能从一次性生成器变成可反复沟通的创作工具。用户不再需要每次都推倒重来,可以在同一张作品上继续修改。

下面我们尝试下保持参考图的风格和布局,进行编辑:

参考这张图的水墨视觉语言,生成一张候鸟迁徙廊道保护信息图。把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite参考图把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

成图

接下来,我计划再给模型多看几张图,难度还会继续增加。

多张参考图融合出成片

多图参考真正难的地方,是模型能不能分清每张图的职责。

可能它需要保留第一张图里的人物身份,借用第二张图的色彩和材质,再沿用第三张图的版式关系。参考图之间不能互相污染,风格迁移也不能吞掉主体。

U1.5 Lite支持单图、多图参考,以及 Bounding Box、Visual Marker 等控制方式。用户可以指定对象和区域,完成元素插入、替换、局部精修和参考风格迁移。

我把我喜欢的动漫角色都放进一张海报里。

←左右滑动查看更多→

上传这五张图片之后,我给的 prompt 是:

帮我为学校咖啡厅活动设计一张可爱的动漫海报,我想让绿发女孩当我们的厨师,酷男孩(图3)当服务员,黑发女孩(图4)当接待员。让那位严肃的男士(图1)当美食评论家,甜美金发女孩当开心的顾客。请添加一些简单的英文标题,比如“Sweet Cafe”,让它看起来像真正的活动传单。把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

可以看到最后的成图信息清晰,符合要求。时间 / 地点 / 菜单三个部分以小卡片的形式独立列出,还设计了 So yummy、Come & Enjoy 等符合人物形象的小对白,用气泡呈现增加了活泼感。

模仿、借鉴,再创作

当你的灵感来自于他人的作品,这个时候就可以让模型参考之后进行再创作。就像我觉得下面这张图很好看,我想自己模仿这张图设计一张其他主题的海报。所以我就

更新图1中的主客厅插图,使其与图2中的蓝绿色沙发和几何配色方案相匹配。将现有的白色和橙色沙发替换为蓝绿色L型转角沙发,并更新地毯、扶手椅和墙面装饰,使其采用包含蓝绿色、芥末黄、陶土红、米色和深蓝色的几何图案。添加图3中那只戴着蓝绿色项圈的浅棕色卷毛贵宾犬,让它坐在房间中央扶手椅之间的几何图案地毯上。更新家具布局示意图和配色方案部分,以体现这一新的蓝绿色和几何配色主题。

最后的效果呈现,实力无需多言。

图一图一图一图二图二图二图三图三图三成图成图成图

当模型能够区分参考谁的主体、借用谁的风格、沿用谁的布局,多图参考才真正离开玩法展示,进入创作流程。

1

一个模型,怎样同时做好几件事

SenseNova U1.5 Lite 延续了 NEO-unify 的原生统一多模态路线。

在同一个模型架构之下,视觉理解、图像生成与图像编辑被共同训练。模型首先理解原始图像和用户指令,识别其中的主体、文字与空间关系,再完成像素级的最终生成。整个过程中,用户无需在理解模型、生成模型和编辑工具之间反复切换。

统一带来的价值,还进一步体现在能力的迁移上。

模型在视觉理解任务中习得了结构、位置、文字排布与信息层级,这些认知成果可以顺滑地迁移到生成和编辑任务中。面对一条较长的自然语言指令,模型需要解析的已经不是孤立的关键词,而是这些要求之间的内在关系:谁在左边,谁不能被遮挡,哪段文字属于哪个区域,修改时又有哪些内容必须被保留。这正是 U1.5 Lite 能够处理层级化视觉需求,却不需要依赖固定 JSON 模板的原因之一。

但统一训练解决了能力共享的问题之后,新的矛盾也随之浮现。

OCR 关心文字是否准确可读,美学关心构图、色彩和整体质感,编辑则还要兼顾主体身份与结构保持。如果简单地把所有训练目标混在一起,往往会出现一项能力变强、另一项反而被削弱的窘境。

正式版的应对策略,是让各项专项能力先分别变强。

商汤训练了 OCR、美学和编辑等多个 Expert:OCR Expert 强化中英文文字识别与排版质量,美学 Expert 改善构图、色彩、材质、光影和真实感,编辑 Expert 则负责确保主体身份、空间结构以及非编辑区域的一致保持。随后,通过 MOPD 将这些 Expert 的能力重新蒸馏回 U1.5 Lite 中。

最终部署的,仍然只有一个模型——没有额外的 Router,用户也无需关心该调用哪一个 Expert,生成和编辑继续通过统一接口完成。

在此基础上,正式版又引入了更精细的任务导向 RL。它优化的三个目标,都能与前面的测试维度一一对应:Instruction Compliance 关注复杂指令是否被执行完整,Visual Preference 关注构图、真实感和整体完成度,Editing Preservation 关注指定区域是否改对、其他区域能否保持不变。

最后交付的,仍然是 U1.5 Lite,一个轻量级、易部署的统一模型。

1

多模态是一件慢回报的事

镜头拉远,多模态模型正在进入一个更现实的阶段。

能力仍在增长,行业却已经开始算账。投入多少,成本几何,回报又在哪。参数规模能快速制造话题,但真实视觉任务里的稳定性,靠的是数据、评测和一次次后训练,慢慢磨出来。

长指令会不会漏、文字能不能写对、4K下结构能否保持、局部编辑会不会破坏整张图,这些看似微小的问题恰恰决定了模型能不能真正进入海报、信息图、电商素材和品牌视觉的日常生产。

商汤选择继续沿着原生统一的路线投入。

从 U1 到 U1.5 Preview,再到正式版,SenseNova 没有简单叠加一份更长的能力清单。它在尝试回答一个更实际的问题:一个轻量级、统一、开源的多模态模型,能不能更完整地承担真实视觉创作任务?

U1.5 Lite 给出的答案是让能力更强,也让能力更稳。

把视野再拉开一点,视觉创作只是多模态进入现实世界的一站。一个模型需要先理解画面中的对象、文字和空间关系,才能进一步生成、编辑,最终与更复杂的真实环境发生连接。

这条路不会很快。

但对今天的用户来说,判断它有没有向前走并不难。只需要把它放在最真实的需求里,一试便知。

会生成只是起点,稳定地完成任务,才是开源视觉模型真正进入生产的开始。

GitHub:

https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:

https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio在线体验:

https://unify.light-ai.top/

把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite点个“爱心”,再走吧
展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松