SenseNova U1.5-Lite-Preview 开源了: 4K 生成、复杂排版和原生图像编辑

这次目前只开源了权重,我还没饭判断本地部署的成本,把主要功能放在这儿 原生 4K 图像生成 U1.5 重新设计了图像生成头,并把训练扩展到 4K 分辨率。 这部分主要改善:

局部纹理和高分辨率细节 材质表现 光影一致性 视觉 Token 网格产生的痕迹 拼接缝和破损纹理

中英文文字和复杂排版 这次更新加强了中文、英文文字生成,以及海报、信息图和品牌视觉中的复杂布局 简单任务仍然可以使用短提示词, 长提示词和 JSON 一类的结构化指令主要用于提高复杂任务的可控程度,不是每次生成都需要写几千字 这个方向对海报和信息图比较实用。这类任务的难点通常不在于生成一张好看的背景,而在于同时处理文字、层级、对齐、多个主体和局部约束。

图像编辑能力 U1.5 覆盖的编辑方式比较多:

根据参考图重新解释风格和设计 从多张参考图提取人物、产品、场景或风格并重新组合 根据单张人物或产品图制作新海报 修改信息图中的标题、数字、图标、图表和局部布局 替换现实场景中的文字 通过红框、坐标或标记点指定编辑区域 在当前结果上继续修改

文字编辑会尝试保留原来的字体、材质、透视、布局和遮挡关系。局部编辑则强调保留主体身份、空间结构和未指定区域。 我个人更关注连续编辑。如果模型能够在多轮修改后仍然保持人物、商品和版式的一致性,它会比一次性文生图更接近真正的设计工具。

Benchmark 官方给出的数据都是 U1.5 Preview 与上一代 U1 的对比:

Benchmark U1 U1.5 Preview

Qwen-Image-Bench 47.14 55.20 (使用 Prompt Enhance )

ImgEdit-Bench 3.90 4.37

GEdit-Bench-en 7.47 8.17

GEdit-Bench-zh 7.42 8.05

换算下来,四项指标的相对提升大约是 17.1%、12.1%、9.4% 和 8.5%。 这些结果只能说明 U1.5 相比 U1 有进步。由于没有完整的同条件横向测试,目前无法据此判断它和其他开源图像模型的实际差距。Qwen-Image-Bench 的 55.20 也必须带上 Prompt Enhance 这个条件。 目前已知的问题 官方材料列出的待改进项包括:

短提示词的理解和设计能力 小字号文字 人物面部细节 细粒度语义纹理 整体审美一致性

我的看法 从介绍材料来看,U1.5 的方向比较明确:把生成、参考图控制和局部编辑放进同一个工作流

连续编辑几轮以后,主体和布局还能不能保持一致 中文小字和复杂海报能否稳定复现