wok??这居然是商汤的官方账号??
刚刚,商汤正式发布并开源 SenseNova U1.5。
这是一个原生统一多模态模型,一个模型内直接覆盖视觉理解、图片生成、图片编辑。
这次重点把生成和编辑能力拉了上来。
支持原生 4K 图片生成,可以处理复杂构图、多主体、数量关系、风格和 Layout,对中文、英文文字生成也专门做了强化。
比较有意思的是编辑。
U1.5 支持直接通过 Bounding Box、视觉 Marker、多张参考图 去指定修改区域和参考对象。
比如框住图片里一个东西,让它只改这里,同时尽量保持其他区域不动。
官方 Benchmark 里,它在长文本生成、信息图和复杂 Layout 上已经开始和 GPT-Image、Gemini、Seedream、Qwen Image 这些大模型放在一张表里打了。
LongTextBench 中文达到 98.9,BizGenEval Hard 51.4,IGenBench Q-acc 61.9。
而且这次直接开源,Apache 2.0。
但是有个点需要注意一下,官方名字叫 SenseNova-U1.5-8B-MoT,这里的 8B 并不是整个模型只有 8B 参数。
它大概是 8B 视觉理解 + 8B 图像生成,Hugging Face 显示总参数量约 18B。
另外商汤还一起放出了 8-step LoRA,后面甚至准备继续公开从 SFT、RL 到 MOPD 的完整训练 Pipeline。
现在国产开源图像模型越来越有意思了。
前面大家还主要卷「文生图效果」,现在已经开始卷 统一理解 + 生成 + 精确编辑 这一整套工作流了。
看起来效果不错,差不多是nanobanana1.0的水平?
𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨𝟭.𝟱 𝗟𝗶𝘁𝗲 — 𝗦𝗵𝗮𝗿𝗽𝗲𝗿. 𝗠𝗼𝗿𝗲 𝗖𝗼𝗻𝘁𝗿𝗼𝗹𝗹𝗮𝗯𝗹𝗲. 𝗠𝗼𝗿𝗲 𝗖𝗼𝘀𝘁-𝗘𝗳𝗳𝗶𝗰𝗶𝗲𝗻𝘁. An 𝗼𝗽𝗲𝗻-𝘀𝗼𝘂𝗿𝗰𝗲, lightweight native unified multimodal model for visual understanding, generation & editing.
𝗕𝘂𝗶𝗹𝘁 𝗳𝗼𝗿 𝗿𝗲𝗮𝗹-𝘄𝗼𝗿𝗹𝗱 𝘃𝗶𝘀𝘂𝗮𝗹 𝗮𝗿𝘁𝗶𝗳𝗮𝗰𝘁 𝘄𝗼𝗿𝗸𝗳𝗹𝗼𝘄𝘀:
🔹𝗡𝗮𝘁𝗶𝘃𝗲 𝟰𝗞 𝗴𝗲𝗻𝗲𝗿𝗮𝘁𝗶𝗼𝗻 with better detail, composition & realism
🔹𝗖𝗼𝗺𝗽𝗹𝗲𝘅 𝗶𝗻𝘀𝘁𝗿𝘂𝗰𝘁𝗶𝗼𝗻 𝗳𝗼𝗹𝗹𝗼𝘄𝗶𝗻𝗴 across subjects, counts, text, layouts & styles
🔹𝗘𝗻𝗵𝗮𝗻𝗰𝗲𝗱 𝗖𝗵𝗶𝗻𝗲𝘀𝗲/𝗘𝗻𝗴𝗹𝗶𝘀𝗵 𝘁𝗲𝘅𝘁 𝗿𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴 & 𝗺𝘂𝗹𝘁𝗶-𝘁𝗲𝘅𝘁 𝗹𝗮𝘆𝗼𝘂𝘁
🔹𝗣𝗿𝗲𝗰𝗶𝘀𝗲 𝗶𝗺𝗮𝗴𝗲 𝗲𝗱𝗶𝘁𝗶𝗻𝗴 & 𝗰𝗼𝗻𝘁𝗿𝗼𝗹 with visual markers, bounding boxes & multi-image references
Just 𝟴𝗕 parameters — outperforming same-size models in instruction following and editing preservation, while 𝗰𝗼𝗺𝗽𝗲𝘁𝗶𝗻𝗴 𝘄𝗶𝘁𝗵 𝗹𝗮𝗿𝗴𝗲 𝗰𝗼𝗺𝗺𝗲𝗿𝗰𝗶𝗮𝗹 𝗺𝗼𝗱𝗲𝗹𝘀 𝗶𝗻 𝘁𝗲𝘅𝘁 𝗿𝗲𝗻𝗱𝗲𝗿𝗶𝗻𝗴 𝗮𝗻𝗱 𝗰𝗼𝗺𝗽𝗹𝗲𝘅 𝗹𝗮𝘆𝗼𝘂𝘁𝘀.
🛠️GitHub:
🤗HF:
👾Discord:
🎨SenseNova Studio:
显示更多