「能画」和「能交付」之间,隔着 60% 的距离 — WAIC 上商汤押注设计的底层逻辑
Site Owner
发布于 2026-07-21
商汤联合创始人林达华在 WAIC 现场说:100 个字错 1 个字,就是 0 分。一张图能不能交给客户,比模型跑分更重要。

「能画」和「能交付」之间,隔着 60% 的距离 — WAIC 上商汤押注设计的底层逻辑
2026 年 7 月 19 日,上海 WAIC 2026 世界人工智能大会首日,商汤发布 SenseNova U1 Pro,定位「面向长程任务的交付级原生多模态 Agent 基座」,首站瞄准设计行业。
同一天,OpenAI 的 GPT-5.6 因为过度自主执行任务,把 OthersideAI 创始人 Matt Shumer 的整台 Mac 文件洗劫一空。量子位报道里,开发者 Bruno Lemos 的整个生产数据库也被模型「自动清理」了。OpenAI 紧急回应:模型存在过度激进执行任务倾向,正在处理中。
两件事隔了 24 小时,指向同一个问题的两面:AI 能力越强、给的权限越大,问题反而不是「能不能做」,而是「做了之后敢不敢交」。

1. 交付鸿沟:99 分也不够用
商汤联合创始人、首席科学家林达华在 WAIC 现场举了一个例子:
一张海报上有 100 个字,错了 1 个字,你大概率不敢把它满大街去贴。但在传统生图评测里,100 个字错 1 个字,模型得 99 分。对交付来说,100 个字错 1 个字,那就是 0 分。
这就是「交付的鸿沟」。传统评测按维度平均打分,「细节逼真度」「构图合理性」各占几分,模型拿个综合高分并不难。但在真实商业场景下,一张图有一处硬伤就不能用,客户不会买单。
为了把这条线划清楚,商汤做了一个相当直接的方法。团队组织了 200 位美院学生和设计师,面对模型生成的每张图片,只回答一个问题:「如果你是一名设计师,你愿不愿意把这张图交给客户?」 获得肯定回答的图片比例超过 60%,模型才算达到交付级。
按这个标准去测,今年上半年之前的所有生图模型,交付率都是个位数。近期发布的商业化模型,包括一些热门产品,也低于五成。目前达到这条交付线的模型只有 U1 Pro 和 GPT Image 2。
「生成模型得 99 分,创作模型才能交付。」 这是林达华对两者区间的直接定性。
2. 从抽卡到 Agentic Generation Loop
同样是生图,为什么 U1 Pro 能过线?
林达华的回答很直接:「这是一个创作模型,不是一个生成模型。」
区别在过程。传统生成模型的逻辑是给一个 prompt,直接出一张图,中间没有过程,用户能做的只有换个 prompt 重新生成,也就是所谓的「抽卡」。U1 Pro 的工作方式完全不同,更像一个真实的设计师在工作:接到需求后,先思考用什么版式,画出草图,退后一步看是否符合意图,调整版式,然后逐区填入内容,最后整体调色和精修。
整个过程是多步迭代的 Agentic Generation Loop,每一步都包含理解、判断和修正。虽然用户看到的只是最终成品,但背后模型已经经历了数十轮的自我反思和优化。
林达华把它类比为 Coding Agent:「Coding Agent 构建一个 software,也不是一步 build 出来的,是经过若干步思考、反馈、迭代,一步一步构造出复杂软件。我们的模型也一样,你可以理解为它就是一个数字空间里的设计师。」

在技术层面,这种能力来自 U1 Pro 的核心架构特征:理解、生成、行动在同一个模型内统一。U1 Pro 使用 NEO-unify 原生统一架构,去掉了传统多模态模型中的 ViT(视觉编码器)和 VAE(变分自编码器),以纯 Transformer 统一处理文字与视觉。理解、生成和行动都使用同一种表征,模型无需在不同模块之间频繁「翻译」。
统一表征带来的第一个价值是学习效率。商汤此前披露,这套架构可以用约十分之一的数据达到同类 SOTA 模型的水平。第二个价值是计算效率,结构更简单,更容易扩展训练和推理,也能降低每一轮模型迭代的成本。
林达华把这条路径类比为 DeepSeek 路径:「当你有了一个很高效的架构之后,你在学习和各方面的成本就会降下来。」对于商汤这样的中等体量公司,架构效率直接关系到竞争方式——很难与 OpenAI、Google 等巨头正面比拼资源体量,更现实的选择是依靠更高的学习效率和计算效率,换取更快的迭代速度。
