【文/观察者网 陈思佳】
7月18日,在世界人工智能大会(WAIC)“基座大模型架构创新与生态合作论坛”上,商汤科技正式发布日日新SenseNova U1 Pro模型,它以理解、生成、行动原生统一为内核,是面向长程任务的交付级原生多模态智能体基座。
作为一个瞄准“设计”赛道的模型,U1 Pro能够输出可直接交付的“成品级”结果,效果比肩GPT-Image 2等海外顶尖模型。商汤科技方面表示,这款旗舰模型的发布也释放一个信号,表明在编程以外,“设计”正在成为顶级多模态模型的下一个主要赛场。
日前,商汤科技联合创始人、首席科学家林达华与观察者网等媒体进行对话。他表示,“交付级”模型有望打开平面设计、工业设计等领域的商业赛道,凭借理解和生成原生统一的技术创新,该模型的学习、计算和推理效率很高,有望获得更大的竞争优势。
瞄准设计赛道的“交付级”模型
U1 Pro是商汤科技的旗舰版图片创作模型,可通过内生的图文交错思维链创作出内容准确、设计精美、生产可用的图片素材,效果比肩海外顶尖模型。
商汤科技董事长兼CEO徐立18日在论坛演讲中表示:“多模态AI正沿着清晰的长程路径演进,从最初解决‘生成美’的单点创作,到可交互的可控生成,再到今天正式迈向系统级交付。当理解、规划、生成、校验、修正进入完整长程闭环,行业长期存在的可控不代表可交付的瓶颈将被打破。”
据介绍,U1 Pro把“交付级”设计作为模型应用的重要赛道,可以实现设计、生成、评审的长程循环,输出可以直接交付的“成品级”结果,能广泛胜任信息图、演示文稿、宣传海报、科普图解、影视分镜、数字艺术等各类图像内容创作。
围绕“一个复杂目标,持续理解、规划、执行、检查和修正”,该模型带来四项核心交付能力:图像生成实现专业交付品质、最高可支持 8K 原生分辨率输出、大幅加强图文与细节控制能力以及长程 Agentic 闭环思维。
U1 Pro生成的例图
在论坛现场,徐立展示了U1 Pro生成的一张WAIC九周年长卷,通过东方水墨风格的长卷地图,以完整视觉叙事串联九年AI产业关键节点。整条长卷时间叙事连贯,美术风格统一,局部放大后细节和文字依然精准。
林达华日前与媒体对话时表示,U1 Pro像是一个设计师,在生成的过程中不断自主调整,最终输出可以直接交付的“成品级”结果。他透露,至少200位设计师在模型迭代过程中不断提供反馈,U1 Pro的文字生成和整体的设计感已经能够对标GPT-Image 2等海外顶尖模型。
林达华指出,城市设计、平面设计、工业设计等赛道具有很大的商业价值,但以往的AI模型难以提供可直接交付的设计,一旦模型达到“交付级”,相关赛道就可能被打开。通过实现理解和生成的原生统一,U1 Pro具有很高的运行效率,有望获得更大的竞争优势。
从拼接迈向原生统一
长期以来,多模态AI模型大多采用拼接的架构,感知、理解、生成等功能各自通过不同模块实现,信息在不同模块之间的传递会影响运行效率,也可能出现信息损耗。
U1 Pro的一项重要技术创新,是实现了理解、生成、行动的原生统一,不再采取以往多模态AI模型的拼接方案。今年早些时候,商汤科技发布NEO-unify架构,模型可以统一完成视觉理解、语言理解和图像生成,不再需要中间的转换。
林达华日前对观察者网表示,传统多模态AI模型采用拼接的架构,视觉编码器(VE)负责理解,变分自编码器(VAE)负责生成,这种流程的效率较低。原生统一模型则可以做到在整个思维链中,理解、生成等过程都采用同一个表征空间,不再需要为不同的步骤更换表征。
林达华指出,原生统一模型具有更简单的结构,在去除VE和VAE、减少编码器和解码器的情况下,模型所有组件都遵循一套标准的计算结构,服务效率、计算效率和推理效率可以显著提高。
他形容说:“这就像是两个人在说话,不同的语言需要翻译,但使用同一种语言的交流效率就会很高。”
U1 Pro生成的例图
目前,U1 Pro主要瞄准设计赛道。谈及未来的长期目标,林达华表示,最为核心的目标是实现视觉和语言的联合涌现。他指出,随着广泛的语言数据被用于AI训练,业界出现了“GPT时刻”,大语言模型迅速崛起,但视觉的涌现还没有到达这样的水平。
他表示,现在承载广泛视觉数据的技术架构还不够成熟,也需要更多、更广泛的视觉和语言联合的数据,但NEO-unify架构可能为此提供一个技术底座。他指出,视觉和语言的深度融合是打开许多现实应用的钥匙,两者统一才有可能在更广的层面上实现真正的通用人工智能(AGI)。
开源生态意义重大
U1 Pro模型是一款闭源产品,但在今年4月,商汤也开源发布了轻量版SenseNova U1 Lite系列模型。商汤方面表示,在GitHub平台上,U1和Skills两个代码库的GitHub Star持续增长,合计超过8500,大量用户已将其纳入真实工作流。
林达华对观察者网表示,开源能够让更多人认识到企业及其技术体系,一个有生命力的技术体系一定不会只存在于一家公司里,一定会有社区和生态系统围绕它持续进行迭代。
他透露,NEO-unify架构开源之后,很多社区开发者提供了反馈,学术界也进行了创新性的探索,“开源生态对于技术的迭代和健康发展起到了非常正面的作用”。
林达华说,让社区共同成长是非常重要的,健康、可持续的商业模式离不开共同成长的生态。他强调:“开放生态让大家共同探索一个技术方向的可能性,所以我们会坚持拥抱开源。”
近年来,开源已经成为中国AI模型的一大标签,与美国科技巨头坚持闭源路线形成明显对比。美国消费者新闻与商业频道(CNBC)7月7日报道称,AI 聚合平台 OpenRouter的数据显示,自今年2月8日以来,美国公司通过该平台调用中国AI模型的比重持续保持在30%以上,最高达到46%。
美国乔治·华盛顿大学新兴技术与国际关系助理教授杰弗里·丁(Jeffery Ding)表示,此前一直有观点认为,美国实施的出口管制政策将限制中国AI发展,从而拉开美国与中国之间的技术差距,但实际情况截然相反。
AI能力可以成为AI治理的助力
如今,AI生成图像和视频的技术迅猛发展,AI短剧等AIGC内容的创作门槛越来越低。例如,商汤已经推出AI视频Agent Seko,结合U1 Pro模型生成导演级分镜稿的能力,似乎就可以构成一套“一体化”的AI内容创作流程。
但在AI逐渐成为广泛使用的生产力工具的同时,也有越来越多的批评声音,对AI内容存在一定“同质化”、AI制造虚假信息等问题表达了不满。
对于这些现象,林达华表示,AI工具的革命赋予普通人以较低成本创作短片、海报等作品的机会,这是非常积极的进步。借助AI的赋能,不具备相关专业知识的用户也能够充分释放他们的创造潜能和想法。
他认为,虚假信息等问题不容忽视,克服这些负面的影响需要整个社会共同去回应,让AI以一种更安全、更负责任的方式发展。
林达华说,对于AI从业者来说,可以从技术角度探寻解决方案,比如通过AI来检测一段视频是不是虚假视频,“在治理AI带来的负面问题的时候,AI能力本身也可以成为一种助力。”