在世界人工智能大会(WAIC)“基座大模型架构创新与生态合作论坛”上,商汤科技正式推出了其最新力作——日日新SenseNova U1 Pro模型。这款模型以理解、生成、行动的原生统一为核心,成为面向长程任务的交付级原生多模态智能体基座,标志着多模态AI技术迈向新的发展阶段。
U1 Pro模型专注于设计领域,致力于输出可直接交付的“成品级”结果。其性能与海外顶尖模型如GPT-Image 2不相上下,展示了中国AI技术在设计领域的强大实力。商汤科技董事长兼CEO徐立在论坛上表示,多模态AI正沿着一条清晰的长程路径演进,从最初解决“生成美”的单点创作,到可交互的可控生成,再到如今正式迈向系统级交付。U1 Pro模型的发布,正是这一演进过程中的重要里程碑。
据介绍,U1 Pro模型具备四大核心交付能力:图像生成实现专业交付品质,最高可支持8K原生分辨率输出;大幅加强图文与细节控制能力;长程Agentic闭环思维;以及持续理解、规划、执行、检查和修正的复杂目标处理能力。这些能力使得U1 Pro能够广泛胜任信息图、演示文稿、宣传海报、科普图解、影视分镜、数字艺术等各类图像内容创作。
在论坛现场,徐立展示了U1 Pro生成的一张WAIC九周年长卷。这张长卷以东方水墨风格呈现,通过完整的视觉叙事串联了九年AI产业的关键节点。整条长卷时间叙事连贯,美术风格统一,局部放大后细节和文字依然精准无误,充分展示了U1 Pro在复杂图像创作方面的卓越能力。
商汤科技联合创始人、首席科学家林达华在接受媒体采访时表示,U1 Pro模型在生成过程中能够不断自主调整,最终输出可直接交付的“成品级”结果。他透露,在模型迭代过程中,至少有200位设计师提供了反馈,使得U1 Pro的文字生成和整体设计感能够与海外顶尖模型相媲美。林达华指出,城市设计、平面设计、工业设计等赛道具有巨大的商业价值,而U1 Pro模型的发布有望打开这些领域的商业赛道。
长期以来,多模态AI模型大多采用拼接架构,感知、理解、生成等功能各自通过不同模块实现。这种架构导致信息在不同模块之间的传递影响运行效率,并可能出现信息损耗。U1 Pro模型的一项重要技术创新是实现了理解、生成、行动的原生统一,不再采用拼接方案。今年早些时候,商汤科技发布了NEO-unify架构,使得模型可以统一完成视觉理解、语言理解和图像生成,不再需要中间的转换过程。
林达华解释说,原生统一模型在整个思维链中采用同一个表征空间,不再需要为不同的步骤更换表征。这种模型结构更简单,去除了视觉编码器和变分自编码器,减少了编码器和解码器的数量,使得所有组件都遵循一套标准的计算结构。因此,服务效率、计算效率和推理效率都得到了显著提高。他比喻说:“这就像是两个人在说话,不同的语言需要翻译,但使用同一种语言的交流效率就会很高。”
尽管U1 Pro模型是一款闭源产品,但商汤科技也在积极推动开源生态的发展。今年4月,商汤开源发布了轻量版SenseNova U1 Lite系列模型。在GitHub平台上,U1和Skills两个代码库的GitHub Star持续增长,合计超过8500,大量用户已将其纳入真实工作流。林达华表示,开源能够让更多人认识到企业及其技术体系,一个有生命力的技术体系一定不会只存在于一家公司里,而是会有社区和生态系统围绕它持续进行迭代。
他透露,NEO-unify架构开源之后,很多社区开发者提供了反馈,学术界也进行了创新性的探索。开源生态对于技术的迭代和健康发展起到了非常正面的作用。林达华强调,让社区共同成长是非常重要的,健康、可持续的商业模式离不开共同成长的生态。因此,商汤科技会坚持拥抱开源,与社区共同探索技术方向的可能性。
随着AI生成图像和视频技术的迅猛发展,AI短剧等AIGC内容的创作门槛越来越低。然而,这也引发了一些批评声音,对AI内容的“同质化”和AI制造虚假信息等问题表达了不满。对此,林达华表示,AI工具的革命赋予了普通人以较低成本创作短片、海报等作品的机会,这是非常积极的进步。同时,他也认为虚假信息等问题不容忽视,克服这些负面影响需要整个社会共同去回应,让AI以一种更安全、更负责任的方式发展。
林达华指出,对于AI从业者来说,可以从技术角度探寻解决方案,比如通过AI来检测一段视频是不是虚假视频。他认为,在治理AI带来的负面问题的时候,AI能力本身也可以成为一种助力。通过技术的不断进步和创新,我们有理由相信,AI将在未来发挥更加积极和重要的作用。