商汤林达华:多模态是Coding之后下一个战场
速览
商汤科技首席科学家林达华认为,多模态是继AI Coding之后的下一个决胜战场,纯文本语言模型天花板已现。商汤推出原生统一多模态架构NEO-unify,彻底移除视觉编码器,实现视觉与语言底层融合。基于该架构的SenseNova U1 Pro模型具备图文交错思维,能直接输出8K画质,对标GPT-Image-2等模型,切入设计赛道。
AI 深度解读
背景
2026年7月,在WAIC(世界人工智能大会)期间,商汤科技承办了“基座大模型架构创新与生态合作论坛”。《AI科技评论》借此机会采访了商汤科技首席科学家林达华。访谈围绕一个核心问题展开:大语言模型发展到当前阶段后,下一个决胜负的战场在哪里?林达华用一盆矮脚绿植的“盆景之问”给出了答案——人类能用语言描述一盆盆景每一片叶子的精确位置吗?大量感知细节无法用语言穷尽,人眼一瞬能看清的感知,语言往往无法说清楚。这揭示了当前大语言模型在理解真实物理世界时的边界。从高级审美、城市空间三维布局,到自动驾驶、具身智能与真实世界的交互,凡是需要理解物理空间的场景,都离不开真正的视觉能力。商汤由此押注的下一个战场正是多模态。
核心内容
林达华认为,AI Coding 是目前商业化最成熟的赛道,但纯文本语言的天花板已经清晰显现。即使用最好的代码模型写前端网页,一眼就能看出是AI生成的,与具备“苹果级”质感的现代产品界面存在明显差距。高级的设计感与空间美学,纯靠代码逻辑无法实现,这是纯文本 Coding 天然的盲区。行业中最敏锐的巨头已开始转向,例如以编程能力见长的 Anthropic 在 Opus 4.8 版本中重点强化多模态元素。当后端逻辑代码能力趋同、价格战愈演愈烈时,前端体验和视觉交互成为下一阶段竞争高地。商汤选择发挥自身在视觉上的积累优势,切入AI Coding战场。
对于“未来AI Agent都会以纯文本命令行(CLI)交互,多模态价值不高”的观点,林达华不认同。他认为只要人和AI持续共存,视觉交互就是人机交互不可替代的核心载体,因为CLI面向机器,而视觉面向人类体验。无论是办公汇报、海报设计、游戏开发还是影视制作,这些高频场景本质都离不开视觉。
商汤自研了原生统一多模态架构 NEO-unify,其核心初衷是让视觉与语言在底层大脑中融为一体,从而打造能在物理世界中思考、行动的“全能智能”。这并非易事:语音和文本属于同构模态,语音可直接映射为文字;但视觉与语言是完全异构模态,像素无法简单对应文字词元,攻克异构模态融合一直是多模态领域的核心难点。
长期以来,多模态大模型的主流技术路线是“拼接式架构”——在成熟的语言大模型之外外挂独立的视觉编码器(VE),本质上是先将图像“翻译”成文本再交由语言模型处理。这种方案工程门槛低、训练速度快,但技术天花板低,因为翻译过程会损耗大量精细化的空间和感知细节信息,导致视觉与语言融合效率低,并非“真正看见”。商汤团队很早就看到拼接架构的局限,并一直在寻找原生统一模型架构的可能性。林达华表示,多模态的终极形态应当是让不同模态拥有共同的内核语言和统一表征,像人类大脑一样顺畅无阻地深度沟通。OpenAI 和谷歌同样意识到这一点,但商汤选择走得更公开、更彻底。
2025年中,林达华团队联合南洋理工大学S-Lab,率先在小规模数据上验证了原生融合的设想。同年9月,团队发表论文《Towards Native Vision-Language Primitives at Scale》,在学术界首次系统阐述了彻底移除视觉编码器、建立深层融合的原生多模态NEO架构。2026年3月,商汤进一步发布升级框架版——原生统一架构 NEO-unify 和论文《NEO-unify: Building Native Multimodal Unified Models End to End》,系统阐述了打造端到端原生统一模型的设想。在NEO-unify架构中,商汤彻底移除了主流大模型普遍依赖的视觉编码器和变分自编码器,让模型不再需要“翻译器”,而是直接从像素和文字中学习。支撑其运转的是自研的 Mixture-of-Transformers (MoT) 架构,该架构让语言和视觉信息在模型的每一层计算中完成深度交融,对多模态领域而言,其意义堪比Transformer之于大语言模型。
NEO-unify架构仅需3.9亿图像文本示例(仅为业界同等性能模型约1/10的数据量),就涌现出了顶尖的视觉感知和推理能力。开源版本的 SenseNova U1(简称U1) 正是这套架构的成果,它拥有真正的“图文交错思维链”,可以在同一个上下文里边写字边插图,确保图像和文字在风格与内在逻辑上高度一致。在同量级开源模型中,仅以8B体量起步的U1直接斩获SOTA性能,部分表现甚至跨代直逼主流大型闭源模型。
研发团队随后锁定了“信息图”(infographic)赛道,并针对这一商业场景高频迭代:
- infographic-V1:在底层算力架构上全面重构,提升信息图的信息密度与排版质感。
- infographic-V2:彻底攻克小字清晰度与排版精度问题,大幅减少错字连字,视觉表现向专业设计师看齐。
- infographic-V3:引入“可编辑功能”,用户可随时点选、直接修改画面。
这套技术范式最终在 SenseNova U1 Pro(简称U1 Pro) 上全面爆发,宣告AI设计进入“交付级”时代。U1 Pro被定位为在审美和设计能力上都达到一定高度的产品。其训练过程像一位“顶尖设计师”的成长史:模型需要用上亿道“魔鬼级”的设计题去喂养。商汤构建了一个规模过亿甚至逼近数十亿级别的超大型“多模态题库”,单张设计图对应的文字描述和需求说明往往长达上千字。在预训练阶段,模型吞吐数十亿级的图文原生交错数据;持续预训练阶段,高比例的“合成数据”成为绝对主力,团队在数亿量级数据中高强度拉升模型专业设计能力;后训练阶段,精选千万量级黄金数据进行精雕细琢,让模型沉淀出成品级的交付质感。支撑这些合成数据的,是商汤内部一套极其复杂的、由超级Agent驱动的自动化数据合成管线。
商汤为多模态战略选择的核心赛道是设计方向,尤其是信息图,其商业化场景极强,尤其在B端(电商、广告、游戏、出海贸易等)。根据Precedence Research等报告,2026年全球设计领域生成式AI市场规模约为13.3亿美元,大型企业和企业级客户贡献超过47%的市场份额。然而,AI生图走向高端商业化长期面临瓶颈:AI无法准确理解需求导致图不达意,模板拼接方案存在无法消除的割裂感,模型无法建立元素间的设计因果,局部微调成本甚至超过重新原创。林达华指出:“学术界生成一张图,100个字错1个,论文里可以打99分。但真实商业世界里,一张客户的海报错一个字,这张图就是废纸,只能打0分。”
U1 Pro依托原生统一多模态架构,从底层理解到图像生成系统性解决了这些难题。林达华评判模型好坏的标尺是 交付率——生成内容无需大幅修改即可直接交付商用,达到付费专业设计师的出品标准。U1 Pro最新交付率稳定在70%。60%是商业可交付基准线,全球只有两个多模态模型超越这一基准:商汤U1 Pro和OpenAI的GPT-Image-2。70%交付率背后是严苛的全维度品控:文字错误率控制在千分级,图形元素、空间布局、色彩搭配等细节错误同步控制在千分级。
U1 Pro实现高交付率的核心在于 “视觉拆解思维链” 学习模式。训练时,模型拿到高质量海报后,自动拆解图像全部视觉组件,逆向推理设计师版式布局逻辑、色彩搭配思路,生成完整设计思维链学习,不只是学形似,而是抓思路和神韵。
