专访商汤首席科学家林达华:多模态的涌现时刻会在一两年内到来
文|李炤锋
编辑|张雨忻
“没有电脑的年代,也有爱因斯坦和牛顿。我们不会因为他们不写代码,就认为他们不够聪明。”
近日,商汤联合创始人、首席科学家林达华在36氪的专访中,用这句话描述Coding与智能上限的关系,也解释商汤为什么仍把原生多模态作为长期方向。
眼下,Coding Agent已经较早跑通商业闭环。公开信息显示,截至7月底,Anthropic的年化收入已超过650亿美元,约为2025年底的7倍。多模态何时能拿出同样清晰的能力和商业结果,是这次对话反复触及的问题。但从长期看,林达华认为,“AI和AGI的空间远远不止Coding”。
谈到多模态在追求AGI中的位置,
几乎在同一时间,英伟达创始人兼首席执行官黄仁勋发布了面向机器人和自动驾驶的世界基础模型Cosmos 3。模型将视觉推理、环境模拟和动作预测放在同一套架构中。黄仁勋说,Cosmos 3“能够理解和推理,能够生成,也能进入模拟闭环,甚至可以直接成为策略本身”。
在林达华看来,这并非谁对谁错。每家公司面对的任务、资源和长期愿景不同,选择自然也不同。
商汤从计算机视觉起家,进入大模型阶段后,又把这套技术积累延伸到原生多模态和空间智能,多模态因此成为贯穿模型与产品布局的一条主线。
在商汤的模型矩阵中,SenseNova 6.8系列是多模态智能体模型,负责长程任务的规划、执行与多Agent协作;U系列是原生理解生成统一模型,聚焦视觉理解、生成和编辑,并向视频、三维延伸。而在应用层,Seko是AI短片创作智能体,串联故事、分镜和视频生成;小浣熊是AI办公智能体,面向办公和数据分析等任务。
今年4月,商汤发布并开源日日新SenseNova U1原生理解生成统一模型。与常见的视觉语言模型不同,U1拿掉独立视觉编码器和VAE(变分自编码器),在一套自回归架构中联合处理语言、视觉语义和像素生成。
近四个月后,商汤发布U1.5 Lite,将这套架构从理解和生成,扩展到连续编辑,同时加强高分辨率生成和复杂指令控制。
在商汤最新发布的2026年中期业绩中,公司上半年收入29.1亿元,同比增长23.4%;生成式AI收入23.3亿元,占比接近八成。
在AI业务增长的带动下,商汤首次实现国际财务报告准则下盈利,也为多模态领域的长期技术投入留出了更多空间。
以下为访谈实录:
01
核心不是Coding,而是长程思考
36氪:梁文锋把多模态视为类似搜索的“组件”,不认为它是提高智能上限的主线。你却判断,多模态充分融合后,单独的语言模型将不再必要。分歧在哪里?
林达华:我其实挺佩服
商汤面对的任务不太一样。办公、医疗、零售、机器人和世界模型,都不可能缺少视觉信号。我们很早就认为,视觉和语言的联合建模,是人工智能进入真实行业和物理世界的基础。
商汤也做Coding,我们把编程能力视为模型的重要基础能力;但我们不会把复杂软件工程作为唯一的主攻方向。
再往下看,关键在于怎样理解智能上限。Coding能力强是智能水平提升的结果,但智能的核心本质不是Coding这种工作形态,而是汇聚复杂信息,进行长程思考、推演、执行和修正。
36氪:长程智能要进入现实世界,原生多模态是必要条件吗?
林达华:如果模型只写代码,多模态未必是必要条件。任务一旦从Coding走向更广泛的行业和真实世界,很多场景就离不开它。
Coding是目前数据条件最成熟的体现长程思考能力的载体。GitHub上有大量过程数据,代码可以运行、测试用例还能提供确定的反馈,背后又有成熟的软件工程市场,所以它最早走通了训练和商业闭环。
但人工智能不会只停在Coding。即使做前端开发,模型写完代码也要把页面渲染出来,看看它是否好看、有没有明显错误,这同样需要视觉能力。
36氪:我们和一些做MLLM(多模态大语言模型)及原生多模态的研究者交流时,他们提到,加入视觉数据会显著增加预训练和后训练难度,配比处理不好,还可能导致语言、数学和推理能力退化。您怎么看原生多模态模型的训练难度和成本?
林达华:如果只是在语言模型上接一个视觉编码器,推理端多出来的计算,相较于数百B甚至1T参数的语言主干,其实微不足道。真正困难的是训练。
首先是数据配比。模型增加视觉能力,就要加入相应数据,同时避免原有的语言、数学和推理能力退化。这就是我所说的Alignment Tax(对齐代价)。它不只是把比例从1:9调成2:8,还要做大量对照实验;模型每次升级,配比也可能重新调整。
其次是强化学习。引入新的模态后,训练目标和技术方案都会变复杂,而且给视觉相关任务建立反馈信号本身也还是一个开放问题。最贵的往往不是最后一轮大规模训练,而是前期探索方法的时间。对模型公司来说,问题未必是付不起钱,而是多做一轮实验,模型就可能比竞争对手慢一个月。
这也是我们先用8B参数轻量模型迭代的原因。理解和生成统一这条路径还没有完全收敛,先把架构、数据配比和训练方案跑稳,再扩大规模,效率反而更高。
图说:U1 Pro生成图片
02
生图是最先解锁的能力,但不是终点
36氪:U1和U1.5目前主要还是图像生成。对用户来说,这套不依赖传统视觉编码器的统一架构,带来了哪些专用模型做不到的体验?
林达华:对用户来说,最直接的变化是模型先理解内容,再决定怎么生成。面对几段复杂信息,它要判断哪些内容重要,再安排结构、版式和视觉表达。信息图正好需要把理解、推理和生成连起来,所以我们先从这个场景入手。
U系列还有一个更长期的目标,就是空间智能和物理智能。我们也曾考虑把空间智能和生图一起做,但模型每增加一种能力,训练复杂度都会明显上升。所以当时先把更复杂的空间智能放一放,让U1把理解和生成统一这条路走通,建立起如何让语言和视觉元素在一个表征空间进行融合的技术认知。
做长期技术不能闷着头三年,什么阶段性成果都不拿出来。商汤是一家上市公司,需要不断交出用户有感知、对行业也有价值的结果。生图是这条路最先解锁的能力,但不是终点。
36氪:U1.5重点提升了文字生成、审美和连续编辑。它怎样改变过去反复“抽卡”的生图流程?
林达华:U1推出后,我们在实际使用中看到,文字生成和局部细节还有提升空间。我们从4月到6月连续迭代信息图版本,把文字逐步修对。后来又发现,字即使全对了,图也可能像学生做的PPT,没有设计感。所以我们请真正的设计师参与,把审美这一课补上。审美和逻辑能力是两件事,Coding和美感也是两件事。模型再强,也不会自动产生美感。
文字准确、画面好看,解决的仍然只是单次生成质量。真实设计不会生成一次就结束,完整的构图和修改要求可能有一两千字。模型既要理解这些约束,也要只改指定区域,尽量不动其他部分。
过去的一次性生成更像“抽卡”:连续生成五张图,可能分别错在五个地方,没有一张能用。持续编辑则让用户保留已经正确的部分,哪里有问题就改哪里。
持续编辑是一项基础能力。以此为枢纽,就能把理解要求、生成内容和反复修改连成一个闭环,这就是我们所说的Agentic Generation(智能体式生成)。模型围绕同一份作品持续迭代,直到能够交付。
36氪:腾讯的姚顺雨曾提出,用户愿意为最强的模型付费;企业判断性价比也要先看性能,有时模型更贵,却可能因为一次把事情做对而更省钱。U1.5 Lite强调性价比,U1 Pro追求能力上限,商汤怎样理解这两类需求?
林达华:模型首先要达到用户真正能用的水平,价格才有讨论的意义。U1.5 Lite是8B参数的开源模型,更重视效率和性价比,适合大量日常任务。U1 Pro追求的是能力上限,成本会高得多,但目标是交付专业级效果。
这有点像轻便相机和专业单反。有人愿意为顶级效果付更高价格,也有人更在意效率。Lite版本出现细节瑕疵的概率可能更高,但它容易修改,不必重新抽卡。两种产品对应的是不同需求。
36氪:企业既可以用一个通用大模型包办任务,也可以让智能体调度多个专业模型。放到真实工作流里,哪种方式更经济?
林达华:模型先要有完整的基本能力,再术业有专攻。这里有一个不可能三角:能力广度、专业深度和成本。一个又广又深的超级模型当然可以做,但一定很大、很贵。
企业也不会每个岗位都雇一个“超人”,现实的做法还是让不同专业的模型组成团队,当然这里每个模型还是有健全的基本智能的。
对商汤而言,SenseNova 6.8(多模态智能体模型)更像管理者,负责长程任务和多个专业智能体的协作,这个智能体也需要有“眼睛”来看懂图像并决定下一步行动;U系列更像视觉领域的专业人士,把精细视觉感知、可控生成和空间智能做到很高水平。两者各有分工,共同完成任务。
36氪:商汤的AI内容创作平台Seko能够完成视频创作,也可以接入Seedance等专用模型。相比单一的视频生成模型,Seko更希望解决什么问题?
林达华:Seko要交付的是完整的视频创作流程,但不需要所有环节都由商汤自己的模型完成。最终的视频渲染可以调用Seedance等专用模型;故事怎么展开、分镜如何生成,看完效果以后怎样调整,这套创作和迭代的闭环,这个创作流程才是真正体现创作者的智能水平的,这是我们重点掌握的。
视频画质很大程度上取决于高质量数据和资源投入。商汤更关注的是让模型理解创作意图,判断哪里需要调整,再把理解、生成和修改连起来。这也是Seko与专用视频生成模型分工不同的地方。
03
空间智能还没有迎来GPT时刻
36氪:生图、生视频、三维和空间智能都需要持续投入。资源有限时,商汤用什么标准决定聚焦哪项能力?
林达华:我们真正聚焦的是两个关系:语言智能能不能影响视觉想象和生成;视觉生成和想象,又能不能反过来影响推理。
所以,我们在投入上重点关注哪些事情可以提升我们对于上述两个问题的认知。
生图、视频和三维看起来是不同方向,底层都在处理这两个关系。所以我们不会把每项指标都做到极致。比如视频,我们不会把电影级画质作为最主要的竞争点;人像生成也会继续做,主要是保证生成质量,但不会成为最核心的方向。
做生成的时候,我们选择信息图作为重点场景,主要是因为它需要真正的智能,来判断如何在有限的画面中有效地组织和传达信息;做办公的时候,我们也特别关注数据分析和预测,它对于智能水平的考验是很强的,可以牵引智能上限的摸高。
所有人都在卷Coding时,我们反而可以按自己的节奏做事。如果所有人都转去做空间智能,我们的压力可能会更大一点。
36氪:一年前,有从业者把世界模型比作“GPT-3阶段”。如今距离真正实现泛化还要多久?
林达华:具体场景里能用的东西已经很多,只是还不能泛化。给定一个场景,今天的VLA(视觉—语言—动作模型)或WAM(世界动作模型)可以做得很专业,但换一个场景,模型未必还有基本判断。
真正的GPT时刻,需要同时做到广和深。广,是换到很多场景都能理解;深,是能够持续完成长程思考和行动。空间能力还要和复杂逻辑结合,否则任务走到一半突然不会想了,依然很难商业化。
如果要看到具备一定泛化能力的系统,我觉得还需要1—2年。模型的能力会一
36氪:世界模型和空间智能普遍被认为受数据制约。您觉得真正缺的是数据,还是使用数据的方法?
林达华:先区分两个概念。世界模型要学习世界及其物理规律;空间智能关注的是人怎样理解空间、在空间中思考和行动。至少对空间智能来说,我不认为世界上缺视频。公开视频和第一人称视频都非常多,我们的生态企业也在做第一人称数据采集。真正的问题是,这些数据还没有被充分利用。
数据也需要分层使用。像训练语言模型一样,预训练阶段广泛吸收素材,中期训练加入具体领域的任务和推理过程,后训练再面向具体任务调整。
现在大家主要用视频训练生成模型,让它学习画面长什么样、下一帧怎样变化,却没有充分利用视频提升智能。比如电影里,一个人看到某件事后突然露出惊恐的表情。模型不仅要看见这个表情,还要理解他为什么惊恐,它和正在发生的事情有什么关系。这才是理解。
所以这里有两件事:一方面要继续采集适合空间智能的视频,另一方面要围绕视频提出正确的问题、建立事件之间的关联。后者才是目前还没有规模化做好的事情。
36氪:U1.5已经能在图片上连续编辑,这套思路会怎样延伸到视频和三维?
林达华:从空间智能的目标看,三维的优先级甚至可能高于视频;空间智能的本质就是理解三维世界,并且能在三维空间中行动和交互。连续编辑和反馈循环的基本原理是相通的,但进入视频和三维以后,数据形态更复杂,也会遇到新的问题。
这条技术主线已经比较清楚,接下来是逐步解决具体问题。U2也会加入更多空间智能元素,对三维空间的建模和理解会进一步加强,不会只是把静态图片延长成视频。
04
多模态不是伪需求,但要问对问题
36氪:Coding已经带来明确的收入和估值反馈,多模态的回报周期看起来更长。商汤怎样在坚持长期路线的同时,也能给出阶段性结果?
林达华:商汤并非不做Coding,只是没有把复杂软件工程作为主要方向;我们一直坚定认准长期愿景,并且为此把资源投入到关键优先事项上。
市场最终还是要看这条路线能不能产生客户和收入。商汤需要通过小浣熊(AI办公智能体)等产品的用户增长、复购和付费,证明多模态在商业上是成立的,而不是只靠发布一个更大的模型。
我们内部讨论过要不要冲一个1T参数模型。我们的结论是基于技术规律往前走,在合适的时候会做1T和更大的模型,但是一定是基于有革新性的架构和技术来推进,而不是简单地扩大规模进行同质化竞争。
我们不希望为了尽快把规模做大,延缓对真正问题的探索。当前,大模型竞争异常激烈,模型公司的认知是否走到前面、迭代速度是否足够快,这是非常重要的,甚至是成败攸关的。对我们而言,参数大小只是具体的技术选择,更重要的,是在我们认定的方向上走得足够快,让自身的认知走在前列。
具体来说,模型采用多大的参数规模,取决于技术路径的成熟度。对于前沿探索,如果技术路径还没有得到充分验证,过早采用很大的参数规模,反而会拖慢迭代速度;当路径逐渐成熟时,就要通过Scale Up(扩大模型规模)探索能力上限。因此,我们的多模态智能体模型已经进入Scale Up阶段,但理解与生成统一在架构和训练范式上,仍有一系列问题需要探索。
商汤小浣熊
36氪:你刚才提到,Coding的能力积累跨过一条线以后,大家突然觉得它真正好用了。对设计和空间智能来说,这条线分别是什么?
林达华:Coding并没有突然比过去强几个数量级,只是能力积累到了一个阶段,大家开始觉得它真的好用了。
设计的拐点已经不远。模型的可控性和视觉质量不断提高,下一步是进入真实工作流,比如直接生成能够在Figma等工具里继续使用的内容。从好看到好用,很多问题靠更好的数据和产品功能就能解决。我觉得可以按月来计算。
空间和视觉推理的拐点会来得更晚,影响也会更深。没有具备空间智能的大脑,机器人只能在固定场景里完成固定动作,很难在复杂物理空间中独立完成长程任务。
36氪:当前,生图和视频的调用价格持续下降,但专业客户场景更看重最终交付的质量。你认为多模态会走向价格战吗?
林达华:如果大家处在同一个能力水平,用户当然会选择更便宜的模型。但只围绕Token竞争,利润会被压得很低,模型最后真会变成水电煤。
我认同人工智能会成为水电煤,但水电煤不是这个时代最赚钱的行业。真正有价值的部分,还是你最后替用户解决了什么问题。
律师不是按判决书字数收费,医生也不是按病历字数收费。把官司打赢、把病治好,用户才愿意为结果付费。智能不是论斤卖的,Token只是一种计量单位,最终要看你解决的问题值不值钱。
未来可以按任务、按最终交付收费,也可以由人工智能和客户共同完成工作,再对结果分成。用户不关心模型消耗了1M还是100M Tokens,只关心事情有没有做成。
36氪:Coding率先跑出商业回报后,一些多模态方向的研究者自称“CV(计算机视觉)难民”。你怎么看这种方向焦虑?
林达华:我能理解。Coding热,人才价格自然更高,大家都会受到影响。但不同方向跑通商业化,本来就有先有后。
2022年以前,自然语言处理也没有今天这样的商业价值。那时做智能客服很苦,需要大量定制,有人反而觉得不如回去做计算机视觉,因为人脸识别等场景至少已经能够有规模化商用。今天只是Coding先走到了一个商业前景非常明确的位置。
这有点像买股票。现在Coding是涨得最快的一只,但不代表每个人都要把所有资金,甚至把人生都押在上面。人工智能改变的不会只有Coding,每个人还是要根据自己的积累和判断,选择真正相信的东西。
当然,选择多模态也不能重复过去的路线。坦率地说,传统VLM(视觉语言模型)的基本范式已经走到尽头了。如果今天谈多模态,仍然只是做VQA(视觉问答)、回答图片里有什么,无论技术价值还是商业价值都不会很大。
36氪:你会鼓励更多公司投入原生多模态吗?
林达华:我更想说,大家应该对多模态的长期前景保持信心。很多行业对视觉能力的需求是刚性的。多模态不是伪需求,但要问对问题,不能继续停留在简单的视觉问答上。
至于每家公司和每个从业者选择Coding还是多模态,并没有天然的优劣之分。重要的是根据自己的积累和判断,选择真正相信的方向,而不是简单跟风。
36氪:未来一两年,多模态会迎来一个类似Code Agent爆发的关键节点吗?
林达华:现阶段,Coding的意义超越了Coding本身。它让大家看到,人工智能真的能够做事情、创造商业价值,而不只是写诗作画。这给整个行业提供了很大的信心。
我觉得未来1—2年,多模态也会跨过类似的节点。它最终呈现的形态可能和今天的产品不一样,未必只是一个生图或视频工具,但内核仍然是视觉、语言、推理和行动的结合。
随着数据和应用不断成熟,多模态会迎来能力涌现的时刻。我们当然希望商汤能率先走到这一步。















