理解与生成,到底是队友还是对手? 要闻速递
你有没有想过一个问题:一个既会看图说话、又会照着描述画图的AI,这两种能力放在同一个大脑里,到底是互相帮忙,还是互相拖后腿?
这个问题听起来像是常识题。直觉上,理解和生成肯定是相辅相成的,毕竟人类学画画的时候,观察能力和动手能力也是一起进步的。但现实要复杂得多。过去两年里,各大实验室推出的统一多模态模型层出不穷,它们确实能在同一个模型里既回答"这张图里有什么",又能画出"一只戴帽子的猫"。可是没有人能说清楚,这两种能力凑在一起之后,究竟是真的产生了化学反应,还是仅仅像两个室友,各过各的日子,谁也没帮上谁。
来自南洋理工大学S-Lab和商汤研究院的团队决定把这个问题彻底搞清楚。他们没有满足于"我们的模型两个都会"这种展示性的结论,而是设计了一整套控制实验,从模型内部的表征层面,到具体任务层面,再到整个系统层面,层层剥开,看看理解和生成之间到底发生了什么。
(相关资料图)
统一多模态模型:一场表面团结、内里各怀心思的联姻
统一多模态模型
指的是能在同一个模型里既做视觉理解(看图回答问题、图文对话)又做视觉生成(根据文字画图、改图)的AI系统。市面上已经有不少代表作,比如Chameleon、Transfusion、Show-o等等。
这些模型的卖点很清楚:能在一个连续的对话里穿插文字和图片,既能推理又能画图,甚至能一边生成图像一边用图像本身来辅助思考。这在只会理解或只会生成的传统模型上是做不到的。
问题是,这种"功能上的统一"并不等于"能力上的协同"。研究团队打了个比方,理解和生成的关系可能有三种:互相促进、互相竞争资源、或者压根没什么关系,只是被塞进了同一套参数里凑合过日子。现有的很多统一模型,证据其实是相互矛盾的,有的论文说理解帮助了生成,有的说两者互相拖累,谁也没有把这件事在一个干净的实验环境里彻底讲清楚。
为了排除干扰因素,研究团队选择了一种叫做原生(native)的建模方式。
原生视觉接口
指的是图像直接以像素形式进入和输出模型,不借助预训练好的视觉编码器(比如CLIP),生成图像时也不依赖图像分词器或VAE(一种把图像压缩成隐向量再还原的技术)。
这么做的理由很实际:如果用了预训练好的视觉编码器,那你观察到的所有效果,可能根本不是理解和生成互相作用的结果,而是这个预训练编码器自带的视觉先验在起作用。想干净地看清楚两个目标之间的关系,就得把这些外部影响先清除掉。这就好比你想测试两个人合作做菜的默契程度,结果厨房里还站着一位大厨随时帮忙调味,那你测出来的根本不是这两人的默契,而是大厨的水平。
模型的骨架建立在Qwen3-1.7B这个预训练语言模型上,文本部分依然按照从左到右一个字一个字生成的方式(自回归)来处理,而图像部分则用了流匹配(一种类似扩散模型的生成技术,通过逐步去噪声来生成图像)。这个组合目前在业内被认为是效果和效率都不错的方案。
架构之争:谁跟谁共享参数,决定了谁会被谁压制
第一个关键实验发生在表征层面,研究团队比较了三种不同的架构设计,看看当理解和生成的视觉token(模型处理信息的基本单位,可以理解为图像被切成的小块)走不同的计算路径时,会发生什么。
第一种叫密集共享(Dense Sharing)。这是最直接的做法,文本、用于理解的干净图像token、用于生成的带噪声图像token,全都塞进同一套语言模型的层里跑。这种设计的参数共享程度最高。
结果出人意料。联合训练确实让理解能力变好了,尤其是在视觉中心和空间智能类的题目上表现更强。但生成能力却明显变差了,各项生成指标全面落后于只训练生成的版本。
为了搞清楚为什么理解变好了,研究团队做了一系列探针实验(一种冻结主干网络,只训练一个小的分类头去测试网络内部特征质量的方法),分别测试了图像分类、语义分割(给图片每个像素打标签)、单目深度估计(从一张图猜出物体的远近)三种任务。结果显示,联合训练之后的视觉特征在语义连贯性和空间结构上都变得更清晰了,PCA可视化图(把高维特征降维到三维用颜色展示)里也能看出物体轮廓更完整。
这其实呼应了近期一些研究的发现,生成任务的训练能学到很强的通用视觉表征,这不是巧合。你去猜测一张图接下来该长什么样、该怎么补全,其实逼着模型必须理解物体的形状、纹理和空间关系,这个过程本身就是一种深度的视觉学习。
但问题也出在这里:既然生成能反哺理解,为什么生成本身却变差了?
研究团队给出的解释是,预训练语言模型自带一套很强的语义先验,一旦理解和生成挤在同一条计算路径里,理解会天然占据主导地位,把生成压成一个"辅助正则项",也就是说生成的存在只是帮理解学得更好,它自己的能力反而被牺牲掉了。
这就像一间只有一张办公桌的办公室,一个是资历深、话语权大的老员工(理解,站在预训练语言模型的肩膀上),一个是刚入职的新人(生成,很多时候是从零训练的)。哪怕两人名义上共用一张桌子办公,实际决策权还是掌握在老员工手里,新人的想法很难真正落地,只能作为参考意见被采纳一部分。如果不做任何区隔,老员工的强势地位会一直持续下去,新人永远长不大。
第二种架构叫模态解耦MoT(Mixture of Transformers,一种按数据类型分流的混合架构)。
这一次文本依然走预训练好的语言分支,但所有视觉token,不管是理解用的还是生成用的,全部被扔进一个从零训练的独立视觉分支,两个分支之间依然保持全局注意力(模型内部让不同位置的信息互相"看到"对方的机制)。
结果彻底反转了。联合训练让生成效果显著超过只训练生成的版本,理解能力却反而下降了,尤其是在需要强视觉文本对齐的通用类和OCR类题目上掉分明显。
这一次轮到生成占据主导,理解变成了辅助角色。研究团队进一步用CKA(一种测量两组神经网络特征之间相似度的方法)来量化文本特征和生成图像特征的对齐程度,发现联合训练后的文本图像对齐分数明显更高。这说明理解监督信号确实帮生成的内部表征和语言语义贴得更近了,只不过代价是理解能力被生成"反噬"了。
两种架构呈现出完全相反的失衡方向,这恰恰说明冲突不是理解和生成天生注定的,而是架构设计的选择造成的偏袒。
于是研究团队设计了第三种方案,叫任务解耦MoT。
任务解耦MoT
指的是把理解用的干净图像token和文本一起留在预训练语言分支里,而把生成用的带噪声图像token分配给一个专门为生成任务准备的独立分支。两边通过共享的注意力机制保持"软对齐",也就是说它们各自专注自己的活儿,但仍然能互相"看到"对方处理的内容,尤其在图像编辑场景里,理解分支处理的原图会作为条件信息传给生成分支。
为了进一步加强两个分支之间的联系,团队还额外加入了20%的图像重建任务,做法是把文本生成图像的数据拿来做图像编辑训练,把原图一半的视觉token随机遮住,让模型学着补全。
这个设计的效果如何?表格数据显示,任务解耦MoT在理解和生成的各项指标上都拿到了相对均衡且优秀的成绩,理解方面General类达到69.02,OCR类72.09,视觉中心和空间智能类62.38,全面超过密集共享方案;生成方面GenEval2达到63.96,DPG达到82.31,接近甚至超过模态解耦MoT的最佳表现,而且没有出现此前两种方案里那种此消彼长的失衡。
这就好比公司终于意识到,与其让新老员工挤在一张桌子上抢话语权,不如给他们各自配一张桌子,但把桌子摆在同一个房间里,方便随时沟通协作。专业分工加上保留沟通渠道,比强行绑在一起或者彻底隔离都更有效。
架构层面这套实验最重要的发现是:理解和生成本身确实能给对方提供有用的学习信号,但这个信号能不能真正转化成双赢,完全取决于架构怎么设计。 这也成了后续所有实验的默认基座模型。
任务层面:知识重叠的地方,才会真的互相帮忙
搞清楚架构问题之后,研究团队把目光转向了更具体的任务场景,他们想验证一个假设:当理解任务和生成任务背后依赖的是同一套知识和能力时,联合训练能不能带来真正的双向提升?
他们选了三个案例来验证这个想法,几何推理、矢量图形(SVG)、三维空间智能。
案例一,几何解题。做几何题需要从图里识别出点、线、角以及它们之间的约束关系,而画一张符合要求的几何图,需要构造出满足同样结构的视觉内容。两者共享的知识基础显而易见。
研究团队构建了一个包含96.5万条几何解题和通用数学推理数据的理解数据集,配上文本生成图像和几何图编辑的数据集。对比结果很清楚:加入生成目标之后,理解模型在Geometry3K、PGPS9K这两个几何测试集上的分数都提升了,甚至在MathVerse和MathVista这两个通用数学推理测试集上也有明显进步。
更有意思的是对照实验。研究团队把同样的生成数据换了一种呈现方式,不让模型学"画图",而是让模型学"描述这张图长什么样"(文字化描述任务),结果发现效果提升幅度明显更小,也更不稳定。这说明真正起作用的不是"多喂了一些几何数据"这么简单,而是"学会画图"这个动作本身对几何推理能力的锻炼效果,比单纯学"描述图片"更深入。
这就像学开车,你光是看别人描述"方向盘往左打三十度,车头就会往左偏",和你自己亲手摸方向盘、真实感受车身反馈,两种学习方式带来的肌肉记忆完全不是一个量级的。生成任务逼着模型真正在"脑子里"构建出几何结构,这种主动建构比被动描述留下的印记要深得多。
案例二,SVG理解和生成。
SVG*(可缩放矢量图形)
是一种用代码描述图形的格式,比如画一个圆、一条线,这些指令写成代码之后,浏览器或渲染器就能把它变成实际看到的图片。这个领域天然具备双向属性:同一个图标既可以是一张渲染出来的图片,也可以是一段可执行的矢量代码。
理解方向是给模型一张渲染好的图标,让它输出对应的SVG代码;生成方向反过来,给模型SVG代码,让它直接渲染出图片。表面上看输出形式完全不同,但两者背后依赖的是同一套潜在场景结构和渲染逻辑。
联合训练的结果显示,理解和生成的分数都比单独训练时更高,理解方向从80.64提升到81.70,生成方向更是从80.21跳到86.52,涨幅相当明显。这说明这两个任务分享的不只是通用的图文语义,而是关于"矢量操作如何映射成视觉结果"这套更深层的执行逻辑。
研究团队还专门设计了一个诊断实验,来验证模型是不是真的学会了"脑内渲染"SVG代码。他们构建了一个盲测VQA基准(模型只看代码,不看渲染图,回答关于图片外观的选择题),题目故意设计得不能靠表面读标签就能蒙对答案,必须真正在脑子里"跑一遍"路径渲染、几何变换、分组、图层叠加这些操作才能推出正确答案。结果联合训练的模型准确率达到58.54%,明显高于只训练理解(52.18%)或只训练生成(49.41%)的版本。
另一个诊断更直观:观察模型生成图像时第一步去噪之后的预览效果。联合训练的模型在第一步就能勾勒出更清晰的轮廓和布局,说明它更早地在心里形成了整体的视觉方案。
案例三,三维空间智能。
这个案例比前两个更宽泛,因为三维空间智能几乎是所有具身智能体(能在真实或虚拟环境里行动的AI)和交互式世界建模的基础能力。研究团队设计了四类生成任务:自我运动转换(给一张图和一串相机运动指令,预测运动后看到的画面)、多视角重建(给物体的两个视角,推断第三个视角)、视图序列补全(给一段视频的首尾帧,补全中间缺失的帧)、以及布局到图像生成(根据三维物体的位置尺寸描述,生成对应场景图)。
理解方向覆盖了单图、多图、视频形式的三维视觉问答,涉及空间关系、视角推理、深度、相机运动等内容。
结果在九个三维空间智能测试基准里,联合训练在其中八个上都超过了只训练理解的版本,平均分从57.15提升到59.01。生成方向也同样受益,自我运动转换任务的视角误差和取景误差都降低了,视图序列补全的PSNR、SSIM、LPIPS三项图像质量指标全面改善。
三个案例呈现出高度一致的规律:只要理解和生成任务背后依赖同一套知识或能力,联合训练就能产生真正的双向促进。 这不是巧合,而是给了一个明确的信号,未来如果想让统一模型发挥更大价值,选对任务组合比盲目堆数据更重要。研究团队甚至提到了一个更大胆的延伸方向,世界建模和策略学习,理解当前状态、预测未来观测、生成具体动作,这三件事背后其实是同一套关于物理世界如何运转的知识,如果把这套思路用到具身智能领域,想象空间会更大。
系统层面:一体化模型和"流水线",谁更懂复杂任务
前面两部分讨论的都还是相对单一的任务,但现实世界里更常见的场景是理解和生成必须紧密咬合、来回配合才能完成一件事。研究团队选择了一个很有代表性的复杂任务:推理密集型图像编辑。
给模型一张原图和一句模糊的编辑请求,比如"让这张照片看起来更有秋天的感觉",模型必须先理解原图内容和用户意图,推理出具体该怎么改,然后才能真正动手生成修改后的图像。这个任务天然可以用两种方式实现:要么一个模型端到端全包了,要么拆成两步,一个负责理解和规划的模型先想清楚具体要做什么修改,再交给一个专门负责执行的生成模型去动手。
为了公平比较,研究团队用同一个任务解耦MoT基座模型,把同一批训练数据整理成三种格式:一种是端到端格式,模型看到原图和模糊指令,自己推理出具体编辑方案,再直接生成结果图;一种是规划器格式,模型只负责把模糊指令转换成具体的编辑指令,不负责生成;还有一种是执行器格式,模型接收原图和具体编辑指令,只负责生成结果图。
规划器加执行器组合起来,就构成了一个流水线系统,和端到端系统做正面对比。
结果在RISEBench和KRIS-Bench两个基准上,端到端的统一模型全面胜出。RISEBench整体得分从流水线的16.66提升到18.88,KRIS-Bench从66.48提升到68.33。
这个结果背后的逻辑其实不难理解。当理解和生成必须紧密咬合、信息需要在两者之间反复流转的时候,把它们拆成两个独立模型意味着中间必须经过一次"翻译",规划模型把它的推理结果压缩成一句自然语言指令,传给执行模型。这个翻译过程天然会丢失信息,规划模型脑子里那些细微的、没有完全用语言表达出来的理解,执行模型是接收不到的。
这就像你请一位建筑师设计房子,如果建筑师和施工队是同一批人,施工过程中遇到任何细节问题,都能立刻回头调整设计方案,因为设计的直觉和施工的手感是连在一起的。但如果建筑师只是画完图纸就交给另一支完全不认识的施工队,施工队只能严格按照图纸上写的字面意思去做,任何图纸没有明确写出来但建筑师脑子里想过的细节,全都传达不到位。端到端模型保留了这种"设计和施工连在一起"的完整信息流,而流水线模型在两者之间硬生生插入了一道信息瓶颈。
三个层面的发现串起来看
把架构、任务、系统这三层实验放在一起看,会发现一条很清晰的逻辑线。
在表征层面,架构设计决定了理解和生成之间的信号能不能公平地互相传递,而不是被一方吃掉。
在任务层面,只有当两个任务真正共享底层知识的时候,联合训练才能带来实实在在的双向提升,如果任务之间毫无关联,硬凑在一起训练大概率什么好处都得不到。
在系统层面,当一个复杂任务要求理解和生成必须实时互动、信息不能有损耗地传递的时候,端到端的统一建模比拼接两个专门模型更有优势。
这三条结论合起来,其实回答了开头那个问题:统一多模态模型的价值,并不是简单地"把两个能力塞进一个模型"就能自动获得的。 它取决于你有没有做对架构设计,取决于你选的任务之间是不是真的有知识重叠,也取决于任务本身需不需要理解和生成紧密咬合。这三个条件缺一个,协同效应都可能变成空谈甚至变成负担。
写在后面
读完这篇论文,最让我意外的其实不是"理解和生成能互相帮助"这个结论本身,因为这多少符合直觉。真正让我停下来想了很久的,是密集共享架构和模态解耦架构呈现出的那种完全对称的反转,一个让理解赢生成输,另一个让生成赢理解输,而且输赢的原因高度一致,都是因为谁离预训练语言模型更近,谁就更容易占据主导权。
这其实揭示了一个在很多联合训练场景里都成立的规律:谁背靠的先验知识更强,谁就更容易在共享参数的博弈里获胜,而不是看谁的任务本身更"重要"。这个视角如果放到更大的多任务学习语境里,可能能解释很多"为什么联合训练效果不稳定"的困惑。这不只是多模态模型的问题,任何时候你把两个不同强度的先验塞进同一套参数,都可能重演这个剧本。
另一个让我反复琢磨的细节是SVG那个盲测VQA诊断实验。研究团队没有满足于"分数变高了"这种表层结论,而是想办法证明模型内部真的形成了某种"脑内渲染"能力。这种刨根问底的验证思路本身就值得学习,很多论文说"能力提升了",但很少有人愿意花力气去证明这个提升不是碰运气蒙对的,而是真的有个可解释的内部机制在支撑。
论文里也留了一个悬而未决的问题:这套结论是不是只在这种把文本自回归和图像流匹配结合起来的混合架构里成立?如果换成纯离散建模或者纯自回归的图像生成方式,理解和生成的博弈关系会不会完全变个样子?这个问题作者自己也承认还没有答案。
一个统一大脑里,两种能力到底是室友还是队友,答案原来一直取决于你怎么给它们分房间。
Q&A
Q1:统一多模态模型中理解和生成任务是互相帮助还是互相拖累?
A:研究发现两者关系取决于具体架构设计。密集共享架构下生成能提升理解能力但会拖累生成本身,模态解耦架构则相反。只有采用任务解耦架构,把理解和生成的冲突计算路径分开同时保留语义交互,才能让两者同时进步,不产生一方压制另一方的情况。
Q2:什么样的任务组合联合训练才能真正提升效果?
A:论文通过几何解题、SVG理解生成、三维空间智能三个案例证明,只有当理解任务和生成任务背后依赖同一套领域知识或能力时,联合训练才会带来双向提升。比如几何解题和几何图生成共享空间结构知识,效果明显好于把生成数据转成纯文字描述任务的对照组。
Q3:端到端统一模型和拆分的规划加执行流水线相比哪个更好?
A:在推理密集型图像编辑这类需要理解和生成紧密配合的复杂任务上,端到端统一模型表现更优。在RISEBench和KRIS-Bench两个基准测试中,端到端模型的得分都超过了先规划再执行的流水线组合,因为拆分成两个模型会在信息传递中造成损耗。








