对话人大高瓴团队:多模态大模型的信息涌现如何产生与落地 这两年讨论多模态大模型绕不开一个词信息涌现。大家都在说模型规模大了、数据多了、训练久了就会自动长出一些意料之外的能力。可它到底在模型的哪个环节长出来、为什么长出来、用什么方法能让它稳定出现能说清楚的人其实不多。这次我和人大高瓴的Gestalt团队约了一下午专门聊这个话题。他们主攻的方向就是“视觉语言”的深层融合目标是做真正意义上的多模态智能而不是更好的看图说话。这篇内容是我把当天对话整理出来的技术复盘和思考沉淀涵盖了他们对架构、训练、评测的解读也结合我自己做AI应用时的实操经验把一些可以直接落地的思路一并写出来。适合正在做算法研究、AI应用开发或者正准备在多模态方向做技术选型的人参考。1. 为什么叫“Gestalt”整体大于部分之和不是口号1.1 从格式塔心理学到多模态建模的迁移逻辑Gestalt这个词学心理学的都不陌生。格式塔心理学最核心的一句话是整体大于部分之和。人类的知觉不是把颜色、线条、形状一个个单独识别之后再拼起来而是先有一个整体的组织感。比如你看一张人脸不会先分析眼睛、鼻子、嘴再判断“这是一个人”而是一眼就知道“这是一张脸”。这个整体性的感知能力是格式塔学派眼里人类认知最本质的特征。把这个概念迁移到多模态智能上其实是在挑战目前大多数模型的基本范式。现在很多视觉语言模型本质上还是“视觉编码器语言模型”的组装方案图片被切块编码成token序列然后拼在文本token前面一起喂给Transformer。好处是工程上简单、训练链路成熟、跑起来稳定坏处也很明显视觉信息和语言信息只在很浅的层面上交互模型大多数时候是在“看图说话”而不是真正“理解图”。团队的原话我印象很深“如果只把图片当作文本的前缀那你训练出来的就不是多模态智能而是带眼睛的语言模型。”这句话听起来有点扎心但确实说中了很多项目的痛点。我自己之前做图文问答系统时也有同样的感觉模型对图片里的物体识别得很准可一旦遇到需要结合背景知识推理的问题输出就漏洞百出。后来我才想明白问题不在识别模块的精度而在于视觉和语言两条信息通道根本没有在深层语义空间里真正融合。1.2 “视觉语言”不等于“图片文本”三种融合方式的取舍这里藏着一个关键的设计决策视觉和语言到底在哪里融合。行业里大致有三种做法各有各的优缺点。第一种是输入层拼接。图片token排在前面文本token排在后面一路送到Transformer里做自注意力。这是最省事的方案工程改动小训练速度快但交互深度最浅。模型的每一层都在同时处理两种模态本质上却仍是把视觉信息当作“外挂”的上下文来用这也是“带眼睛的语言模型”说法的来源。第二种是交叉注意力融合。在每一层Transformer里额外插入交叉注意力模块让视觉特征和语言特征在每一层都能互相“看到”。这种方案计算量明显上去了但模态之间的交互确实充分了很多模型在执行细粒度视觉问答时表现会好一个档次。第三种是统一语义空间。团队探索的方向更接近这种思路把视觉特征和语言特征映射到一个共享的推理空间里让“看”的行为和“说”的行为走同一条认知链路。好处是跨模态的迁移和推理能力会显著增强模型能够利用语言世界里的逻辑关系去反推视觉上的因果。融合方式交互深度计算成本典型效果输入层拼接浅层低看图说话识别为主交叉注意力中层中高细粒度问答部分跨模态推理统一语义空间深层高跨模态迁移多步因果推理我拿生活场景打了个比方。输入层拼接像两个人合租一套房各自有卧室和卫生间只是共用一条走廊交叉注意力像情侣同居客厅和厨房共用但还各留私人空间统一语义空间像结婚后共同经营一个家庭日常决策都是“一起做”的。三种模式没有绝对的好坏取决于你要的到底是什么——是快速上线一个能识别物体的产品还是做一个能理解世界并执行任务的智能体。1.3 他们怎么定义“信息涌现”我问了一个比较直接的问题你们说的信息涌现到底可不可以被测量团队的回答是可以但要用对方法。在他们看来信息涌现不是玄学它的典型表现是模型在某个能力维度上出现“突变式的提升”。比如一个模型在图文数据上训练到某个阶段之后突然能理解因果关系——看到一个人举着伞就能推断出外面大概率在下雨并且能用语言解释这个推理过程。这种能力在训练早期是完全不存在的可一旦越过临界点它就稳定出现而且不会因为后续继续训练而消失。这种涌现能力的核心特征是它不来自某一条具体的训练数据而是来自大量不同模态数据在深层语义空间里的互相印证。用他们的话说模型不是“记住了某条知识”而是“长出了某种组织知识的方式”。这也是为什么他们建议评估一个多模态模型时传统榜单的分数参考意义有限更要看反事实推理、跨模态迁移、多步推理这类“非直接训练目标”的能力。2. 架构与训练一个可复用的多模态认知框架2.1 数据配比任务意图的多样性比总量更重要聊到训练数据团队给了一个很实在的判断给模型喂多少亿图文对不如让模型见多少种“任务意图”。什么是任务意图同一张图片可以有完全不同的问法。可以问“你看到了什么”可以问“图里有几辆车”可以问“这张图可能出现在什么场景”还可以问“如果把曝光调低一档画面会有什么变化”。这些问法代表了不同的认知层次。如果只喂大量“图片-描述”的配对数据模型学到的是统计映射看到某种像素分布输出某种文本模式。但如果喂的是大量不同意图的任务模型就被迫对同一份视觉输入做不同层次的加工。他们管这个叫“认知压力”没有这种压力模型就没有动力去构建更深层的语义结构。在实践层面他们会刻意控制数据配比。视觉特征明显的通用描述数据大概占四成细粒度的视觉问答占三成需要推理的图文推理任务占两成剩下的一成留给纯文本数据用来保持语言能力不退化。这个比例不是标准答案但它背后的逻辑值得记下来纯视觉任务和纯语言任务都不能占满必须给中间的推理任务留出足够空间。推理任务才是让信息涌现出现的催化剂。2.2 训练策略渐进式融合与防止模态坍塌具体训练方式上团队推荐的是两阶段渐进式策略。第一阶段把视觉编码器和语言模型分开初始化用一个较浅的适配模块把两种特征先放进同一个向量空间训练时只更新这个适配模块其他参数全部冻结。这样做的目的是先让两边的特征分布建立起“共同语言”互相知道对方的表达习惯然后再谈深度融合。如果一上来就做全量端到端训练视觉和语言的分布差异太大会导致梯度互相干扰损失曲线容易剧烈震荡。第二阶段会解冻部分高层的视觉编码器和低层的语言模型用较小的学习率做端到端微调。这里有个非常关键的细节学习率要分块设置。视觉编码器用最小的学习率语言模型用中等的新初始化的融合模块用最大的。原因是预训练模型的原始特征不能冲得太狠而融合模块是一个“新兵”需要更多学习空间。我自己在实际训练里试过这个策略对比起全程统一学习率损失的收敛平稳度明显更好最终评测分数也高出几个点。团队还特别提醒了“模态坍塌”这个隐患。模态坍塌是多模态训练里很典型的病训练到某个阶段视觉编码器的梯度贡献变得特别小模型开始直接忽略视觉输入退化成一个纯语言模型。表面上看评测分数还在涨但涨的是语言部分的能力视觉部分已经“失活”了。应对的方法很朴素训练过程中定期检查注意力分布算一下视觉token拿到的平均注意力权重如果发现这个权重持续走低就要马上调整训练策略比如调高视觉相关的loss权重或者重新加入更多视觉导向的训练数据。这个检查方法我自己后来在用与其等整个模型训练完才发现“它根本不看图”不如在训练中途就盯住注意力分布的变化曲线。2.3 评测的盲点传统榜单在骗你评测体系是这次对话里聊得最热烈的一个部分。团队直言现有的很多公开榜单已经不太能反映模型真实的多模态理解能力。原因有两个。第一公开榜单的数据容易被污染。训练语料里如果包含了评测集的相似样本分数就虚高。这在图文领域尤其突出因为图片的“相似”很难用文本查重来发现。第二很多榜单考的是“记忆型知识”问一个物体的颜色、数一数图里的物体数量模型靠视觉编码器就能答对根本不需要跨模态推理。他们建议用三类评测来补盲点。第一类是反事实推理比如问“如果画面里没有那个箭头这个人会往哪边走”。这类问题要求模型理解箭头作为“符号”的功能而不是单纯识别一个箭头的形状。第二类是跨模态迁移比如给模型看一张中文报纸的照片让它判断版面主题。模型需要先通过视觉把文字内容识别出来再映射到语言知识库里做主题判断。第三类是多步推理比如给一组连续动作的图片序列让模型推断整个过程发生了什么并预测下一步动作。这考验的是模型能不能把视觉时间线变成一条因果链。这三类评测有一个共同特点它们的组合方式都是模型在训练数据里没有直接见过的。只有这种“未见过的组合能力”才配叫信息涌现。我回去之后把这套思路用在内部模型评测上发现一个之前被榜单分数掩盖的问题模型的基础视觉识别能力很强但只要涉及隐性语义推断得分立刻掉到及格线以下。榜单分数确实会骗人用对评测方法才能真正看清模型的能力边界。3. 从模型到智能体多模态只是起点3.1 模态对齐只是表层关键是意图对齐聊到落地应用话题自然转向了AI智能体。2026年这波多模态大模型的热度很大程度是被智能体应用带起来的。大家已经不满足于让模型“看懂一张图”而是想让模型“看懂真实世界并完成具体任务”。团队提出了一个让我印象很深的观点多模态智能的终极目标不是对齐模态而是对齐意图。所谓对齐模态是让模型知道“这张图片对应的文字描述是什么”而对齐意图是让模型理解“用户到底要我完成一个什么目标”。我拿一个很常见的场景举例子员工拍了一张表格照片上传说“帮我把表里的数据提取出来并做成图表”。表面上看模型需要OCR识别、还需要一个生成图表的工具但本质上它需要理解的是用户意图是“把数据变成可视化报告”而不是“识别这张表格里的文字”。如果意图对齐做得不到位模型就会老老实实地OCR出一堆文字完全不会想到去调用做图表的工具。这类问题在现在的很多多模态系统里非常普遍模型的感知能力很强工具也不缺缺的是把感知结果和用户意图连接起来的那一层推理。3.2 多模态智能体应用案例从文档理解到动态决策他们分享了几个自己做过的实验性应用案例我认为很有参考价值。第一个是文档理解助手。输入是一份扫描合同加一条语音指令“找出违约金最高的条款并解释为什么。”整个任务过程模型要同时完成OCR识别、条款语义比较、金额数值推理、以及用自然语言组织答案。这完全不是单模态能搞定的任务也不是简单的多模态拼接能解决的——它需要视觉把文字提取出来语言去理解条款含义再结合数值逻辑做比较最后还要组织成人类能自然读懂的答案。第二个是物理世界操作场景。让智能体看一段燃气灶的火力视频然后判断“哪个旋钮控制哪个灶眼”。模型要把视频里的空间位置和物理功能绑定起来形成“左上角旋钮控制左前方灶眼”这类空间-功能映射再交给机械臂执行旋转操作。到了这一步多模态已经不是文本和图片的融合了而是视觉和物理常识的融合。模型需要理解的不只是画面内容还包括“旋钮旋转会改变燃气流量最终影响火力大小”这样的物理因果链。第三个是端到端数据处理场景。让模型看一个在线大屏的实时折线图当用户问“这个趋势什么时候会出现拐点”模型不能只读图还要结合外部的时序预测工具结果再综合判断给出一个时间范围。这需要模型具备“读图调用工具综合推理”的完整链路能力。团队说这种任务才是多模态智能体真正施展拳脚的地方因为它的每一步都需要在感知和推理之间来回切换。这三个案例的共同点是视觉语言只是入口信息涌现发生在模型把感知结果转化为可执行决策的那一步。这也是为什么他们坚持认为多模态模型和智能体不是两个分开的研究方向而是同一个能力链条上的不同环节。3.3 2026年多模态智能的几个趋势判断聊到2026年的最新进展团队给了四个判断我觉得很值得记下来。第一评测会从“答对”走向“做对”。学术圈和工业界都会越来越关注模型在真实任务里的完成度而不是公开数据集上的分数。这对应用开发者来说是个好消息以后选型的时候可以直接用业务场景去测试模型的实际表现而不是被刷榜的模型名字迷惑。第二强化学习会渗透到感知层面。现在的RLHF主要用于对齐文本输出下一步会被用在视觉定位、工具选择、多步决策上。尤其是当模型需要自己决定“调用哪个工具”“先看哪个区域”时强化学习比纯监督训练更适合训练这类决策能力。第三统一多模态模型和专用小模型会长期并存。大模型负责复杂推理小模型负责高频感知中间通过一个路由层协作。这个观点我完全认同因为成本和性能的平衡在真实工业化场景里永远是最现实的约束。第四数据工程仍然是最深的护城河。真正的创新不是多改几个transformer模块而是想清楚“模型需要见识哪些认知冲突”再针对性地构造数据。这个判断听起来有点反直觉——2026年了大家还在聊数据工程但仔细想想模型架构大家都在抄训练框架也都差不多最后拉开差距的还真的就在数据处理的深度上。4. 实操中的坑能避就避4.1 灾难性遗忘微调多模态后语言能力退化这正好是我最近自己踩过的坑。用多模态数据微调一个通用大模型之后视觉问答的能力是上去了但让它写一段正常的业务邮件它开始词不达意。这就是典型的灾难性遗忘。团队的建议很落地。第一微调数据里始终混入10%到20%的高质量通用语料不要全用多模态数据。第二优先使用LoRA这类参数高效微调方法冻结大部分主体参数只训练低秩适配矩阵。第三每个训练阶段结束后跑一份固定的纯语言评测集随时盯着语言能力曲线的下降幅度。如果发现下降超过10%就说明多模态数据和通用语料的比例失衡了要马上调整。这个建议听着基础但很多团队真的会忽略。尤其是赶项目进度的阶段只要看到多模态评测分数涨了就觉得万事大吉结果整个模型变成了一个瘸腿的巨人。我现在每次微调前都会先在内部建一个“语言能力回归基线”把所有后续实验的结果跟这个基线比。这个习惯补上之后我再也没有被灾难性遗忘问题偷袭过。4.2 多模态幻觉不说不知道也别胡说多模态模型比纯文本模型更容易产生幻觉原因很直接视觉输入天然带噪声模型会把“可能看到”当成“确实看到”。我见过最离谱的例子是模型对着一张没有行人的街景图片信誓旦旦地说“一个穿红衣服的人正在横穿马路”。团队给的组合方案很实用。第一在数据层面引入负样本故意给模型看“图A描述B”的错配样本让它学会拒绝回答“看图不对题”的问题。第二在解码层面给模型一个输出“不确定”的选项在答案空间里加一个“我不知道”的通道。这个做法比强迫模型硬猜要好得多。第三在评测层面增加人工抽检每100条多模态问答里抽10条做事实性检查持续跟踪幻觉率的变化。负样本这个思路我此前完全没想到试了之后效果出乎意料地好。模型学会“承认不知道”之后整体回答的可靠性反而提升了用户反而更信任它。这里可以补一句模型自信地胡说比模型承认不会对业务的杀伤力大得多。4.3 数据工程的日常重复、错位、污染多模态的数据工程坑比纯文本多得多。团队提到了三类高频问题。第一是图片重复。同一张图片经过裁剪、压缩、加滤镜之后感知哈希基本一致但会反复出现在训练集里这会放大某些特征的权重。处理方法是先做感知哈希去重再做embedding相似度过滤双重保险。第二是图文错位。爬来的数据里图片和描述经常对不上。解决思路是用一个训练好的CLIP模型强行过滤一轮图片和文本的相似度低于某个阈值就直接丢掉。这招简单粗暴但能过滤掉相当大比例的噪声数据。第三是语料污染。评测集数据混进训练集是公开数据集的经典问题。团队的处理方式是训练之前把所有评测样本和训练样本做embedding检索相似度超过0.8的全部剔除。这个方法很笨但确实有效。我在自己的数据处理pipeline里把这套流程固化下来了每次新数据进来都要跑一遍虽然费时间但能避免后期评测时的巨大尴尬。说到这我想插一句模型的上限拼的真的不只是网络结构和算力数据工程的深度才是拉开差距的隐性变量。架构大家都能抄数据清洗的功夫才是真正的差距所在。5. 对话后的个人体会重新定义“看懂”这次对话对我冲击最大的一句话是团队在快结束时说的“不要问模型看懂了没有要问它因为看到了什么而决定做什么。”这句话值得反复琢磨。过去我评测多模态模型习惯性地会问它“识别得准不准”“描述得全不全”这些都是输入侧的指标。但真正重要的是模型把视觉信息转化成了什么行动输出——是回答一个问题、调用一个工具、还是控制一个机械臂执行动作。我后来给自己定了一个新的评测习惯每个多模态任务不但看模型输出的答案还要看它有没有产生正确的“后续动作”。这个习惯让我发现了好几个之前被忽略的模型弱点。如果你现在也在做多模态相关的事情我有几个小建议算是这次对话的副产品。第一选模型时别迷信榜单上那些名字用你实际业务里的十个问题去测试看它的做对率而不是答对率。第二训练自定义模型时盯紧注意力分布视觉token失活比loss不下降更危险。第三评估能力时至少加入一类反事实推理问题即使是最简单的也能让模型的真实水平“露出原型”。第四做多模态智能体的话越早想清楚意图对齐越好。技术细节可以后面补但方向错了后面全是返工。这次和Gestalt团队聊完我对“视觉语言”这个方向的信心更足了但不是那种打了鸡血的兴奋更像一种“终于有人把问题问对了”的踏实感。多模态智能的未来不取决于我们把多少种模态堆在一起而取决于我们能不能找到那个让信息涌现出来的统一组织方式。这条路当然还长但至少方向已经很清楚了。