
导读大模型的“记忆”正在从一个模糊概念变成模型架构中可以被系统设计、比较和评测的核心维度。过去我们常把 Transformer 的上下文窗口、KV Cache、检索增强、长期用户画像、智能体经验库都称为 memory但这些机制到底存了什么、何时更新、能保持多久往往混在一起讨论。来自清华大学、Bosch Center for AI 等机构的综述论文《Memory for Large Language Models》试图把这个问题重新放回模型架构层面它关注的是模型内部或推理动态中实际参与计算的记忆机制而不是单纯的外部智能体工程流水线。论文给出的主线很清晰大模型记忆可以沿三条正交轴组织。第一是表征形态即记忆是隐式地耦合在计算状态中还是显式地通过可寻址、可读写的存储接口存在第二是更新动态即记忆只在训练阶段形成还是能在推理过程中在线更新第三是持久性即记忆是局限于当前上下文的短期状态还是能跨上下文、跨会话长期保留。基于这三条轴论文进一步梳理了注意力、稀疏选择机制、循环状态空间模型、外部记忆模块、检索型存储、专家路由、多时间尺度更新、混合架构、效率管理与评测体系。对今天的大模型系统来说这篇综述的价值不只在“列举方法”而在于把长期上下文、检索增强、测试时训练、状态空间模型、混合模型与智能体记忆放到同一张设计图中比较。它提醒我们真正有用的记忆系统不是简单把上下文窗口做长也不是把所有历史都塞进数据库而是要在存储粒度、更新规则、读取接口、遗忘策略、计算成本和可控性之间做结构化权衡。引言记忆从副产物变成架构维度论文首先指出现代 LLM 的能力不再只由参数规模和训练语料决定模型如何保存、访问、更新和遗忘信息正在成为影响长上下文推理、持续学习、个性化交互和智能体行为的重要因素。在传统 Transformer 中记忆主要体现为前向计算过程中的临时状态例如当前上下文内的 KV Cache、隐藏状态或局部注意力窗口。这类机制确实能保留上下文信息但它们通常没有独立的读写接口也难以跨越长时间尺度进行稳定更新。随着长上下文模型、检索增强模型、状态空间模型、测试时训练、可写参数模块和智能体系统的发展记忆开始成为一等架构对象。模型不只是“看到更多 token”而是需要决定哪些信息值得保留、以何种形式保留、什么时候写入、如何读取、何时压缩或遗忘。论文把这种转变概括为从隐式、短暂、计算耦合的记忆走向显式、持久、可适配、可交互的记忆。这一区分非常关键。若把所有历史信息都视为记忆就会无法比较注意力窗口、向量数据库、MoE 路由和测试时更新之间的本质差异若只把外部数据库视为记忆又会忽略 KV Cache、循环状态、状态空间模型等在模型内部承担的记忆功能。本文因此选择一个折中且更架构化的视角关注模型级记忆机制即那些被实例化在模型架构、推理状态或模型内部更新过程中的存储与访问机制。记忆分类三个正交轴论文的核心贡献是提出一个三轴分类框架用来描述大模型记忆的设计空间。第一条轴是表征形态。隐式记忆是计算耦合的信息没有被放在一个独立的存储器里而是存在于注意力键值、隐藏状态、循环状态或状态空间变量中通过前向传播自然参与计算。显式记忆则具有更清楚的存储和访问语义例如外部数据存储、可查询键值表、专门的记忆模块、可写参数子空间或专家模块。显式记忆的重点不在它是否“在模型外部”而在于它是否具备相对独立、可控制的读写机制。第二条轴是更新动态。离线记忆只在训练阶段形成推理时保持固定例如普通预训练权重、训练好的 MoE 专家、部分静态检索表示。在线记忆则能在推理过程中被改变例如循环状态随序列更新、KV Cache 随上下文增长、测试时训练模块根据当前输入调整参数、长期记忆模块根据新事实或新经验写入内容。论文强调离线与在线回答的是“什么时候能更新”但还不能完整解释“如何更新”。因此论文进一步给出细粒度更新规则优化式写入通过梯度或显式目标更新记忆参数状态转移更新通过递推方程维护隐藏状态信号门控写入或路由根据惊讶度、不确定性、预测误差或效用信号决定是否写入准入、淘汰与合并规则决定哪些条目进入记忆、哪些被压缩或遗忘目标诱导或结构更新则通过训练目标、架构替换或离线构造塑造记忆行为。第三条轴是持久性。短期记忆通常受限于当前上下文窗口、缓存预算或推理片段保真度高但生命周期短典型代表是注意力 KV Cache。长期记忆则能跨越更长上下文甚至会话边界保存影响可以是压缩的循环状态、可查询的数据存储、长期参数化记忆模块或混合系统。论文特别强调长期并不必然意味着存得更多而往往意味着以更高压缩率、更强选择性和更明确的写入策略保留对未来仍有用的信息。这三条轴彼此正交。一个显式记忆系统可以是离线的也可以在线更新一个隐式记忆机制既可能是短期 KV Cache也可能是长期循环状态一个长期记忆既可能存在于外部可查询存储中也可能以可更新参数模块的形式嵌入模型内部。这样的分类避免了把“记忆”简化成单一技术路线。隐式记忆依附于计算动态论文第三部分讨论隐式记忆。隐式记忆的共同特征是它不提供独立的读写接口而是嵌入模型的前向计算。它的优点是天然端到端、访问路径短、与模型表示深度耦合缺点是可控性弱、持久性受架构约束、难以解释和稳定更新。最经典的隐式记忆来自注意力机制。Transformer 在每一步生成中把历史 token 映射为键和值查询向量再从这些历史状态中读取相关信息。KV Cache 因此可以被看作高保真、内容寻址的短期工作记忆。它保留粒度细适合局部引用、指代消解和上下文内推理但存储与计算成本随上下文增长而增长也容易出现“窗口变长但有效利用率不等比例提升”的问题。长上下文模型并不自动等于强记忆模型因为模型还必须学会在海量历史中真正访问和整合关键内容。稀疏、选择性和结构化注意力可以看作对隐式记忆访问路径的再设计。Sparse Transformer、Longformer、BigBird 等方法通过局部窗口、跨步连接或少量全局 token 降低全量注意力成本StreamingLLM 等方法尝试在无限流式输入中保留注意力锚点MoBA、NSA、RATTENTION 等工作则通过内容路由、块级访问或局部全局混合策略让模型在有限预算下选择更有价值的历史片段。这类方法本质上不是增加无限容量而是在固定或近似固定的记忆预算内改变“哪些过去状态可被访问”。循环序列记忆提供另一条路线。RNN、RWKV、Mamba、DeltaNet、线性注意力和状态空间模型都将历史压缩进固定或近似固定的状态中。相比显式保存每个 token 的 KV Cache循环状态更适合长序列和流式推理因为状态大小不随长度线性增长但压缩是不可逆的早期信息一旦被覆盖或混合后续很难精确恢复。论文把这类机制视为长期隐式记忆的重要代表它们可以拥有很长有效视野却往往牺牲细粒度可检索性和可编辑性。隐式记忆的主要局限在于控制接口缺失。模型很难明确指定“把这条信息写入长期记忆”“只在满足某个条件时读取”“过期后删除某类内容”。它的更新由前向计算、注意力模式或状态转移方程间接决定而不是由独立的记忆管理策略决定。因此隐式记忆很适合高吞吐、低延迟、端到端建模但面对持续学习、事实更新、用户长期偏好和可审计系统时往往需要与显式机制结合。显式记忆可寻址与可更新存储论文第四部分讨论显式记忆。显式记忆的核心是把存储与基础前向计算部分解耦让信息可以通过明确的接口被写入、检索、更新或路由。它不一定必须在模型外部也可以体现为模型内部的可写参数模块、专门记忆槽或条件激活子网络。第一类是参数化外部记忆模块。早期记忆增强神经网络和可微神经计算机已经探索过独立记忆矩阵近期的大模型工作则把这种思想扩展到更大规模例如 Titans、TTT-E2E、MEMORYLLM、LM2、In-Place TTT 等。它们通常让一部分参数或潜在槽承担可更新记忆的角色推理时根据输入进行快速适配而基础骨干保持相对稳定。这类方法的吸引力在于它既能保留预训练知识又能引入在线可塑性但风险是更新漂移、目标错配和长期稳定性不足。第二类是检索型记忆。kNN-LM、PlugLM、Engram、ExplicitLM 以及可编辑数据存储等方法将历史片段、事实、上下文表示或可解释条目放入可查询结构中。查询时模型根据当前上下文从存储中读取相关内容再用于预测或生成。这类机制的优点是容量大、可扩展、可更新、相对可审计也更容易与知识库和工具系统结合缺点是检索偏差、陈旧信息、召回失败、冗余累积和隐私治理会直接影响生成质量。第三类是条件参数记忆与专家路由。MoE 模型可以被理解为一种条件激活的参数记忆不同专家承载不同子分布、任务模式或知识片段路由器根据输入选择少数专家参与计算。Switch Transformer、Mixtral、DeepSeek-MoE 等模型展示了这种路线在规模化训练中的价值。与外部检索不同MoE 的“记忆”仍存放在参数中但通过稀疏激活和条件路由让参数访问更具选择性。问题在于路由可解释性、专家负载均衡、知识定位和错误路由仍是难点。第四类是多时间尺度与嵌套更新机制。不同信息的寿命并不相同局部上下文状态可能只需保留几个 token 或一个对话轮次用户偏好可能持续数周世界知识或任务技能则需要更稳定的长期更新。因此近期系统常把短期、中期和长期记忆分层管理让快速更新模块处理临时适配让慢速记忆承担稳定知识让路由或门控机制协调它们。论文认为这类设计是从“单一记忆容器”走向“记忆生态系统”的关键。显式记忆也带来新的系统风险。记忆一旦可写就必须处理错误写入、恶意注入、过度保留、隐私泄露、过期事实和不可逆污染记忆一旦可路由就必须解释何时访问、为何访问、访问了什么记忆一旦长期存在就必须具备遗忘、修正、压缩和审计能力。换言之显式记忆提升了模型的适应性也把数据库、学习系统和安全治理的问题带进了模型架构。系统设计混合架构、效率与评测论文第五部分把视角从单个机制推进到系统层面。现实中的强记忆模型通常不是单一路线而是混合架构注意力负责高保真的短期上下文循环或状态空间模块负责压缩长程动态外部检索负责大容量可查询知识参数化记忆模块负责任务或用户级适配路由机制负责在不同记忆路径之间分配计算。混合架构的核心问题是互补而不是堆叠。KV Cache 适合保存最近上下文但不适合无限扩展检索库容量大但存在召回和融合误差循环状态高效但压缩后可解释性弱参数化在线更新灵活但可能破坏稳定性。优秀系统需要决定哪些信息进入哪类记忆哪些记忆参与当前推理何时压缩何时丢弃何时把短期经验固化为长期知识。效率管理是记忆系统能否落地的另一条主线。长上下文注意力的主要成本来自 KV 存储和访问PagedAttention、KV 压缩、缓存复用、记忆合并、瓶颈 Transformer、选择性保留等方法都在试图降低显存和延迟。显式检索系统则面临索引维护、向量检索、重排序、上下文拼接和多轮查询开销。论文提醒评估记忆系统不能只看准确率也必须测吞吐、延迟、显存占用、可扩展性和在线更新代价。评测方面现有长上下文基准、召回任务和多文档问答只能覆盖记忆能力的一部分。论文主张更细粒度地评估模型能否在长序列中稳定召回关键信息能否跨多步推理整合分散证据能否在新事实写入后更新行为能否避免遗忘旧知识能否区分短期上下文与长期记忆能否解释检索和写入决策能否在有限计算预算下保持收益。对在线记忆系统还需要测试连续输入下的漂移、污染和恢复能力。从系统角度看记忆并不是一个附加模块而是一组贯穿训练、推理、存储、路由和安全的设计约束。它同时影响模型架构、服务部署和产品体验。未来方向走向可控、可扩展、可评测的记忆系统论文最后总结了六个开放方向。首先需要统一的大模型记忆理论。当前的注意力记忆、循环状态、检索存储、可写参数和专家路由常被分别研究但它们都在解决信息保存与访问问题。未来需要更形式化地刻画容量、保真度、可寻址性、更新频率、压缩损失和计算成本之间的关系。其次需要真正的持续与终身参数记忆。大模型部署后会不断遇到新事实、新用户、新任务和新环境。理想系统应能在不灾难性遗忘、不频繁全量微调的前提下吸收新信息并在必要时纠正或撤销旧记忆。这要求参数化记忆具备局部更新、冲突检测、版本控制和稳定性保证。第三需要鲁棒且可解释的更新规则。在线记忆的危险在于模型可能把噪声、对抗输入或短期偶然模式写进长期状态。未来系统需要更可靠的写入门控、置信度估计、来源追踪和回滚机制使记忆更新不只是“能发生”而是“发生得有理由、可检查、可修正”。第四需要自适应记忆分配与控制。不同任务对记忆的需求差异巨大代码生成需要保留项目结构医疗问答需要审慎处理事实更新个人助手需要长期偏好但又必须尊重隐私。模型应能根据任务、风险和资源预算选择不同记忆路径而不是固定使用一种缓存或检索策略。第五需要硬件与算法协同设计。随着上下文长度、检索库规模和在线状态数量增长记忆系统的瓶颈越来越多地落在显存、带宽、缓存管理和分布式通信上。未来的架构可能需要从一开始就把 KV 管理、稀疏访问、状态压缩和外部存储访问纳入硬件友好的设计。第六需要多维度评测框架。记忆能力不能只用单次问答分数衡量还应覆盖长期保持、快速写入、抗干扰、可遗忘性、事实修正、隐私保护、效率和解释性。只有评测指标足够细才能避免系统在一个维度上看似增强实际却在稳定性或安全性上付出过高代价。总结《Memory for Large Language Models》把大模型记忆从泛泛而谈的功能描述整理成一个可比较的架构设计空间。论文最重要的观点是记忆不是简单的长上下文也不是单纯的向量数据库而是表征、更新和持久性三者共同决定的系统属性。隐式记忆提供高效、端到端、计算耦合的上下文利用显式记忆提供可寻址、可更新、可审计的长期适配能力混合架构则试图在两者之间找到可扩展的平衡。随着智能体、长期交互、个性化模型和持续学习系统的发展大模型需要的不只是“更会回答”还包括“记得合理、忘得及时、改得可靠、查得清楚”。这篇综述给出的框架为理解下一代记忆增强大模型提供了一张很实用的地图。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】