清华唐杰团队揭示大模型记忆全景

量子位·2026年08月05日 15:35
LLM记忆架构全景图,万字长文解构大模型记忆机制

近年来,大语言模型(LLMs)的突破很大程度上归功于Scaling Laws(参数、数据、算力)。

然而,在模型演进的过程中,一个同等重要的维度正变得愈发关键——记忆(Memory)。

从Transformer中伴随计算产生的KV Cache,到线性RNN/SSM的隐式状态压缩,再到近期大火的Titans、TTT(Test-Time Training)以及Engram等显式、可持久化记忆模块,大模型的底层记忆机制正在经历一场深刻的范式转换。

基于此方向,清华大学唐杰教授团队、新加坡国立大学(NUS)以及Bosch AI联合发布了一篇针对大模型记忆架构前沿的详尽综述。文章不仅首次提出了三维记忆分类学(Representation, Update Dynamics, Persistence),还将零散的前沿工作统一到了一个连贯的理论框架下,为下一代更高效、可长效学习的LLM设计指明了方向。

这里需要特别澄清的是,本文探讨的“记忆”特指模型架构层面的内部记忆(Architectural-level Memory)——即模型在网络底层对历史信息的表征、压缩与状态更新;而非目前同样火热的、通过外部Agent框架(如外挂对话日志、本地文件检索引擎等)实现的Agent层面记忆。

背景:大模型记忆的范式转移

传统意义上,LLM的内部“记忆”往往是隐式的、作为计算的副产品存在的。Transformer的自注意力机制提供了一个基于内容的瞬时工作记忆(KV Cache),但其计算与存储开销随序列长度呈二次方增长,且严重依赖于上下文窗口的限制。

近期的研究趋势表明,仅仅“拉长”上下文窗口已经不够了。为了让模型拥有跨越会话的持久学习能力,研究者们开始引入显式的、独立寻址且可持久化的记忆机制(例如在推理阶段可更新的参数模块)。

正如作者在文中所指出的:记忆,正在从单纯的计算副产品,跃升为大模型架构设计的第一性维度。

核心框架:LLM记忆的三维“分类学”

面对海量且碎片化的架构创新(如注意力缓存、循环状态、测试时自适应、检索模块、条件参数路由等),本综述提出了一个统一的三维架构级分类框架,以此理清不同记忆机制的边界与共性:

表示形式(Representation):隐式vs.显式

隐式记忆(Implicit): 与模型前向计算深度绑定,无独立控制接口(如注意力机制的KV Cache、RNN/SSM的隐藏状态)。

显式记忆(Explicit): 具备独立的存储组件与明确的读写语义,不局限于标准的前向计算流程(如外部Datastore、测试时可更新参数、记忆槽等)。

更新机制(Update Dynamics):离线vs.在线

离线(Offline): 仅在训练阶段通过梯度更新(如预训练参数、传统的MoE)。

在线(Online): 支持在推理阶段动态更新,赋予模型在不重新微调的情况下吸收新知识的能力(如Titans的惊奇驱动更新、TTT)。

持久性(Persistence):短期vs.长期

短期(Short-Term): 随局部上下文窗口或推理会话结束而消散(如Attention)。

长期(Long-Term): 信息或其影响力能够跨越局部上下文、甚至跨越独立会话持续存在。

深度解析:隐式与显式架构的设计哲学

在统一的分类学下,作者以表示形式为切入点,对目前主流的两大阵营进行了深度技术拆解:

隐式记忆:计算流中的“过客”(Implicit Memory)

隐式记忆虽然效率极高,但其本质是“计算绑定的瞬时态”。

注意力机制: 作为内容寻址的点状瞬时工作记忆,虽然通过稀疏注意力(Sparse Attention)或滑动窗口(如StreamingLLM)缓解了计算开销,但其容量仍受限于短期存储。

循环序列记忆(Recurrent Memory): 包括Mamba等SSM架构以及RWKV、Gated DeltaNet等线性注意力模型。它们将历史信息压缩为结构化的隐状态(Hidden States)。近期的演进方向(如Kimi Delta Attention)更是将简单的标量衰减升级为通道级的动态状态编辑。

瓶颈与局限: 隐式记忆的容量受到隐藏层维度和窗口的硬性限制,通常缺乏独立可控的读写语义。

显式记忆:独立寻址的“外脑”(Explicit Memory)

这是当前最前沿的研究热点,旨在赋予LLM更长久的生命力和自适应能力:

参数化记忆模块: 如Titans和TTT-E2E,将记忆固化在特定的参数块中,并在推理时 (Test-Time) 执行高频更新。这种将“上下文存储”与“通用知识主干”解耦的设计,大幅缓解了长程灾难性遗忘。

基于查找的记忆(Lookup-based): 如Engram和kNN-LM。信息被存在非参数化的槽位或数据库中,推理时通过稀疏路由检索。这种方式极大拓宽了模型的容量上限,摆脱了密集的计算开销。

条件参数记忆(MoE): Mixtral等MoE架构本质上也是一种显式记忆的变体——通过Router在参数空间中进行依赖上下文的检索寻址。

走向融合:混合架构(Hybrid)与系统级挑战

正如前文所见,没有任何单一的记忆范式能解决所有问题:Attention召回率高但极度消耗显存;SSM计算高效但可能损失细粒度信息;参数化记忆自适应强但面临优化漂移。

因此,混合记忆架构(Hybrid Memory Architectures)正在成为主流。

一些更为人熟知的大模型已经采用了这一路线:例如Kimi Linear以约3:1的比例交错使用Kimi Delta Attention(KDA)与Multi-head Latent Attention(MLA),Qwen3-Next也以类似比例混合Gated DeltaNet与全注意力层;Jamba、Samba等模型则代表了更早的Attention—SSM层际组合。这些设计证明了不同记忆通路的互补性,但其分配比例通常仍由架构预先固定。

更前沿的方向是自适应记忆路由:例如,AMOR根据模型的不确定性决定何时启用高成本的Attention精炼;HAM则利用预测误差判断哪些Token值得进入高保真的稀疏KV Cache,其余信息由高压缩率的循环状态处理。

不过,融合多种记忆并不等于简单叠加模块。该领域仍面临几项关键挑战:

写什么、何时写: 惊奇度、熵或预测误差不一定能够准确衡量信息的长期价值;当前看似无关的Token,可能在很久之后才变得关键。

稳定性与可塑性的平衡: 测试时参数更新能够快速吸收新信息,却也可能带来记忆漂移、旧知识干扰和错误累积。如何实现可靠的写入、遗忘与必要时的回滚,仍缺少成熟方案。

容量、精度与系统成本: 高保真KV存储会持续消耗显存和带宽,而固定大小的循环状态又可能过度压缩历史。PagedAttention、KV Cache量化与内存整合需要与模型结构协同设计。

如何真正衡量“记得好”: 长上下文长度并不等同于有效记忆。除RULER、LongBench等长程测试外,未来评测还需区分召回与推理,并衡量持久性、抗干扰性、更新一致性及计算效率。

结语与未来展望(Future Directions)

记忆架构的研究正越发受到关注和重视。在文章的最后,研究团队为未来的工作提出了几个启发性的方向:

大一统的记忆理论: 建立一个能用统一的信息压缩和状态转换视角来量化Attention、SSM与检索机制的理论框架。

终身参数化记忆(Lifelong Parametric Memory): 突破TTT的短期适应性,让模型实现无需全量微调的长期稳定增量学习。

自适应的记忆分配: 摒弃静态的架构设计,引入可学习的控制器,动态决定信息的存储介质 (Cache还是State) 与持久化级别。

算法-硬件协同设计: 随着上下文延伸至百万级Token,记忆的读取与写入必须与GPU内存层次结构进行深度协同。

从“被动遗忘”到“主动掌控”,大模型的记忆机制正在重塑AI的计算边界。无论你是专注于底层Kernel优化的系统工程师,还是致力于探索下一代模型架构的研究人员,这篇综述都将为你提供一份理论地图。

论文链接:https://arxiv.org/abs/2607.25380

本文来自微信公众号“量子位”,作者:LLM记忆团队,36氪经授权发布。

+1
14

好文章,需要你的鼓励

参与评论
评论千万条,友善第一条
后参与讨论
提交评论0/1000

36氪AI测评

选靠谱AI,看真实评测
查看
36氪AI测评官方交流社区
加入

36氪项目推荐

咨询项目审核和入驻
联系
36氪项目推荐订阅号
关注

下一篇

AI第三年,华尔街厌倦了「烧钱换未来」。

4小时前

36氪APP让一部分人先看到未来
36氪
鲸准
氪空间

推送和解读前沿、有料的科技创投资讯

一级市场金融信息和系统服务提供商

聚焦全球优秀创业者,项目融资率接近97%,领跑行业