「记忆之巅」首期放榜:Agent 记忆赛道的一张标准化成绩单出炉
8月12日,一张叫 AML(Agent Memory Leaderboard,中文名「记忆之巅排行榜」)的榜单,放出了首期结果。
对于一个相当垂直的评测来说,它的热度高得有些反常:上线以来,官方站
但如果把过去半年这条赛道上发生的事情连起来看,这场「记忆大考」的火爆,其实早有伏笔。
Agent 的「失忆症」,正在被重新定价
有关Agent 的记忆问题,一个流传很广的吐槽是,用 Claude Code 写了一周代码,关掉终端再打开,它不记得项目架构、不记得你的代码风格、不记得上次调试到哪一行,一切从零开始。
而资本市场对这块短板的定价,在过去半年明显加速了。围绕 Agent 记忆的新公司密集出现,头部机构也开始系统性地看这个方向,出手频率和估值水位都在往上走。
一份近期的行业调研报告显示,记忆系统是 AI 基础设施里「最后一块未被充分定价的核心组件」,而大模型记忆赛道热起来之后,下一个问题自然浮现:这么多玩家,谁的记忆是真的好?
这正是 AML 出现的背景。
一场只考「记忆」的统考
过去评价一个 Agent「记性好不好」,其实是一笔糊涂账——各家用的数据、答题模型、Prompt 和评分标准都不一样。一个系统分数更高,可能是记忆做得好,也可能只是背后的大模型更会答题,结果很难直接比较。
而 AML 由海内外近 30 所研究机构科研团队联合发起,用更直接的方式,把记忆系统单独拎出来考。AML 的关键设计,不只是换了一批题,而是试图统一整条评测链路。
参评系统只负责两件事,把历史信息记下来(Add),在问题到来时找回来(Search)。至于拿到记忆之后怎么组织答案、怎么打分,全部由平台用同一套模型、同一套标准统一完成。
考试科目也不是简单的几个项目,文本记忆覆盖事实召回、多跳推理、时间与事件、记忆治理、个性化、上下文执行、安全与隐私七个方向,代码记忆则考察系统能不能复用历史调试和开发经验。通过各种维度的测评,记忆能力的评估才能跳出单一指标的局限,更准确地反映模型在长周期交互中的真实水平。
放榜:榜上记忆框架各有长短
纵观AML首期榜单,各家记忆模型的能力结构呈现出极为显著的差异与分化。用AML在官方解读中的评价来描述这个现象非常贴切:榜前都是好汉,榜上各有绝活。
在商业榜单中,排名第二、第九的框架在事实召回、多跳推理、时间推理和记忆治理上表现强劲,这高度契合他们强调结构化、可编辑与自演化的架构设计;然而,规则与工作流执行能力是他们共同的短板。获得季军的框架其个性化能力高达 57 分,也即意味其核心优势在于对用户意图与偏好的理解;但是其在时间推理与安全隐私上相对偏弱。也有一些框架,在海内外社区十分活跃,但综合性能相对有限,显露出高阶记忆管理能力的瓶颈。
在首期结果里,MemoraX 以 58.0 分的绝对优势锁定总榜第一,并且实现了七项能力维度全部排名第一。公开信息显示,这是一家成立还不到半年的公司——深圳忆纪元科技有限公司(MemoraX AI)。作为一家专注大模型记忆赛道的创新企业,团队在短短 5 个月内已连续斩获三轮大额融资,迅速成为资本与技术双重瞩目的焦点。
一个 5 个月大的团队,在一场统一规则的考试里赢过了大厂,这件事本身比分数更值得琢磨。
MemoraX AI可能做对了什么?
根据公开资料,MemoraX 走的是一条和主流方案不太一样的路线。目前市面上大多数记忆系统,本质上是「外挂」——在模型旁边挂一个记忆库,靠人工规则和提示词来决定记什么、怎么存、什么时候取。而 MemoraX 对外传递的技术关键词是「内生记忆」和 Agentic RL(智能体强化学习):把「什么值得记、什么时候更新、什么时候调用」变成模型自己可以学的能力,而不是工程师提前写死的规则。
在 AML 之前,这条路线已经有过几次点状验证:在南京大学与上海 AI Lab 联合发布的 LoCoMo-Refined 基准上拿到 82.65 分、领先第二名 30%;在其与牛津大学联合开源的剧本记忆基准 ScriptMem 上正确率 60.3%、领先第二名 40%;在 Coding 领域的 SWE-context-bench 上任务解决率 45%、领先第二名 50%。
从这个角度看,这次 AML 的七项第一,更像是一连串信号的集中确认,而不是一次孤立的爆发。
当然,一期榜单说明不了全部。记忆系统真正的考场仍在生产环境:长期运行是否稳定、成本是否可控、能否满足企业级安全与合规要求,都不是一次集中评测能够回答的。但它至少提供了一套统一口径,让不同技术路线能够在相同条件下被观察和比较。
榜单之后,这条赛道看什么?
对关注这条赛道的人来说,AML 首期榜单的意义,可能不在名次本身。
第一,标准化评测让记忆能力变得可比较。有技术社区观察者把这次放榜类比为记忆领域的「ImageNet 时刻」,ImageNet 的突出贡献不是选出了冠军,而是让计算机视觉从各自为战走向统一标尺,随后才有了整个行业的加速。记忆赛道今天站的位置,和当年有些相似。
第二,路线之争才刚刚开始。「外挂式」记忆库胜在成熟、合规、即插即用,「内生式」路线胜在上限和想象空间。一期榜单证明不了哪条路线终局会赢,但它会让接下来的每一次产品迭代、每一轮技术选型,都多一个可引用的参照系。
第三,记忆的商业化路径正在清晰。Mem0 的 API 调用量一年涨了 5 倍,说明「记忆即服务」的付费意愿是真实的;企业侧对私有化部署、多租户隔离、权限审计的要求,又会把竞争拉向工程厚度的比拼。这个赛道的收入模型,大概率会介于模型 API 和数据库之间——而这两个市场,都出过百亿美元级别的公司。
Agent 要真正进入长期协作场景,记忆是绕不开的那块拼图,它需要记住过去、理解变化,并把经验带到下一次行动中。AML 首期榜单,使得这块拼图终于有了公开的成绩单。
接下来的问题是:第二期榜单放榜时,第一名还会是同一家公司吗?















