• 果壳说
3407
需用时 06:48
Agent 记忆挑战赛正式启动:首个面向记忆系统的开放锦标赛

随着 Agent 从一次性问答工具走向长期协作系统,长期记忆正在成为决定其可靠性、个性化能力与工程可用性的关键基础设施。2026 年 7 月 29 日,由国内外二十多所高校与研究机构联合发起的 Agent Memory Leaderboard(AML)正式发布,旨在为记忆系统建立一套统一、开放、可复现、可长期运行的评测协议与公开榜单

过去一年,Agent Memory 方法与产品快速涌现,但不同系统往往使用不同数据集、回答模型和评分规则,导致结果难以直接比较。一个系统在单一数据集上的高分,未必能说明其整体记忆能力;同一个记忆方法接入不同回答模型后,端到端表现也可能产生明显差异。由此得到的成绩,往往混合了记忆系统、回答模型和裁判规则等多方面因素的影响,难以准确衡量记忆系统本身的贡献。

在这一背景下,AML 并不试图再造一个单点 benchmark,而是将已有公开基准、平台私有测试集、标准化接入协议、统一回答流程、评审机制和公榜治理整合为一套长期运行的开放评测体系。

围绕“全面、统一、可比”的评测目标,平台形成了三项核心设计

其一,构建覆盖文本记忆与代码记忆的多源数据体系,并以统一流程、统一回答模型和统一评审机制保障评测公平性;

其二,重构记忆能力维度,将总分拆解为分能力项的性能表现,帮助识别记忆系统在事实召回、多跳整合、时序理解、记忆治理、安全隐私等环节的真实性能差异;

其三,提供统一记忆方案接入协议,降低记忆方案的参评成本,使榜单能够持续稳定运行、不断追踪和吸纳新系统。

一、统一评测:整合多源数据,统一评测全流程

记忆系统评测要具备公信力,关键在于两点:数据覆盖是否全面,评测条件是否一致。AML 覆盖文本记忆与代码记忆场景下多源评测任务,并统一接口、回答流程和评审机制,减少单一数据集与外部变量对结果的影响,使成绩更能反映记忆系统本身的能力。

在文本记忆评测方面,AML 整合了 PersonaMem、LoCoMo-Refined、CLBench、BEAM、LongMemEval、ScriptMem 等 10余个业界主流的数据集,覆盖长对话、跨会话历史、个性化偏好、规则执行、超长上下文和剧本式连续事件等场景,合计超过 1500 个对话与任务样本、约 1.5 亿字符的长程历史、近 5000 道评测题目。更广的数据覆盖面能够降低单一场景优化带来的偶然优势,使评测结果更接近系统在真实复杂场景中的整体表现。

除文本记忆外,AML 将面向代码任务的长期记忆能力纳入评测体系。现有代码 Agent 评测通常将每个任务视为独立事件,而较少评估记忆系统能否检索并复用历史工程经验,以及这种经验复用能否提升 Agent 解决当前任务的能力。在真实软件开发场景中,开发者解决问题时往往需要参考历史 Pull Request、既有架构约定、过往修复方案和项目演化记录。AML 引入了一套面向长期工程经验的检索与复用能力评估的数据集。该代码评测数据集(暂未发布)由高校研究团队基于真实 GitHub 仓库中的软件工程任务构建并提供,覆盖 12 个仓库、150 个基础任务。对于每个基础任务,评测数据集中收集同一仓库中创建时间早于该任务的历史 Pull Request,形成 1290 个经过细粒度标注的历史任务。数据在设计上包含三项关键机制:首先,通过标注历史任务与目标任务之间的强相关、弱相关和无关关系,支持对系统抗噪能力的细粒度评估;其次,通过严格的时间约束,确保所有候选历史任务均产生于目标任务之前,从而避免未来信息泄漏;最后,通过构建三种具有不同历史规模和噪声密度的记忆环境,模拟不同真实软件开发场景,从而支持对记忆系统检索、筛选与复用历史工程经验能力的评测。

在评测流程上,AML 将参评系统的职责限定为 Add 和 Search 两类接口。Add 负责写入记忆,Search 负责返回与问题相关的记忆证据;最终回答由平台统一的 Answer 模型生成,评分由平台统一的 Eval 流程完成。通过固定回答模型、评分流程和聚合规则等关键变量,平台能够更大程度地将成绩差异归因于记忆系统本身。

评分环节则采用多评审评分系统(Multi-Agent Judging System)。平台会根据题目来源、能力标签和答案类型,将题目路由到相应评审流程:事实召回类题目检查关键事实是否命中,多跳类题目检查分散证据是否被正确整合,时序类题目检查新旧状态判断是否准确,安全类题目检查系统是否守住证据与隐私边界;代码任务则以测试用例通过情况进行客观判定。平台还会统一封装模型、参数、日志和聚合规则,并使用人工标注样本校准评分规则,保留检索证据、平台答案和评审记录,以提升评测结果的可解释性与可追溯性。

因此,AML 的统一评测并不是简单扩大测试集规模,而是通过“全面数据覆盖、固定评测链路、多评审评分机制”,把不同记忆系统放到同一把尺子下比较。

二、能力剖面:重构能力维度,呈现系统真实差异

单一总分很难解释记忆系统的真实差异。为了解决“排名可见、原因不可见”的问题,AML 将不同来源的数据重新映射到统一能力维度中,把评测结果从单一分数扩展为可解释的能力剖面。

现有公开数据集本身具有重要价值,但其任务设计和能力标签并不统一。有的数据集强调长程事实召回,有的强调偏好与个性化,有的关注时间线,有的侧重规则执行或拒答安全。如果只是将这些数据集简单拼接,最终得到的往往是混合分数,难以为研究迭代和产品选型提供清晰依据。

为此,AML 对收录题目的能力标签进行了人工重构,将原本分散在不同数据集中的题目映射到同一套能力维度体系。这套维度沿着记忆使用链路展开:一条信息要成为可用记忆,首先要被精准召回,其次要被正确理解,最后还要在合适边界内稳定使用。基于这一链路,平台将文本记忆归并为七类能力:显式事实召回、关系与多跳组合、时间与事件序列、记忆治理、个性化与关怀、规则与流程执行、认识论安全与隐私。

代码记忆同样纳入这套能力坐标,重点评估系统能否从历史工程记录中检索、筛选并复用有效经验,主要包括两类任务:

Debug Memory:考察记忆系统能否从历史记录中检索出相似问题的修复经验,帮 Agent 复用定位思路、修改方案和验证方法;

Development Memory:考察能否从历史开发记录中提取架构设计与既有工程模式,帮 Agent 生成符合项目设计的修改。

经过这一重构,LoCoMo、BEAM、LongMemEval 等不同来源的数据不再只是并列出现,而是被组织进同一套能力坐标。参评者最终得到的也不只是一个名次,而是一张能力剖面图:它能够呈现系统在事实召回、多跳整合、时序理解、记忆治理、个性化、安全隐私等维度上的具体表现。

这意味着,AML 提供的不只是一个排行榜,而是一套诊断工具。对研究者而言,能力剖面能够定位方法短板;对产品团队而言,它可以帮助判断系统是否适合具体应用场景;对行业用户而言,它让“记忆能力强”从笼统宣传变成可核验的分项证据。

三、低门槛统一接入:支撑开放榜单长期运行

一个评测平台要成为长期基础设施,关键不只是数据和评分规则,还要让不同类型的系统能够持续接入、反复复现、长期比较。过去许多评测难以延续,一个重要原因在于接入成本高、系统形态差异大、版本记录不完整,导致新方法和商业产品很难在同一套规则下持续积累结果。

AML 因此将参评系统的技术要求压缩为 Add 和 Search 两类核心接口。参评方只需负责记忆写入与检索,回答生成、评分、结果聚合和评测编排均由平台统一完成。这一协议设计使不同类型的参评方都能进入同一套评测体系。商业产品可以通过稳定 API 参评,无需公开内部实现;开源方法则提交代码、运行方式和版本材料,由平台按规则复现或托管运行。对参评方而言,接入重点从搭建完整评测环境转为提供稳定、规范的记忆写入与检索能力。

统一接口也使榜单能够持续吸纳新系统。每条成绩与系统版本绑定,评测日志与结果长期可追溯;不同时间加入的系统,也可以在同一套条件下进行比较。在既有基准之外,AML 还接受社区贡献的新 Benchmark——平台鼓励大家提交与现有评测形成互补、具备区分度的完整测试集,经审核后可纳入平台评测体系。

因此,AML 统一了评测入口、执行流程和治理规则,既保留了不同记忆系统的创新空间,也为开放榜单的长期运行提供了制度基础。

首届 Agent 记忆挑战赛 2026

由 Agent Memory Leaderboard 平台主办的首届 Agent 记忆挑战赛已于 2026 年 7 月 29 日启动,本次挑战赛面向全球研究者、开源项目维护者和商业产品团队征集参评系统,旨在为社区提供第一批可比较、可复核的公开评测结果。

赛事榜单分类

开源方法榜单:面向开源研究方法,成绩与代码、配置和复现材料绑定,参与排名与奖励结算;

商业产品榜单:面向以稳定 API 提供的商业记忆产品,独立排名,为行业提供选型参照。

研究者、开源项目维护者、产品团队和正在做技术选型的开发者,都可以提交系统参与评测。不设组队要求。

参赛流程说明

报名申请:填写报名表单,审核通过后获取评测 API Key;

接口接入:按平台协议提供公网可访问的 Add/Search 接口;

提交评测:通过 smoke 兼容性测试确认链路后,提交正式评测任务;

复核上榜:评测结果经复核后进入公开榜单。

平台统一承担 Answer、Eval 与评测编排成本;参赛方承担自身 API、数据库、带宽和计算成本,参赛者无需自行搭建评测环境。

奖励设置

上榜奖励(开源方法榜,每期结算)

第 1—3 名:ChatGPT Pro 月度会员(价值 ¥1,400)

第 4—10 名:ChatGPT Plus 月度会员(价值 ¥140)

社区贡献计划(满足任一条件即可入选,瓜分百亿级 Token 奖励)

前 50 位完成有效提交的参赛者,每人获得价值 50 元人民币的 API 额度;

每成功邀请 3 位新参赛者完成有效提交,同样获得价值 50 元人民币的 API 额度。

我们也欢迎贡献有挑战性的测试样本,提交 3 个有挑战性的测试数据,同样获得价值 50 元人民币的 API 额度!

*全部奖励以账号会员与 API 额度形式发放,名额有限,发完为止,最终规则以赛事官网规则页为准。

赛事日程与联系方式

报名开放:2026 年 7 月 29 日

提交截止:2026 年 8 月 7 日

放榜日期:2026 年 8 月中旬

赛制:本次为首届赛事。Agent Memory Leaderboard 长期运行,后续赛事另行公告

报名入口:https://agentmemories.ai/competition/

赛事仓库:https://github.com/AML-memory/agent-memory-leaderboard (含接口协议、提交指南与接入示例)

答疑邮箱:contactus@agentmemoryleaderboard.ai,2 个工作日内响应

关注"记忆之巅排行榜"公众号(Agent Memory Leaderboard 官方中文账号),第一时间获取放榜结果与下期赛事。

记忆技术要往前走,需要一套大家认可、任何人都能核验的度量衡。

8 月中旬,我们榜单见。

The End

举报这篇文章

果壳说

果壳作者

pic