FIRST PUBLIC CYCLE2026 · OPEN

Agent 记忆
挑战赛

在统一、可复核的评测环境中,比较 Agent Memory 系统的长期记忆能力,“忆”决高下。

首期截止
08.07 · 23:59
UTC+8
首期发布
08 月中旬
01 / 统一评测契约02 / 公开与私有数据03 / 平台统一跑测04 / 结果独立复核05 / 版本全程可追溯
01WHY THIS CHALLENGE

评测框架

让不同记忆系统,
在同一套规则下公平比较。

不同论文和产品常使用不同数据集、回答模型和评分模型,成绩难以横向比较。本赛事统一数据、接口、Answer 与 Eval,让参赛系统在同一套评测规则下比较长期记忆能力。

Same data同一批记忆与问题

公开子集用于预检与复现,私有数据降低过拟合。

Same answer同一回答模型

检索结果进入一致的 Answer 合约,隔离生成差异。

Same judge同一评分流程

统一提示词、参数与评分器,保留审计证据。

统一评测协议

系统只负责记忆。
其他变量,交给平台。

清晰的责任边界,是成绩可比的前提。参赛方实现记忆写入与检索;平台统一完成回答与评分。

参赛系统CANDIDATE SYSTEM
  1. 01WRITE

    Add

    接收记忆并完成内部处理

  2. 02RETRIEVE

    Search

    返回相关记录或证据

  3. 03GENERATE

    Answer

    平台统一生成最终答案

  4. 04SCORE

    Eval

    平台统一评分与复核

赛事平台OFFICIAL PLATFORM
不得在 Search 中直接生成最终答案 不得针对公开题目硬编码或跨样本共享状态 必须绑定代码、Commit、镜像或 API 版本
02BENCHMARK SCOPE

评测类型

文本记忆与代码记忆,
先按任务类型分别评测。

评测类型分为文本记忆榜与代码记忆榜;参赛组别再按学术方法榜与商业产品榜分别呈现,两个维度互不混淆。

1,559CONVERSATIONS

公开子集对话

≈150MCHARACTERS

长程记忆规模

≈5KQUESTIONS

多维能力问题

MEMORY COMPETENCY MODEL证据如何成为可靠行动
  1. 01 找回
  2. 02 记准
  3. 03 用稳
01
RECALL

召回证据

从长期上下文中找到正确、完整且可追溯的信息。

A2,304

显式事实召回

事实、属性、来源与实体信息

B787

关系与多跳组合

跨片段证据与关系链恢复

C671

时间与事件序列

日期、间隔、顺序与轨迹变化

02
ADAPT

形成稳定记忆

面对变化与个体差异,持续维护准确的记忆状态。

D437

记忆治理

更新、冲突消解、删除与遗忘

E689

个性化与关怀

偏好、背景、健康与心理关怀

03
ACT

安全执行

把记忆用于任务,同时守住事实、规则与隐私边界。

G1,509

规则与流程执行

领域推理、程序执行与格式约束

H155

认识论安全与隐私

稳健拒答、最小披露与证据边界

03TWO DIVISIONS

参赛组别

开源方法与商业产品,
分别进入对应榜单。

FOR OPEN RESEARCH

让方法被准确复现,
也被公平看见。

面向论文方法、研究项目与开源框架。成绩与源码版本、运行配置和复现状态共同公开。

提交
可复现代码或托管 API
完整开源披露
复核
环境复现 · Commit 固定
配置与版本审计
展示
方法 · 论文 · 仓库
配置与复现状态
激励
符合规则可参与
学术方法榜奖励
提交学术方法

层级说明先选择评测类型(文本记忆榜 / 代码记忆榜),再按参赛主体进入学术方法榜或商业产品榜;同一评测类型内统一数据、Add / Search 协议、Answer / Eval 模型、资源限制与评分流程。

04PROCESS & TRUST

首期赛程

从提交到公榜,
每一步都有证据。

平台统一跑测,结果通过版本、日志与合规复核后再进入公开榜单。

查看完整赛事规则 ↗
SUBMISSION DEADLINE

提交截止

提交系统、固定版本与复现材料。

统一考场平台统一评测与复核同一数据、模型、参数与评分流程
FIRST RELEASE

第一期榜单发布

学术方法榜与商业产品榜分别呈现。

* 具体评测安排以赛事官网发布的最新通知为准。

01

协议固定

数据版本、接口、并发、超时、重试、Answer 与 Eval 配置在同一期保持一致。

02

私有评测

公开数据支持预检与复现;私有数据不开放,降低定向过拟合。

03

版本追溯

成绩绑定 Commit、镜像或 API 版本,以及 Run、Suite 与 Pipeline 标识。

04

异常复核

硬编码、提示词注入、人工干预、复现不一致与恶意刷榜均按规则处理。

01 / 上榜奖励OPEN METHOD LEADERBOARD
TOP 10

开源方法榜单 TOP 10
将获得 GPT Pro / Plus 账号奖励!

TOP 1—3GPT ProTOP 4—10GPT Plus
账号由赛事方独立采购并发放;赛事并非由相关产品提供方主办或赞助。
02 / 社区贡献计划入选奖励COMMUNITY PROGRAM
NOW OPEN

社区贡献计划
持续火热开启中

参与 / 邀请参与,即有机会瓜分百亿级Token奖励
入选即发放奖励Kimi Token 额度¥50

满足以下任一条件即可入选前50名有效提交邀请3次有效贡献提交3组有挑战性的测试样本最终奖励发放以官方通知和审核结果为准。
01

提交系统

提供仓库或稳定 API,写清运行方式与版本。

02

通过 Smoke

验证接口、鉴权与端到端链路。

03

启动 Full

当期一次正式评测,受理后版本冻结。

04

复核上榜

有效结果完成复核后公开发布。

开始参赛
05BEFORE YOU ENTER

参赛问答

常见问题

操作细节以 API 指南、参赛说明和当期规则为准。

01参赛是否收费?

不收费。平台承担统一 Answer、Eval 与评测编排成本;参赛方承担自身 API、数据库、带宽和计算成本。

02我要怎么参与?

先选择评测类型(文本记忆榜或代码记忆榜)和参赛组别(学术方法榜或商业产品榜),再提交可复现代码或稳定 API,按 Add / Search 协议通过 Smoke 预检后启动当期 Full 评测。

03是否必须开源?

学术方法榜需提供可复现开源来源或完整复现材料;商业产品榜无需开源,但必须提供可核验的产品与 API 版本。

04正式评测能提交几次?

一个 Leaderboard Key 在当期只能提交一次 Full。开始前可以更新版本并重新运行 Smoke;Full 受理后版本冻结。

05公开集与私有集如何使用?

Smoke 使用固定小子集做接口预检;正式排名综合公开与私有评测结果,私有题目和答案不向参赛方开放。

06什么是有效提交?

材料完整、Smoke 通过、Full 完成,并通过版本、结果与合规复核的提交才计为有效提交。

07评测失败或结果有争议怎么办?

Smoke 阶段可按错误信息修正。Full 若出现平台异常或结果争议,可提交 Run / Job ID 与脱敏说明进入复核。

08社区贡献计划怎么入选?

入选社区贡献计划的同学将瓜分百亿级Token奖励,获得至少额度¥50的 Kimi Token。满足以下任一条件即可入选:
(1)前50名有效提交;
(2)邀请3次有效贡献;
(3)提交3组有挑战性的测试样本。入选即进入奖励发放名单,最终奖励发放以官方通知和审核结果为准。

ENTER THE CHALLENGE · 2026

Agent Memory Challenge
忆决高下

赛事官方公众号二维码

赛事官方公众号欢迎关注!