公开子集用于预检与复现,私有数据降低过拟合。
评测框架
让不同记忆系统,
在同一套规则下公平比较。
不同论文和产品常使用不同数据集、回答模型和评分模型,成绩难以横向比较。本赛事统一数据、接口、Answer 与 Eval,让参赛系统在同一套评测规则下比较长期记忆能力。
检索结果进入一致的 Answer 合约,隔离生成差异。
统一提示词、参数与评分器,保留审计证据。
统一评测协议
系统只负责记忆。
其他变量,交给平台。
清晰的责任边界,是成绩可比的前提。参赛方实现记忆写入与检索;平台统一完成回答与评分。
- 01WRITE
Add
接收记忆并完成内部处理
- 02RETRIEVE
Search
返回相关记录或证据
- 03GENERATE
Answer
平台统一生成最终答案
- 04SCORE
Eval
平台统一评分与复核
评测类型
文本记忆与代码记忆,
先按任务类型分别评测。
评测类型分为文本记忆榜与代码记忆榜;参赛组别再按学术方法榜与商业产品榜分别呈现,两个维度互不混淆。
公开子集对话
长程记忆规模
多维能力问题
- 01 找回
- 02 记准
- 03 用稳
召回证据
从长期上下文中找到正确、完整且可追溯的信息。
显式事实召回
事实、属性、来源与实体信息
关系与多跳组合
跨片段证据与关系链恢复
时间与事件序列
日期、间隔、顺序与轨迹变化
形成稳定记忆
面对变化与个体差异,持续维护准确的记忆状态。
记忆治理
更新、冲突消解、删除与遗忘
个性化与关怀
偏好、背景、健康与心理关怀
安全执行
把记忆用于任务,同时守住事实、规则与隐私边界。
规则与流程执行
领域推理、程序执行与格式约束
认识论安全与隐私
稳健拒答、最小披露与证据边界
真实软件工程任务
真实 GitHub 仓库
经过相关性标注的历史任务
每个 Base Task 的平均历史候选任务数
不同类别相关任务的数量
根据历史任务能够为当前任务提供的实际帮助,将 Related Tasks 划分为 Strong、Weak 和 Unrelated 三类。
STRONG TASKS
可直接复用的工程经验
WEAK TASKS
提供局部工程上下文
UNRELATED TASKS
无关或可能产生干扰的历史信息
参赛组别
开源方法与商业产品,
分别进入对应榜单。
让方法被准确复现,
也被公平看见。
面向论文方法、研究项目与开源框架。成绩与源码版本、运行配置和复现状态共同公开。
- 提交
- 可复现代码或托管 API
完整开源披露 - 复核
- 环境复现 · Commit 固定
配置与版本审计 - 展示
- 方法 · 论文 · 仓库
配置与复现状态 - 激励
- 符合规则可参与
学术方法榜奖励
让产品能力脱离宣传,
回到统一证据。
面向商业 API、闭源产品与企业系统。无需公开源码,但必须提交可核验的产品和 API 版本。
- 提交
- Add / Search API
产品与版本材料 - 复核
- API 日志 · 版本声明
接口一致性核验 - 展示
- 产品名称 · 版本
统一评测成绩 - 激励
- 独立商业产品榜
不参与学术奖励
层级说明先选择评测类型(文本记忆榜 / 代码记忆榜),再按参赛主体进入学术方法榜或商业产品榜;同一评测类型内统一数据、Add / Search 协议、Answer / Eval 模型、资源限制与评分流程。
提交截止
提交系统、固定版本与复现材料。
第一期榜单发布
学术方法榜与商业产品榜分别呈现。
* 具体评测安排以赛事官网发布的最新通知为准。
协议固定
数据版本、接口、并发、超时、重试、Answer 与 Eval 配置在同一期保持一致。
私有评测
公开数据支持预检与复现;私有数据不开放,降低定向过拟合。
版本追溯
成绩绑定 Commit、镜像或 API 版本,以及 Run、Suite 与 Pipeline 标识。
异常复核
硬编码、提示词注入、人工干预、复现不一致与恶意刷榜均按规则处理。
开源方法榜单 TOP 10
将获得 GPT Pro / Plus 账号奖励!
社区贡献计划
持续火热开启中
参与 / 邀请参与,即有机会瓜分百亿级Token奖励
入选即发放奖励Kimi Token 额度¥50
提交系统
提供仓库或稳定 API,写清运行方式与版本。
通过 Smoke
验证接口、鉴权与端到端链路。
启动 Full
当期一次正式评测,受理后版本冻结。
复核上榜
有效结果完成复核后公开发布。
参赛问答
常见问题
操作细节以 API 指南、参赛说明和当期规则为准。
01参赛是否收费?
不收费。平台承担统一 Answer、Eval 与评测编排成本;参赛方承担自身 API、数据库、带宽和计算成本。
02我要怎么参与?
先选择评测类型(文本记忆榜或代码记忆榜)和参赛组别(学术方法榜或商业产品榜),再提交可复现代码或稳定 API,按 Add / Search 协议通过 Smoke 预检后启动当期 Full 评测。
03是否必须开源?
学术方法榜需提供可复现开源来源或完整复现材料;商业产品榜无需开源,但必须提供可核验的产品与 API 版本。
04正式评测能提交几次?
一个 Leaderboard Key 在当期只能提交一次 Full。开始前可以更新版本并重新运行 Smoke;Full 受理后版本冻结。
05公开集与私有集如何使用?
Smoke 使用固定小子集做接口预检;正式排名综合公开与私有评测结果,私有题目和答案不向参赛方开放。
06什么是有效提交?
材料完整、Smoke 通过、Full 完成,并通过版本、结果与合规复核的提交才计为有效提交。
07评测失败或结果有争议怎么办?
Smoke 阶段可按错误信息修正。Full 若出现平台异常或结果争议,可提交 Run / Job ID 与脱敏说明进入复核。
08社区贡献计划怎么入选?
入选社区贡献计划的同学将瓜分百亿级Token奖励,获得至少额度¥50的 Kimi Token。满足以下任一条件即可入选:
(1)前50名有效提交;
(2)邀请3次有效贡献;
(3)提交3组有挑战性的测试样本。入选即进入奖励发放名单,最终奖励发放以官方通知和审核结果为准。
Agent Memory Challenge
忆决高下
赛事官方公众号欢迎关注!
