为什么AI Memory的benchmark这么少?
最新的是今年ICLR的BEAM
- 数据规模:100段对话,单段最长1000万token,配2000个探测问题。生成流程是先编好故事线、人设和时间线,再展开成多轮对话,身份一致,事实演变。
- 测十种记忆能力:记事实/实体、信息更新、消解矛盾、时间顺序、指令vs偏好区分、多跳推理、长历史摘要等。
- 两个模式:BEAM-1M(百万token)和BEAM-10M(千万token)。
- 核心结论:光靠长上下文不够,长上下文+结构化记忆才行,差距一直都在。
- LIGHT记忆框架:论文同时放出了一个记忆增强框架,比最强的长上下文baseline准确率高3.5%~12.7%,token越多差距越大。