摘要
文章梳理了一个可审计长期记忆系统在 LongMemEval-S 基准上的评估数据,其确定性检索链使用混合候选检索、交叉编码器重排、覆盖优先的数据包编译与确定性推理支架,最终由 LLM 充当可替换的末端阅读器。
内容总结
- 该检索链在 470 道可答题中将全部金标会话纳入候选池的比例为 468/470,生成金标完整数据包的比例为 462/470。
- 使用通过未锁定 CLI 别名调用的 Claude Opus 阅读器进行两次 500 题测试,得分分别为 479/500 和 475/500(GPT-4o 评判)。
- 72 道可答知识更新题使用了实质性修改过的评分提示词,该提示词在官方文本下的效果尚未被测量;该组成绩与 Chronos High 已公布的 478/500 分处于交叉状态,差异来源包括阅读器代次、评分提示词、可能的数据版本以及系统内方差,文章表示这些差异既不能确立优越性也不能确立等价性。
- 同一批数据包上 grok-4.6-high 阅读器得分为 476/474,而最大推理努力度的智能体变体退化至 461/465;两次头条测试在八行判定翻转上存在差异。
- 第二评判者在每轮测试中与头条评判者在 493/500 行上一致(98.6%),且对两轮均给出 472/500 分;官方评判者在重新评分字节相同的首轮答案时也翻转了三个判定。
- 所有组件均在同一组 500 道题上开发,没有留出评估集或独立人工裁定;检索与支架方法来源及转录衍生审计被保留;头条阅读器获得了额外的操作者上下文,其完整请求未被保留,MCP 工具可用性尚未解决。文章发布了物化数据包、支架、阅读器输出、评判者判定和控制项以供检查和重新评分。
来源:arXiv · 09-30 01:04(北京时间)