Recuris:长时域Agent的递归经验-工作记忆进化框架
论文标题:Recursive Experiential–Working Memory Evolution for Long-Horizon Agent Harnesses
代码仓库:https://github.com/Gen-Verse/Recuris
论文链接:https://arxiv.org/abs/2608.24876
作者团队:National University of Singapore · Stanford University · University of Oxford · Princeton University
一、核心思想:让Agent的"记忆"自己进化
想象一个场景:你让AI助手帮你规划一次复杂的旅行,它需要协调机票、酒店、景点门票等多个工具。在执行过程中,随着对话历史不断增长,AI逐渐"迷失"——忘记了最初的目标,做了重复的操作,或者遗漏了关键步骤。这不是模型能力不足,而是记忆管理机制出了问题。
Recuris提出了一个优雅的解决方案:不是让模型变得更强,而是让模型的"记忆"学会自我进化。
传统Agent记忆系统的困境
当前主流的Agent记忆系统面临两大核心问题:
| 问题 | 表现 | 后果 |
|---|---|---|
| 记忆检索失效 | 从初始指令或完整对话历史中检索技能 | 随着任务推进,早期信息被"淹没",检索结果越来越不相关 |
| 记忆进化粗放 | 从最终成功/失败信号中学习 | 不知道哪里出了问题,只能整体重写记忆 |
Recuris的核心洞察
Recuris提出了一个关键洞察:工作记忆是连接当前任务状态与存储经验的桥梁。
核心循环:任务状态 → 技能选择 → 执行反馈 → 更新任务状态
- 工作记忆(WM):持续追踪任务进度和未完成的目标
- 经验记忆(EM):存储可复用的技能
- 验证机制:确保状态更新基于实际执行结果
二、技术架构:Skill Memory的四组件设计
Recuris将Agent的外部记忆控制层抽象为四元组 ℳ = (𝔈, 𝒲, ρ, ℭ):
| 组件 | 全称 | 功能 |
|---|---|---|
| 𝔈 | Experiential Memory | 存储可复用的Agent技能 |
| 𝒲 | Working-Memory Specification | 定义状态模式和更新提案 |
| ρ | Invocation Policy | 决定何时检索技能、从经验记忆中检索哪些条目 |
| ℭ | Checker Set | 验证观察结果是否支持提议的状态变更 |
三、跨任务记忆进化:递归改进的闭环
失败定位(Failure Localization)
Recuris知道哪个记忆组件导致了失败:
| 失败定位 | 指向的组件 | 修复方向 |
|---|---|---|
| 技能缺失或错误 | 𝔈 | 添加或修正技能 |
| 目标遗漏或状态错误 | 𝒲 | 修改状态字段或更新提案 |
| 技能调用时机错误 | ρ | 调整触发谓词或检索键 |
| 验证器判断失误 | ℭ | 修正完成谓词 |
关键数据:从结构化轨迹进行失败定位的准确率为 64.8%,而仅从任务结果判断仅为 13.0%。
验证门控(Validation Gate)
补丁不会立即生效,必须通过固定的验证门:补丁在源任务上有效且在held-out开发集上无回归,才被接受。
四、实验结果
35/37 的模型-基准测试对获得提升:
| 模型 | τ²-Retail提升 | SkillFlow提升 |
|---|---|---|
| GPT-5.6 Sol | +17.8 | - |
| Claude Opus 5 | +15.6 | - |
| Qwen3.6-27B | +8.3 | +16.6 |
| Doubao-2.0-Pro | +23.3 | +16.8 |
关键发现
- 优势随任务时长增长而扩大:最长任务获得+32.2提升
- 长时域失败减少80%
- 工作记忆是主角:工作记忆单独贡献+23.9提升,经验记忆单独仅+2.0
五、设计哲学
- 状态锚定记忆使用:记忆检索基于已验证的任务状态
- 目标导向的进化:失败定位到具体组件,而非整体重写
- 验证门控约束:补丁由配对的held-out验证
- 训练自由与模型无关:记忆从一个模型迁移到另一个模型无需修改
- 递归自我改进的边界:递归被限制在外部化的记忆控制层
六、十大核心观点总结
- 记忆的价值在于"何时调用"而非"存储什么"
- 工作记忆是长时域任务的关键
- 验证机制防止错误累积
- 结构化轨迹是精准修复的前提
- 关键组件因领域而异
- 前沿模型在长时域任务上并未饱和
- 优势随任务时长增长而扩大
- 长时域失败可被大幅消除
- 跨模型迁移可行但有代价
- 递归自我改进是可持续的
结语
Recuris提出了一个简洁而强大的框架:不是让模型更强,而是让记忆更聪明。通过将记忆分解为四个可独立进化的组件,结合结构化的失败定位和验证门控,Recuris实现了真正意义上的递归自我改进。
最令人印象深刻的是:这一切都发生在冻结的基础模型之上——不需要微调,不需要重训练,只需要让记忆系统学会从失败中学习。
相关资源:
Frequently Asked Questions
Who is behind TopDigg?
TopDigg is created by Eric, a researcher focused on AI trends and SEO/GEO strategies.
How often is content updated?
Blog posts are published regularly. AI Daily is updated daily with the latest AI news.
Can I republish or share content from TopDigg?
Please contact us for content licensing and collaboration inquiries.
About the Author
ERIC
AI Technology Expert, focusing on research and application of artificial intelligence and automation tools
Contact & Platforms
