Back to Blog 自进化 Agent 的系统瓶颈:不在算法,在基础设施

自进化 Agent 的系统瓶颈:不在算法,在基础设施

Paper
Next-Generation Agentic RL Systems Enable Self-Evolving Agents
蚂蚁集团 / 港科大 / 清华 · arXiv 2607.01120
arxiv.org/abs/2607.01120 · GitHub
核心论点:自进化企业级 Agent 的瓶颈不是 RL 算法,而是缺一整套在线 Agentic RL 系统基础设施。需要三个协同设计的支柱:标准化轨迹数据协议(ATDP)、企业级数据代理(Data Proxy)、统一进化控制面(Control Plane)。蚂蚁用 AREAL2.0 原型验证了"策略权重在线更新"这一分支。

问题:部署即静态

LLM Agent 正在大规模生产部署(编程助手、客服、科研),但部署后就彻底静态了——权重冻结、prompt 冻结、工具集冻结。想改进?人工收集数据 → 离线微调 → 修改 agentic loop → 重新部署。这个循环必须被打破。

个人 agent(如 OpenClaw)已证明自进化可行,但企业级场景需要跨租户治理、合规审计、隐私隔离——这不是算法问题,是系统问题。

支柱一:Agent Trajectory Data Protocol(ATDP)

现有 agent 日志记的是 prompt、completion、工具调用、延迟——对调试有用,对在线 RL 不够。ATDP 要求在 step 粒度保存:observation、内部状态、action、action 结果、延迟到达的 reward/critique、模型版本、tool schema、租户、成本、治理状态等 metadata。

核心要求:vendor-neutral、支持延迟反馈、保留版本化溯源(反事实回放)、从一开始编码隐私和训练资格字段。没有它,海量交互数据就是不完整、不可复现、不安全的学习基底。

支柱二:企业级 Agentic Data Proxy

ATDP 规定"表示什么",Data Proxy 规定"怎么生产"。在稳定执行边界拦截:LLM 调用、工具调用、检索、内存、文件/浏览器、审批、用户纠正、任务结果。将生产工作转化为可治理的学习材料——脱敏、访问控制、保留策略、溯源、收割弱/延迟 reward。

核心原则:数据治理在进入学习队列之前完成。这不是可观测性收集器,而是 RL 学习循环的第一道安全边界。

支柱三:统一 Agent Evolution Control Plane

自进化 agent 定义为 At = ⟨πθt, Hψt, Mt, Tt, Gt⟩(策略 LLM / harness / memory / 工具集 / 治理配置)。进化动作空间包括策略权重更新、harness 编辑、memory 更新、工具 schema 修改、回滚、不操作。

  • 多面适配:窄范围缺失事实 → memory 插入;工具路由问题 → harness 编辑;跨租户跨任务持续失败 → 策略 RL 更新
  • 统计自动触发:靠 evaluator 得分、用户纠正率、工具失败聚类、canary 差异等显式统计量,而非人工巡检
  • 算法多元主义:不硬编码单一范式,weight 更新可以是 on-policy RL / process reward / distillation
  • 安全分阶段部署:shadow eval → 回放检查 → 离线回归 → canary rollout → rollback → 差异监控
AREAL2.0 Architecture
图1:AREAL2.0 系统架构 — 将 RL rollout/training worker 包装为微服务,直接替换 agent 推理后端

AREAL2.0:概念验证

聚焦单一分支:从部署 agent 轨迹做在线策略 LLM 权重更新。核心设计:不把 RL 基础设施当作离线流水线,而是把 rollout 和训练 worker 包装为 agent 微服务组件,替换标准 LLM 推理后端。部署 agent 的原生多轮交互成为轨迹数据源,消离离线训练数据与部署行为的差距。

AREAL overview
图2:AREAL 框架全貌

与 GSME 的互补

这两篇同周论文形成互补。GSME(EverMind)关注"如何可信地让 harness 自进化",蚂蚁这篇拉到更高维度问"企业级自进化的系统基座需要什么"。两篇论文从不同角度指向同一结论:自进化不是一个单一优化器,而是一个"选择在哪个面上干预"的决策问题。

值得关注的三个点:

1. ATDP 概念的价值不限于企业——个人 agent 同样需要 step-level、RL-grade 轨迹协议作为自进化闭环基础。

2. "数据治理在学习之前"应成为 agent 自进化的默认范式——对"先跑再改"实践的纠正。

3. Control Plane 的多面适配思想对 OpenClaw 的 harness 进化接口设计有直接参考价值。

Tags: #Blog