问题:部署即静态
LLM Agent 正在大规模生产部署(编程助手、客服、科研),但部署后就彻底静态了——权重冻结、prompt 冻结、工具集冻结。想改进?人工收集数据 → 离线微调 → 修改 agentic loop → 重新部署。这个循环必须被打破。
个人 agent(如 OpenClaw)已证明自进化可行,但企业级场景需要跨租户治理、合规审计、隐私隔离——这不是算法问题,是系统问题。
支柱一:Agent Trajectory Data Protocol(ATDP)
现有 agent 日志记的是 prompt、completion、工具调用、延迟——对调试有用,对在线 RL 不够。ATDP 要求在 step 粒度保存:observation、内部状态、action、action 结果、延迟到达的 reward/critique、模型版本、tool schema、租户、成本、治理状态等 metadata。
核心要求:vendor-neutral、支持延迟反馈、保留版本化溯源(反事实回放)、从一开始编码隐私和训练资格字段。没有它,海量交互数据就是不完整、不可复现、不安全的学习基底。
支柱二:企业级 Agentic Data Proxy
ATDP 规定"表示什么",Data Proxy 规定"怎么生产"。在稳定执行边界拦截:LLM 调用、工具调用、检索、内存、文件/浏览器、审批、用户纠正、任务结果。将生产工作转化为可治理的学习材料——脱敏、访问控制、保留策略、溯源、收割弱/延迟 reward。
核心原则:数据治理在进入学习队列之前完成。这不是可观测性收集器,而是 RL 学习循环的第一道安全边界。
支柱三:统一 Agent Evolution Control Plane
自进化 agent 定义为 At = ⟨πθt, Hψt, Mt, Tt, Gt⟩(策略 LLM / harness / memory / 工具集 / 治理配置)。进化动作空间包括策略权重更新、harness 编辑、memory 更新、工具 schema 修改、回滚、不操作。
- 多面适配:窄范围缺失事实 → memory 插入;工具路由问题 → harness 编辑;跨租户跨任务持续失败 → 策略 RL 更新
- 统计自动触发:靠 evaluator 得分、用户纠正率、工具失败聚类、canary 差异等显式统计量,而非人工巡检
- 算法多元主义:不硬编码单一范式,weight 更新可以是 on-policy RL / process reward / distillation
- 安全分阶段部署:shadow eval → 回放检查 → 离线回归 → canary rollout → rollback → 差异监控
AREAL2.0:概念验证
聚焦单一分支:从部署 agent 轨迹做在线策略 LLM 权重更新。核心设计:不把 RL 基础设施当作离线流水线,而是把 rollout 和训练 worker 包装为 agent 微服务组件,替换标准 LLM 推理后端。部署 agent 的原生多轮交互成为轨迹数据源,消离离线训练数据与部署行为的差距。
与 GSME 的互补
这两篇同周论文形成互补。GSME(EverMind)关注"如何可信地让 harness 自进化",蚂蚁这篇拉到更高维度问"企业级自进化的系统基座需要什么"。两篇论文从不同角度指向同一结论:自进化不是一个单一优化器,而是一个"选择在哪个面上干预"的决策问题。
值得关注的三个点:
1. ATDP 概念的价值不限于企业——个人 agent 同样需要 step-level、RL-grade 轨迹协议作为自进化闭环基础。
2. "数据治理在学习之前"应成为 agent 自进化的默认范式——对"先跑再改"实践的纠正。
3. Control Plane 的多面适配思想对 OpenClaw 的 harness 进化接口设计有直接参考价值。