Self-Instruct 开创了用 LLM 造训练数据的范式,后续的 Grounded、CoT、self-challenging 方法都在渐进改良。但它们有一个共同缺陷:数据质量无法被直接控制。Meta FAIR 提出了 Autodata——把"造数据"本身变成 agent 闭环,让 AI 扮演数据科学家角色,迭代生成、分析、改进数据配方。数据科学家本身还能被元优化,越造越强。
Autodata 框架
内循环是经典数据科学工作流:agent 基于给定材料(论文、法律文本等)生成数据,然后逐条和整体分析质量,提炼经验反馈给生成环节。外循环则用同样的标准(造出的数据好不好)来优化 agent 本身的 prompt 和行为。本质是"用推理计算换训练数据质量"。
四子 Agent 架构:Agentic Self-Instruct
具体实现采用四子 agent 架构:Challenger 生成训练样本,Weak Solver(弱模型)和 Strong Solver(强模型,可用同一模型但配更多推理计算)分别作答,Judge 评估质量。核心控制逻辑:要求 strong solver 多数投票正确且 weak solver 多数投票失败,确保数据难度恰到好处。
实验:三个领域全面验证
CS 研究问答
Agentic Self-Instruct 造出的数据将 weak solver 正确率从 67.7% 压到 45.8%,strong solver 从 69.6% 升到 77.2%,gap 从 1.9% 拉到 31.4%。用这些数据 RL 训练 Qwen3.5-4B:
| CoT 测试集 | Agentic 测试集 | |||
|---|---|---|---|---|
| 模型 | mean@3 | best@3 | mean@3 | best@3 |
| Base (无额外 RL) | 63.0% | 75.8% | 36.6% | 48.4% |
| RL on CoT Self-Instruct | 72.7% | 85.3% | 50.0% | 63.1% |
| RL on Agentic Self-Instruct | 77.4% | 89.4% | 63.2% | 76.8% |
法律推理
Qwen3.5-4B 在 Legal-Hard 上从 base 的 14.5% 提升到 Agentic RL 后的 32.9%,对比 CoT Self-Instruct 的 23.3%。
科学推理(Principia)
| Base | CoT Self-Instruct | Agentic Self-Instruct | |
|---|---|---|---|
| Overall (avg@8) | 68.66% | 71.08% (+2.42) | 71.86% (+3.20) |
| Agentic 子集 | 52.39% | 56.33% (+3.94) | 56.79% (+4.40) |
元优化:数据科学家也能自我进化
CS 任务上,元优化 124 次迭代后验证集 pass rate 从 62.1% 提升到 79.6%。错误分析显示主要减少了 grounding 失败和回答截断——agent 学会了造更可控难度的题目。