Back to Blog Untitled

Untitled

Paper

Self-Instruct 开创了用 LLM 造训练数据的范式,后续的 Grounded、CoT、self-challenging 方法都在渐进改良。但它们有一个共同缺陷:数据质量无法被直接控制。Meta FAIR 提出了 Autodata——把"造数据"本身变成 agent 闭环,让 AI 扮演数据科学家角色,迭代生成、分析、改进数据配方。数据科学家本身还能被元优化,越造越强。

Autodata 框架

Autodata pipeline
Figure 1: Autodata pipeline:agent 扮演数据科学家,内循环迭代生成和分析数据,外循环元优化 agent 本身。

内循环是经典数据科学工作流:agent 基于给定材料(论文、法律文本等)生成数据,然后逐条和整体分析质量,提炼经验反馈给生成环节。外循环则用同样的标准(造出的数据好不好)来优化 agent 本身的 prompt 和行为。本质是"用推理计算换训练数据质量"。

四子 Agent 架构:Agentic Self-Instruct

Agentic Self-Instruct
Figure 2: Weak-vs-strong Agentic Self-Instruct method:Challenger 造题 → Weak/Strong Solver 作答 → Judge 评估 → 主 Agent 调整。

具体实现采用四子 agent 架构:Challenger 生成训练样本,Weak Solver(弱模型)和 Strong Solver(强模型,可用同一模型但配更多推理计算)分别作答,Judge 评估质量。核心控制逻辑:要求 strong solver 多数投票正确且 weak solver 多数投票失败,确保数据难度恰到好处。

CS pipeline example
Figure 4: CS research question creation example:CS 研究问答的完整数据生成示例。

实验:三个领域全面验证

CS 研究问答

Agentic Self-Instruct 造出的数据将 weak solver 正确率从 67.7% 压到 45.8%,strong solver 从 69.6% 升到 77.2%,gap 从 1.9% 拉到 31.4%。用这些数据 RL 训练 Qwen3.5-4B:

CoT 测试集 Agentic 测试集
模型 mean@3 best@3 mean@3 best@3
Base (无额外 RL) 63.0% 75.8% 36.6% 48.4%
RL on CoT Self-Instruct 72.7% 85.3% 50.0% 63.1%
RL on Agentic Self-Instruct 77.4% 89.4% 63.2% 76.8%
CS RL training
Figure 3: CS RL training dynamics:两种数据的 RL 训练动态对比。

法律推理

Legal RL training
Figure 5: Legal reasoning RL training dynamics:法律推理任务上 Agentic 数据 RL 训练效果优于 CoT Self-Instruct。

Qwen3.5-4B 在 Legal-Hard 上从 base 的 14.5% 提升到 Agentic RL 后的 32.9%,对比 CoT Self-Instruct 的 23.3%。

科学推理(Principia)

Base CoT Self-Instruct Agentic Self-Instruct
Overall (avg@8) 68.66% 71.08% (+2.42) 71.86% (+3.20)
Agentic 子集 52.39% 56.33% (+3.94) 56.79% (+4.40)

元优化:数据科学家也能自我进化

Meta optimization
Figure 6: Meta-optimization of the data scientist agent:外循环分析 agent 的失败轨迹(如 context leakage),系统性地改进 prompt。

CS 任务上,元优化 124 次迭代后验证集 pass rate 从 62.1% 提升到 79.6%。错误分析显示主要减少了 grounding 失败和回答截断——agent 学会了造更可控难度的题目。

这篇论文的本质贡献不在某个具体技巧,而在把数据工程的闭环自动化了。更深远的意义是打开了"推理计算 → 训练数据 → 模型能力"的飞轮。Karpathy 的 autoresearch 关注架构和训练配方优化,这篇则说:数据本身可能才是最值得自动化的那个环节。
Tags: #2026-06-26 合成数据 Agentic Meta-Optimization Meta FAIR