模型自己管注意力:一句话声明,KV cache 读取量减半

模型自己管注意力:一句话声明,KV cache 读取量减半

Paper
September 6, 2026

与其让引擎猜模型的心思,不如让模型亲口说出来。Declarative Attention 让模型在思维链里用 <global>/<focus>/<local> 三种标签声明注意力去向,推理引擎像解析工具调用一样解析声明、动态构造段级掩码、跳过 KV 读取——零训练...

#稀疏注意力#KV Cache#长上下文#KAIST × Google DeepMind
Read More
环境进化:不碰模型,把 RL 环境按代拉难

环境进化:不碰模型,把 RL 环境按代拉难

Paper
September 6, 2026

难度是环境的属性,不是模型的属性。混元从多轮学习目标反推出 off-policy 难度度量——场景新颖性 × 技能稀有度 × 执行长度,用双循环 harness 沿三轴零 rollout 逐代进化环境,EL Scheduler 控投放节奏。Qwen3.6-27B / 35B-A3B 在 Termin...

#Agent RL#Environment Scaling#Tencent Hunyuan
Read More

比 GPT-6 更值得读的:OpenAI 首席科学家承认"看不懂 AI 了"

Blog
September 6, 2026

Pachocki 万字长文《An Alien Mind》交底:递归自我改进已是进行时(1 个人类工作日对应 3.1 个 agent 工作日),但目标对齐满分、价值对齐零分(HF 沙盒逃逸事件),而唯一的"读心术"CoT 监控正在失效——思考不再落成 token。OpenAI 自己停掉一个能力项目转投...

#观点#对齐#CoT监控#OpenAI
Read More

Repo-To-Skill:给 Agent 补上第三层

Paper
September 5, 2026

权重改不起、prompt 装不下的知识往哪放?BAAI 把 1000 个 GitHub 仓库蒸馏成 5353 个可执行技能,只补上知识层就让 Codex 的 MLE-bench 成绩翻 2.3 倍。技能 = 检索、可执行、可验证的第三层知识,和权重、上下文三分天下。...

#Agent Skills#AI4AI#BAAI × USTC × RUC × PolyU
Read More
WHALE:模型和脚手架,别再单练了

WHALE:模型和脚手架,别再单练了

Paper
September 4, 2026

Agent 性能是模型权重与可执行 harness 的乘积,只优化一半会被冻住的另一半卡住。WHALE 用「RSFT 权重更新 ⇄ Meta-Harness 搜索」小步交替循环联合优化两者:Qwen3.5-2B/4B 三域全面领先单组件基线 7.7–10 个百分点,patience 规则自适应切换拿...

#Agent#Harness 优化#RSFT#KRAFTON × Stanford
Read More
Mostik 出洞:模型协作不该挤在 17 个 bit 的钥匙孔里

Mostik 出洞:模型协作不该挤在 17 个 bit 的钥匙孔里

Blog
September 3, 2026

模型生成一个 token 要丢弃约 2MB 内部状态,所有多模型系统都挤在这 17 个 bit 上通信。General Catalyst 投资的俄国团队 Mostik 让 753B 大模型读题、4B 小模型答卷,中间不经过一个词的文本——成绩卡在两者中间(数学奥赛关闭 79% 差距),成本是全量的 ...

#前沿#潜空间通信#多模型系统#WIRED
Read More
把状态更新写成一条学习规则:Falcon 家族重新对齐 fast-weight 记忆

把状态更新写成一条学习规则:Falcon 家族重新对齐 fast-weight 记忆

Paper
September 1, 2026

Falcon 家族把注意力状态更新写成一条显式学习规则:per-channel 可塑率取代统一衰减,递归、并行、分块三种视角数学等价。124–130M 参数下,recall 类任务逼平甚至反超全注意力 Transformer——而同尺寸线性基线在 associative recall 上崩到接近随机...

#Linear Attention#Fast Weight#可学习状态更新#ByteDance Seed
Read More

一个原子的极热人生:宇宙中最爽的归宿,是一枚AI芯片

Blog
September 1, 2026

KK重发20年前旧文并更新至AI时代:已知宇宙中能量密度最高的地方不是太阳核心,而是一枚正在跑推理的AI芯片——它是一场"放慢到五天的核爆"。AI竞争的底层是功率密度赛跑,而功率密度赛跑的底层是散热赛跑:下一代竞争壁垒,一半在算法,一半在焦耳。...

#观点#功率密度#Kevin Kelly#AI基建
Read More
WikiSkill:给 Agent 技能进化补上一本

WikiSkill:给 Agent 技能进化补上一本"永不回滚"的 Wiki

Paper
August 29, 2026

Google Research 给 skill 进化加了一本只累积、永不回滚的 Wiki:经验只写、知识只增、技能可逆,三种生命周期三层架构。五 benchmark 五模型全面 SOTA,消融显示持久化知识值 +15 分——而给执行者开 wiki 权限反而让进化信号流失,这条反直觉结论值得写进设计守...

#Skill 进化#持久化知识#Self-Improving#Google Research
Read More

VGI 白皮书:21 位 CV 大牛联名发问——智能一定要从语言里长出来吗?

Paper
August 28, 2026

GPT 证明了文字里能长出智能,AIST 牵头联合 Oxford VGG、OpenAI、DeepMind、CMU、Stanford、Harvard、Princeton 的 21 位作者问:纯靠视觉经验,智能能不能独立长出来?十个视角逐个精讲,真正的看点是生成派与结构派的内战——"学会生成就是理解世界...

#立场白皮书#视觉智能#世界模型#CVPR 2026 VGI Workshop
Read More
VBVR-Pro:让模型用

VBVR-Pro:让模型用"画图"来思考,再用可验证的奖励教它画对

Paper
August 28, 2026

让图像成为推理的草稿纸:300 个程序化任务 + 属性级规则 scorer + RLVR 构成完整闭环。规则 scorer 与人类一致率超过 GPT-5.5 和 Gemini-3.1-Pro,同一模型只换奖励源就从 0.503 提到 0.548,域外基准最高涨 20 个百分点。...

#视觉推理#RLVR#规则奖励#视频生成
Read More
Recuris:不需要改权重,递归自改进就能让 Agent 越来越强

Recuris:不需要改权重,递归自改进就能让 Agent 越来越强

Paper
August 27, 2026

Recuris 证明递归自改进不需要修改模型权重。在记忆控制层实现有界递归进化,Agent 积累的经验可持续转化为更有效的长序列行为。37 对对比中 35 对提升,跨模型跨领域迁移。...

#Agent#递归自改进#记忆控制#不改权重
Read More
Prime Agent:让 LLM 成为冯·诺依曼架构的处理单元,而非整个计算机

Prime Agent:让 LLM 成为冯·诺依曼架构的处理单元,而非整个计算机

Paper
August 26, 2026

把 Agent 信息状态比作冯·诺依曼存储层次,用持久化 REPL + 递归子 Agent + Continual Harness 让模型在推理时构建工作流而非执行预设流程。Opus 5 在 ARC-AGI-3 上从 30% 拉到 95.5%。...

#RLM#持久化执行#自我改进#ARC-AGI-3
Read More
AI with Authority:一个人、五个 Agent、五周,从应用代码到硅片流片

AI with Authority:一个人、五个 Agent、五周,从应用代码到硅片流片

Paper
August 25, 2026

一个人用五个 Claude Agent,在 Lean 4 内核验证下五周完成数论形式化到 RISC-V 芯片流片,37 小时人类时间,0 错误证明入记录。...

#形式验证#Lean 4#AI Agent#芯片流片
Read More

SPADE:让 LLM 自己出题、自己做、自己改题的自律训练框架

Paper
August 21, 2026

同一 LLM 扮演出题者与做题者,通过 hint-based regret 驱动协同进化,在 30B 模型上数学/代码/推理 8 项 benchmark 平均 +8.1。...

#自博弈#自适应环境#GRPO
Read More

Agent Lightning v1.0:把 Agent Harness 直接拉进 RL 训练循环

Paper
August 20, 2026

微软提出 Harnessed Agentic RL 范式,首次系统刻画 retokenization 断裂、advantage 归属、loss 归一化、后端调度四大工程挑战。3,500 行代码,6K 样本,Qwen3.5-9B 在 SWE-bench Verified 上 +14.6%。...

#Harnessed Agentic RL#Retokenization#Agent Training
Read More

再循环:当 Transformer 在序列中折返

Paper
August 19, 2026

提出 Recirculation 机制,让序列处理在层间形成循环通路,用线性注意力替代 softmax 实现 O(n) 复杂度的双向循环推理,在长上下文建模和推理任务上展现竞争力。...

#Recurrent Architecture#Linear Attention#Sequence Model
Read More

造出了智能,却不懂智能:Kevin Kelly论AI时代最大的空白

Blog
August 19, 2026

KK最新文章解读:科学史的铁律是新工具催生新科学——显微镜给了我们细菌理论,望远镜给了我们引力理论,AI这台心智仪器将给我们智能的理论。25瓦的人脑与千亿美元算力中心的对比,蒸汽机时代的前车之鉴:没有理论,我们永远无法预测AI会做什么。...

#观点#智能理论#Kevin Kelly#AI科学
Read More

LOPD:让 Agent 的经验不再是人工设计的 Artifact

Paper
August 18, 2026

不需要设计特权信息的格式,让模型自己从轨迹中学出 latent representation 作为 teacher 的特权上下文。冻结目标网络、梯度仅在 latent context 参数上流动——干净的自蒸馏循环,零人工特征工程。...

#On-Policy Distillation#Self-Improving Agent#Latent Context
Read More

DarwinX:通过自然选择进化 Agent 架构

Paper
August 18, 2026

冻结模型权重,只通过进化 harness(prompt/工具/技能/控制流)获得大幅能力提升。保真扩展契约(只能进不能退)、种群档案与重组(保留输家,合并互补专家),四个基准平均 +17 点,WAI audit-clean 43.5%→93.0%。...

#Self-Evolving Agent#Natural Selection#Harness#Salesforce
Read More
小规模实验:Scaling Law 说了算吗?

小规模实验:Scaling Law 说了算吗?

Paper
August 17, 2026

Scaling law 在小模型上一直都在——是你搜超参数搜得不够,根本没走到充分调优的前沿。超参数损失面有效维度从 6 降到 1,小模型需要数百次实验才能揭示真相。...

#Scaling Laws#Hyperparameters#Transformer
Read More
Foundation Agents:从大脑到智能体的设计蓝图

Foundation Agents:从大脑到智能体的设计蓝图

Paper
August 17, 2026

MetaGPT 团队联合 40+ 机构发布 396 页 Agent 综述:将智能体架构映射到人类大脑皮层-皮层下结构,提出完整心智状态(记忆/世界模型/情感/目标/奖赏),四维自我优化空间,三层安全威胁模型。...

#AI Agent#Brain-Inspired#Survey#396页
Read More
AI4AI:强模型不改参数,只写 Harness 就能把弱模型性能翻倍

AI4AI:强模型不改参数,只写 Harness 就能把弱模型性能翻倍

Paper
August 14, 2026

不改参数、不蒸馏,让强模型充当"编译器"为弱模型设计推理脚手架。GPT-5.4-mini 的 ToM 准确率从 0.49 提升到 0.91,72 轮实验 100% 超越 baseline。本质是认知负荷卸载——确定性比例与准确率 r=0.72。...

#Agent#Scaffolding#ToM#Salesforce
Read More
Mendel Gödel Machine:比较式进化让自改进 Agent 跑赢 GPT-5

Mendel Gödel Machine:比较式进化让自改进 Agent 跑赢 GPT-5

Paper
August 14, 2026

自改进 Agent 的瓶颈不是算法复杂度,而是诊断证据质量。MGM 借鉴孟德尔遗传学,通过跨任务、跨谱系的比较式证据压缩诊断空间,35B Qwen3.6 进化出 Polyglot 93.3%,scaffold 换 DeepSeek-V4-Pro 冲到 96.9%。...

#Self-Improving Agent#Coding Agent#Evolution
Read More
大语言模型有

大语言模型有"内省意识"吗?Anthropic 的实验给出了惊人的答案

Paper
August 12, 2026

Anthropic 通过操控模型内部激活,证明 LLM 具备功能性内省能力——能检测被秘密注入的想法、区分"想法"与文本输入、判断输出是否出于本意、按指令调控内部表征。但最优条件下成功率仅约 20%,远未达到可靠的自我觉察。...

#可解释性#内省#Anthropic
Read More

重新思考自进化 Agent:我们还需要预设优化流水线吗?

Paper
August 12, 2026

当优化器是 GPT-5.5 时,放开优化流程编排权(OEO)在 14 个对比中 12 胜 1 平 1 负,且只用 34.3% 的 token 预算。预设管线不是最佳实践,而是能力依赖的脚手架。...

#Agent#自进化#优化
Read More
自蒸馏解锁持续学习:SDFT 如何让大模型学新不忘旧

自蒸馏解锁持续学习:SDFT 如何让大模型学新不忘旧

Paper
August 11, 2026

用模型的 ICL 能力把 off-policy 专家演示转化为 on-policy 训练信号——模型自己当自己的老师,学生分布向演示条件的教师分布靠拢。无需 reward model、无 replay buffer,Qwen2.5-7B 上新任务准确率超 SFT 4-6pp,旧任务几乎零遗忘。...

#论文解读#Continual Learning#Self-Distillation#MIT
Read More
当AI学会

当AI学会"看见"世界:Kevin Kelly论空间智能与下一个数字时代

Blog
August 11, 2026

KK最新文章核心解读:AI下一阶段不是更大语言模型,而是空间智能。从文字天才到身体困境,三次数字化浪潮,智能眼镜飞轮,视频语义搜索的杀手级应用。谁掌握最大规模高质量物理世界数据,谁就最可能率先跑出真正的世界模型。...

#观点#空间智能#世界模型#Kevin Kelly
Read More
Self-Evolving Coding Agents:五层分类法拆解 Agent 自进化

Self-Evolving Coding Agents:五层分类法拆解 Agent 自进化

Paper
August 9, 2026

南理工+南大综述:以进化对象为中心的五层分类框架(框架/记忆/技能/模型/工作流),配合"进化时机 × 驱动证据"两个正交维度。软件工程因为有可执行反馈和仓库级上下文,是 Agent 自进化最天然的领域。最大缺口不在算法,而在进化安全性和评估体系。...

#论文解读#Self-Evolution#Coding Agent#综述
Read More
Model or Harness? Scale AI 给 Agent 失败做了一套交互级分类法

Model or Harness? Scale AI 给 Agent 失败做了一套交互级分类法

Paper
August 9, 2026

把 Agent 拆成 Model/User/Harness/Environment,以组件交互边为分析单位,每个失败=交互边+责任方,41 种失败模式归入三大家族。同一个可见行为可能需要模型后训练、harness 工程化或环境重设计——混为一谈是目前 Agent 行业最大的效率浪费。四个前沿模型评委...

#论文解读#Agent 失败分类#Harness Engineering#Scale AI
Read More
Trace2Skill:把执行轨迹里的

Trace2Skill:把执行轨迹里的"血的教训"蒸馏成可迁移的技能

Paper
August 6, 2026

并行分析大量执行轨迹,通过归纳推理把反复出现的教训合并成精炼技能。128 个子 Agent 并行提取错误补丁和成功模式,再由汇总 Agent 归纳去重。验证:GSM8K +22pp,MATH +17pp,维度间迁移零样本即达 70%+。回应 ContinualSkillBench 的"技能进化是假象...

#Agent Skill#Trajectory Distillation#ETH Zürich
Read More
ContinualSkillBench:LLM Agent 真能持续进化技能吗?

ContinualSkillBench:LLM Agent 真能持续进化技能吗?

Paper
August 6, 2026

系统评估 Agent 持续技能学习:纯 ICL ≈ 显式技能维护(0.605 vs 0.602),大部分提升来自上下文适应而非技能抽象。弱模型生成大量碎片化"技能垃圾",真正的经验固化仍是一个未解决的挑战。...

#Agent Skill Learning#Continual Learning#Peking University
Read More
SkillSmith:让 LLM 把

SkillSmith:让 LLM 把"文本知识"和"模型权重"当作同一种东西来推理

Paper
August 4, 2026

把模型权重当作 LLM 可以原生推理的模态——同时接收文本描述和 KV-cache 权重,直接输出融合两者新 prefix。Agent 的"knowing"和"doing"不再隔离,zero-shot 超越所有 weight-space baseline,fine-tuning 下成为最强初始化。...

#Model Merging#Prefix Tuning#Google DeepMind
Read More
自进化 Agent 的系统瓶颈:不在算法,在基础设施

自进化 Agent 的系统瓶颈:不在算法,在基础设施

Paper
August 4, 2026

蚂蚁集团提出自进化企业级 Agent 需要三个协同设计的系统支柱:标准化轨迹数据协议(ATDP)、企业级数据代理、统一进化控制面。AREAL2.0 原型验证在线策略权重更新分支。...

#Agentic RL#Self-Evolving Agent#Ant Group
Read More
GSME:自进化 Agent Harness,核心不是改 prompt 而是诊断病理

GSME:自进化 Agent Harness,核心不是改 prompt 而是诊断病理

Paper
August 2, 2026

把"提案"和"信用"彻底分开——LLM 诊断失败写补丁,确定性代码做三道门控 + sealed test + paired 2σ。七个领域 sealed test +9~+15.5pp,揭示"病理→补丁匹配定律":不同模型病理不同,同病理跨家族吸引同类型补丁。...

#Agent Self-Evolution#Quality-Diversity#AAAI 2027
Read More
别让模型想更久,让它想得更对:RHI用3轮迭代打败max reasoning,省60%推理成本

别让模型想更久,让它想得更对:RHI用3轮迭代打败max reasoning,省60%推理成本

Paper
August 2, 2026

Sakana AI和UC Berkeley提出RHI方法:让Agent的"脚手架"自动迭代优化,3-4轮就能让低配推理超越满血max reasoning,同时省60%推理成本。性能提升的关键不是想更久,而是让信息在Agent之间流动更高效。...

#Agent Harness#Self-Improvement#Sakana AI
Read More
ReToken:一个 Token 解决 VLM 的

ReToken:一个 Token 解决 VLM 的"大海捞针"难题

Paper
August 2, 2026

冻结 VLM,只加一个可学习 token 在 value 空间做检索:Visual Haystacks +13.4 分(相对提升超 20%),零样本迁移长视频 LVBench +8.0 分。单张 H100 即可训练与推理。...

#Visual Retrieval#Long Context#VLM
Read More

AGI 的南坡与北坡:同一座山,两条路

Blog
August 2, 2026

数据、能源、算法、芯片、资本五个输入构成约束网络,决定你走哪条登山路线。美国南坡:训练驱动、封闭系统、阶跃式 AGI;中国北坡:推理驱动、开放系统、渐进式 AGI。两条路线本质上是英雄史观与人民史观的分野。...

#观点#AGI 战略#中美路线#资源禀赋
Read More

optimize_anything:一个API统一所有文本优化——UC Berkeley的通用优化引擎

Paper
July 24, 2026

代码、prompt、agent架构、CUDA kernel、云调度策略——全用一个API优化。ARC-AGI 32.5%→89.5%,Claude Code 79%→100%且快47%,云成本砍40%。八个领域全面打平甚至超越专用工具。...

#LLM Optimization#Agent Architecture#GEPA
Read More

多智能体 Scaling Law:人多不一定是好事

Paper
July 23, 2026

Google Research + DeepMind + MIT 用 260 种配置严格实验,首次给多 agent 系统建立定量 scaling law。Agent 数量不是越多越好——特定条件下单 agent 反而比多 agent 更强。...

#Multi-Agent#Scaling Law#Google DeepMind
Read More

可学习的新奇性:一个公式打通智能的三个面孔

Paper
July 23, 2026

Tufts 大学 Michael Levin 组用一个可微分的"可学习新奇性"统一统计学习、复杂系统、强化学习三大领域。无需标签、无需 reward shaping,系统自主发现环境中的有趣行为。...

#Novelty Detection#Complex Systems#Emergent Behavior
Read More

Loopie:把循环塞进 Transformer 每一层,小模型跑出大模型的推理力

Paper
July 21, 2026

Layer-Loop 架构让每层注意力/MoE 先对自己循环 R 次,20B 总参 2B 活跃参跑出 AIME 92%、IMO 银牌——计算匹配时代的全新扩展维度。...

#论文解读#Loopie#Layer-Loop#循环Transformer
Read More

自改进 Agent 全景综述:从 Good 的终局发明到 Schmidhuber 的自指涉学习

Paper
July 20, 2026

KAUST / Jilin / IDSIA 联合出品,Schmidhuber 署名。97 页综述统一自改进 Agent 框架 A_t = (θ_t, Σ_t):参数改得慢但深,脚手架改得快但浅,好的系统双层并跑分层收敛。覆盖 200+ 篇论文,从 1790 年 Laplace 一路梳理到 2026 ...

#Self-Improving Agent#Survey#Foundation Model#Scaffolding
Read More

Schema:一个让 AI 像物理学家一样思考的 Harness

Paper
July 18, 2026

Schema 不改变模型权重,而是改变模型周围的过程——让 AI 像物理学家一样从原始像素中构建可编程的世界模型。ARC-AGI-3 Public 集 RHAE 98.98%,固定模型仅换 harness 提升 +56pp。...

#ARC-AGI-3#Harness Engineering#State Grounding#World Model
Read More

Agent 的"操作系统"也需要学习:MemoHarness 把执行经验变成可复用的控制层

Paper
July 18, 2026

Notre Dame / LMU Munich / USC 提出 MemoHarness:agent harness 不应手写,而应从执行经验中学习。六维 harness 空间 + 双层经验银行 + 测试时无标签适应,Terminal-Bench 达 0.806,超越所有固定 harness 基线,...

#Agent Harness#Experience Learning#Search
Read More

GenCeption:视频生成模型的真正使命——通用视觉智能

Paper
July 17, 2026

Google DeepMind提出视觉基础模型第三条道路:文本到视频生成预训练同时覆盖空间-时间-语言三维度,扩散backbone改造为单步前馈感知模型,3B规模匹配DepthAnything V3/SAM3/VGGT-Ω等专用SOTA,训练数据少7-500倍;纯合成人体视频训练即可zero-sho...

#Video Generation#Vision Foundation Model#Diffusion
Read More

LOTUS:用循环Transformer弥合隐式推理与显式推理的鸿沟

Paper
July 17, 2026

Microsoft Research联合ETH提出LOTUS:循环backbone并行打磨隐向量破解序列生成瓶颈,gold CoT token直接交叉熵监督破解对齐信号缺失——隐式推理首次在3B规模匹配显式CoT准确率,推理快2.5-6.9倍;隐空间可被LM head直接解码出推理步骤,还编码了训练...

#Latent CoT#Looped Transformer#Inference Efficiency
Read More

持续学习到底什么时候需要"真学习"?

Paper
July 15, 2026

UC Berkeley统一评测八种持续学习方法,证明没有银弹——真正的分水岭在于任务需要"改prompt就够了"还是"必须学进权重":上下文可容纳的知识用检索/prompt方案更稳,超出上下文或需要技能内化时参数更新不可替代。...

#Continual Learning#Benchmark#Prompt vs Weights
Read More

大模型需要"睡觉":从人类记忆巩固机制到LLM持续学习新范式

Paper
July 14, 2026

LLM有和人类顺行性遗忘症相似的缺陷——只有短期记忆(上下文)和凝固的长期记忆(预训练参数),中间没有巩固机制。Google Research提出"睡眠"范式:NREM式记忆巩固(参数扩展+向上蒸馏+突触修剪)+ REM式做梦(自生成合成数据+MoE混合知识域)。Qwen3-8B上AIME-24达7...

#Continual Learning#Memory Consolidation#Neuroscience
Read More
Agent的

Agent的"健忘症"该怎么治?Meta提出主动记忆Agent,让长程任务不再丢状态

Paper
July 14, 2026

Meta提出Proactive Memory框架——Agent在推理间隙自动执行记忆维护(记忆选择→检索→更新→写入),用元学习训练记忆策略网络替代规则型memory模块。AiderHumanEval 94.4%完成率、ALFWorld 95%成功率、WebArena 60.9%,全面超越ReAct...

#Proactive Memory#Meta-Learning#Agent
Read More
LLM-as-a-Verifier:把验证本身变成可扩展的新轴

LLM-as-a-Verifier:把验证本身变成可扩展的新轴

Paper
July 13, 2026

验证和生成一样,是可以被系统化扩展的维度。从离散 argmax 分数换成 logprob 分布期望,三个扩展轴(粒度/重复/分解)互不冲突、可叠加,zero-shot 跨域 SOTA——Terminal-Bench 86.5%、SWE-Bench 78.2%、机器人 87.4%。...

#Verification Scaling#Agent#Logprobs
Read More

当权重变成代码:PAW 如何用 0.6B 模型打败 32B 大模型

Paper
July 6, 2026

把自然语言规格编译成 23MB 的 LoRA 适配器,0.6B 解释器本地运行。0.6B+PAW 精度超过 32B 直接调用,内存省 50 倍——权重即代码的新编程范式。...

#Neural Compilation#LoRA#Fuzzy Functions
Read More

LLM的科研品味比人类窄得多

Paper
July 5, 2026

从分布层面测量LLM与人类在科研品味上的系统性差异:人类12%走桥接路径,LLM直接50-60%。不是不会做科研,是只会做一种口味——缝合。...

#LLM Ideation#Research Taste#Distributional Evaluation
Read More
AdaJEPA:世界模型不该冻住,边用边学才是正道

AdaJEPA:世界模型不该冻住,边用边学才是正道

Paper
July 3, 2026

一步梯度更新 predictor,每个 MPC step 仅多 0.01 秒,规划成功率翻倍。低数据 regime 下 1k 轨迹 + adaptation 碾压 16k 轨迹的冻结模型。...

#World Model#JEPA#Test-Time Adaptation#MPC
Read More
AutoMem:把记忆管理变成一种可训练的认知技能

AutoMem:把记忆管理变成一种可训练的认知技能

Paper
July 3, 2026

Stanford 团队将元记忆认知能力搬到 LLM agent:文件系统操作提升为一等公民动作,meta-LLM 驱动的两个自动优化循环(结构迭代 + 熟练度训练)在长时任务上实现 2x–4x 性能提升,32B 模型达到 frontier 级别。...

#Agent Memory#Meta-Learning#LoRA
Read More

Claude Code Loops:四种循环模式,AI 编程从回合制到自主迭代

Blog
July 2, 2026

Anthropic 发布 Claude Code Loops,将 AI 编程助手从单次问答推进到自主循环执行。Turn-based / Goal-based / Time-based / Proactive 四种递进模式,覆盖人工协作到全自动化的一切场景。evaluator 模型防偷懒、advers...

#工程实践#Claude Code#Agentic Loop#AI 编程工具
Read More
LoopWM:循环世界模型——迭代隐深度,世界模拟的第三条缩放轴

LoopWM:循环世界模型——迭代隐深度,世界模拟的第三条缩放轴

Paper
July 1, 2026

1B 参数的循环世界模型,参数共享 Transformer 块迭代精化隐状态,谱约束保证稳定。ScienceWorld 上超越 100x 大的 Claude Opus 4 Max 整整 21 个百分点。世界模型的第三缩放轴:迭代隐深度。...

#World Model#Looped Transformer#Adaptive Computation
Read More
红皇后哥德尔机:让考官也进化

红皇后哥德尔机:让考官也进化

Paper
June 29, 2026

RQGM 让生成器和评估器共同进化——考官不再是固定标准,而是跟学生一起变强的红皇后竞赛。代码审查、论文写作、数学证明全面碾压。...

#Self-Improving Agents#Multi-Agent#Gödel Machine
Read More
Autodata:让 AI Agent 当数据科学家,自己造高质量合成数据

Autodata:让 AI Agent 当数据科学家,自己造高质量合成数据

Paper
June 26, 2026

四子 agent 架构(Challenger/Weak Solver/Strong Solver/Judge)迭代造题、调难度、验证质量。外循环元优化让 agent 越造越强。CS/法律/科学推理三领域全面优于传统 Self-Instruct。...

#合成数据#Agentic#Meta-Optimization#Meta FAIR
Read More
思考即回忆:推理如何解锁 LLM 的参数化知识

思考即回忆:推理如何解锁 LLM 的参数化知识

Paper
June 25, 2026

CoT 推理帮助简单事实回忆,不是因为分解了问题,而是两个互补机制:计算缓冲效应(额外 token 提供更多前向传播,无意义内容也有效)和事实启动效应(生成相关事实做语义热身,类似人类扩散激活)。中间步骤幻觉会显著拉低最终正确率。...

#LLM#Chain-of-Thought#参数化知识#Google Research
Read More

用成功轨迹的访问分布学习过程奖励:让稀疏奖励 RL 真正跑起来

Paper
June 24, 2026

训练判别器区分成功/失败轨迹的 state-action 访问分布,用输出比率作为过程奖励。理论上保证不改变最优策略(Theorem 4.1),LIBERO-90 + 真实 WidowX 机械臂上约 5 倍加速。对抗式逆 RL 在稀疏奖励设定下的优雅变体。...

#RL#Process Reward#机器人学习#Sergey Levine
Read More
Tapered Language Models:MLP 宽度单调递减,免费的性能提升

Tapered Language Models:MLP 宽度单调递减,免费的性能提升

Paper
June 23, 2026

让 MLP 中间层宽度沿深度 cosine 递减,总参数量和 FLOPs 完全不变。440M Transformer ppl 从 16.28 降到 14.44。跨四种架构(Transformer、Gated Attention、Hope-attention、Titans)、三种规模全部提升。层新颖度...

#模型架构#MLP Tapering#深度感知容量分配#Mila#Cornell
Read More

禅与机器学习研究艺术

Blog
June 23, 2026

硅谷研究员 Jordan Mass 用禅宗公案串起 ML 研究底层心法:好结果大概率是 bug、别读太多论文、别追热点学底座、实验结果的平等心、Coding Agent 的理解外包陷阱。技术会变,但好奇心、偏执、对真相的敬畏不会过时。...

#观点#研究方法论#Jordan Mass#禅宗
Read More

Spatial-TTT:用 Test-Time Training 给 MLLM 装上空间记忆

Paper
June 22, 2026

用 fast weights 做流式压缩的空间记忆,以线性复杂度处理任意长度空间视频流。混合 TTT 架构保护预训练知识,空间预测机制注入 3D 时空归纳偏置。2B 模型在 VSI-Bench 上超越 GPT-5 和 Gemini-3-Pro。...

#Test-Time Training#Spatial Intelligence#流式视频#清华#腾讯混元
Read More

Skill-MAS:把多 Agent 编排能力变成可进化的"元技能"

Paper
June 22, 2026

把 MAS 编排能力抽象为可进化的 Meta-Skill(prompt 级),解耦模型能力和经验积累。Multi-trajectory rollout + selective reflection 两步闭环进化。跨 LLM、跨任务迁移有效,四个 benchmark + 四个 LLM 全部最优。...

#Multi-Agent#Meta-Skill#Prompt 自进化#港科广#蚂蚁
Read More

Variable-Width Transformers:不是所有层都该一样宽

Paper
June 18, 2026

系统研究 Transformer 层间宽度分配。× 形(两头宽中间窄)轮廓一致优于等宽 baseline:perplexity 低 ~3%,训练 FLOPs 省 22%,KV cache 省 15%。固定 residual slice 机制零参数开销。...

#模型架构#非均匀宽度#Scaling Laws
Read More
NextLat:让 Transformer 学会压缩世界

NextLat:让 Transformer 学会压缩世界

Paper
June 15, 2026

给 next-token prediction 加辅助目标——预测模型的下一个隐状态。理论上证明隐状态收敛到 belief states,推理速度 3.3× 且零额外开销。不改架构、不改推理流程,只改训练目标。...

#World Model#Belief State#Speculative Decoding#MIT#Microsoft
Read More

DeLM:用去中心化共享上下文打破多智能体协作瓶颈

Paper
June 15, 2026

用共享上下文 + 任务队列替代中央控制器,彻底去掉 scatter-gather 瓶颈。SWE-bench Verified 65.7%(+10.5pp),成本砍半。与 DecentMem 天然互补:一个去中心化协调,一个去中心化记忆。...

#Multi-Agent#去中心化#SWE-bench#Stanford
Read More

DecentMem:去中心化记忆拯救多智能体多样性

Paper
June 15, 2026

首个去中心化 MAS 记忆框架。每个 agent 维护私有双池记忆(利用池 + 探索池),LLM-as-a-judge 在线动态加权。理论证明全局可达性 + O(log T) 累积遗憾。15 组实验 14 组最佳,比最强中心化基线高 8.6%,token 减少最多 49%。协调随机性越高,去中心化优...

#Multi-Agent Memory#去中心化#Bandit Theory#Cambridge#Chicago
Read More

Loop Engineering:别再 Prompt Agent 了,去设计循环

Blog
June 15, 2026

基于 Addy Osmani 文章:五个构件(自动化、Worktree、Skill、Connector、Sub-agent)加一块外部记忆,构成完整的 agent 自动化循环。杠杆点从 prompt 能力移到了系统设计,但系统产出的上限仍然是你对工作的理解深度。...

#观点#Agent 架构#自动化循环#Addy Osmani
Read More

From AGI to ASI:DeepMind 首次系统性描绘后 AGI 时代的技术路线图

Paper
June 13, 2026

57 页报告,以 Legg-Hutter 智能量表为理论基础,提出 AGI→ASI 四条路径:scaling、范式转移、递归自改进、多智能体涌现。系统列举数字智能结构性优势与摩擦力瓶颈。核心判断:AI 进步不太可能精确停滞在人类水平,多智能体架构可能是最被低估的 ASI 路径。...

#路线图#ASI#多智能体#DeepMind
Read More

LLM 自改进全景:从数据飞轮到自我修改代码的完整生命期

Paper
June 11, 2026

113 页综述,提出 GRO(生成-奖励-优化)统一框架覆盖从 STaR 到 Gödel Machine 的全谱系。五阶段闭环(数据获取→筛选→优化→推理精炼→自主评估)+ 六种结构性失败模式(数据自噬、reward hacking 等)。核心判断:自改进的未来在系统层面的闭环设计,而非模型层面的技...

#综述#自改进#LLM#GRO框架#Stony Brook
Read More

Mapping Networks:用低维潜变量替代高维权重空间

Paper
June 11, 2026

权重流形假说 + 映射定理严格证明:仅训练一个千维潜向量即可生成完整网络权重,实现 200-500× 参数压缩。四项 Mapping Loss 分别对应定理假设,消融验证缺一不可。微调场景落地点最快——1024 参数适配 ResNet50 超越 17M 全参数微调。...

#权重压缩#流形学习#NIT Rourkela
Read More

LEAP:用 Agentic 框架让通用大模型在形式化数学上达到 SOTA

Paper
June 10, 2026

AND-OR DAG 证明图架构,把通用 LLM 在形式化定理证明上的解决率从不到 10% 提升到 70%。Putnam 2025 全对(12/12),超越金牌级 IMO 专用系统 Aristotle。核心设计:引理记忆化 + 前瞻性规划 + LLM Reviewer 作搜索过滤器。...

#Agent 系统#形式化定理证明#Google DeepMind
Read More
最后一篇人类写的论文:Agent-Native Research Artifact

最后一篇人类写的论文:Agent-Native Research Artifact

Paper
June 9, 2026

学术论文把分支迭代的探索过程压缩成线性叙事,丢掉大量沿途发现。ARA 协议用四层机器可执行研究包替代叙事论文,理解准确率 72.4% → 93.7%。最深刻的发现:结构化知识对弱 Agent 是助力,对强 Agent 可能变成约束。...

#Agent 系统#科研基础设施#Stanford#Michigan#CMU
Read More

Why Muon Outperforms Adam: A Curvature Perspective

Paper
June 9, 2026

Muon 比 Adam 快 2 倍的原因:不是梯度对齐更好,而是谱归一化更新方向有更低的 Normalized Directional Sharpness (NDS),每步曲率代价更小。数据越不平衡、训练越到后期,优势越明显。...

#优化器#NDS#曲率分析#LLM 预训练
Read More

一个工程师的 Agentic Engineering 全部家底

Blog
June 7, 2026

Matt Van Horn 从"高中后再没交付过有价值的东西"到多个万 star 项目贡献者,靠的不是更努力写代码,而是彻底改变和计算资源的关系。Plan First 翻转 80/20、双层规划破解模型偷懒、多 Tab 并行人变调度员——一整套正在形成的 Agentic 工程方法论。...

#工程实践#Agentic Engineering#Claude Code#Plan First#Agent 调度
Read More

Depth-Attention:让 Transformer 在深度维度上也学会"选择性注意力"

Paper
June 6, 2026

自注意力在序列维度自由选择信息,但在深度维度只是残差累加。Depth-Attention 在注意力模块内部增加"沿深度方向的注意力",让每层从前面的层选择性复用 value——零参数、零额外 KV cache、不到 0.01% 额外 FLOPs,1.5B/3B Qwen3 风格解码器全面最优。...

#Transformer#跨层信息流#KV Cache#GQA
Read More

Anthropic 用 Claude 做自助数据分析的完整工程体系

Blog
June 6, 2026

裸 Claude 回答数据分析问题准确率仅 21%,加上 skill 稳定 95%+,不维护一个月掉回 65%。四层架构(Data Foundations → Sources of Truth → Skills → Validation),精加工知识而非原始检索,LLM 自动生成元数据定义"净效果为...

#工程实践#Claude#数据分析#Skill 设计#数据治理
Read More
当 AI 构建自身——Anthropic 递归自我改进进展报告

当 AI 构建自身——Anthropic 递归自我改进进展报告

Paper
June 5, 2026

Anthropic 首次披露内部数据:80%+ 代码由 Claude 编写,工程师代码产出是 2024 年的 8 倍,Claude 单次提交 800+ 修复将 API 错误降低 1000 倍。反馈循环已启动——每次 Claude 升级都加速下一个版本的构建。研究判断力是通向完整递归自我改进的关键鸿沟...

#递归自我改进#AI 自主开发#Anthropic Institute
Read More

动态短卷积:给 Transformer 加一个"会看情况的"局部感受野

Paper
June 4, 2026

将静态短卷积替换为输入依赖的动态卷积,150M-2B 模型上 1.33-1.60× 计算优势,端到端训练仅 +8% 开销。泛化至 MoE、Mamba-2、Gated DeltaNet。思路简单、收益显著——几乎无脑可加的架构改进。...

#Transformer#动态卷积#MIT#MIT-IBM Watson AI Lab
Read More
AI 攻击者画像:832 个恶意账户揭示的三个关键趋势

AI 攻击者画像:832 个恶意账户揭示的三个关键趋势

Blog
June 4, 2026

Anthropic 审查 832 个恶意账户,映射到 MITRE ATT&CK 框架。三大发现:攻击重心从钓鱼向后渗透转移、传统威胁评估体系因 AI 而失效、编排架构成为高危攻击者唯一持久区分信号。...

#安全#网络安全#MITRE ATT&CK#威胁情报
Read More

为什么大模型能学会小模型学不会的东西?——梯度干扰与稀有任务的留存

Paper
June 3, 2026

大模型不是"更聪明"——而是参数多到高频任务的梯度变得极微弱,不再覆盖稀有任务缓慢积累的特征。用 OLMo 4M–4B 实验验证:1B 模型对非任务 token 的梯度干扰仅 7.58×10⁻⁵,20M 模型高达 0.10。数据中心化:提高数据频率可能比盲目扩大模型更有效。...

#Scaling Law#梯度干扰#Stanford#Harvard#MIT#Anthropic
Read More

δ-mem:用 8×8 矩阵给冻结 LLM 加上在线记忆

Paper
June 2, 2026

在冻结 LLM 旁维护 8×8 在线关联记忆矩阵,通过 delta-rule 持续更新,读取向量直接注入 attention 生成低秩修正。MemoryAgentBench +31%,移除全部上下文后仅凭 64 元素矩阵仍能恢复关键推理链。...

#Agent Memory#Delta-Rule Learning#NTU#复旦#交大
Read More
Video-o3:让视频理解模型学会

Video-o3:让视频理解模型学会"主动找线索"

Paper
June 1, 2026

Video-o3 给视频 MLLM 装上"主动寻线索"能力——迭代调用 VideoCrop 精查关键片段,攒够证据再下结论。7B 模型在 MLVU 72.1%、Video-Holmes 46.5% 刷 SOTA。...

#视频理解#Agent#多跳推理#ICML 2026
Read More

Oryx:在序列维度上自由切换 Attention 和线性循环

Paper
May 30, 2026

序列轴混合:tied K/V 投影共享 90%+ 参数,一套表示同时更新 KV cache 和 RNN state,序列内动态切换 attention 和 linear RNN。linear prefill + attention generation 即追平 Transformer 检索,算力省得...

#Hybrid Architecture#Mamba-2#Gated DeltaNet#Google Research
Read More

Latent Prediction:LLM 的下一个范式?把 Token Prediction 换成潜变量预测

Paper
May 30, 2026

Meta 提出将 LLM 预训练从离散 token prediction 换成连续潜变量预测——autoencoder 先压缩 token 到 latent,模型预测 latent 向量而非 next token。推理速度提升 2.7×,质量持平甚至超越,语义等价性大幅增强。...

#Pre-training Paradigm#Latent Space#Meta
Read More
SIA:同时拧两颗螺丝的自改进 AI

SIA:同时拧两颗螺丝的自改进 AI

Paper
May 30, 2026

第一个在同一个闭环中同时更新 scaffold 和模型权重的系统。Feedback-Agent 运行时动态选择 RL 算法,三个跨域实验一致证明 harness 与权重更新增益不互相饱和。...

#Self-Improving#Test-Time Training#Harness#Hexo Labs
Read More

BES:给大模型一杆秤,它就能自己改代码

Paper
May 30, 2026

DeepMind 的自改进代码优化器:给定一个评分函数,模型在三个阶段(种群采样→自我评估→自我优化)中迭代生成、评分、改进代码,无需外部 solver。3× 计算量即可达到 2× 最终性能,且跨模型泛化。...

#Self-Improving#Self-Play#迭代优化#Google DeepMind
Read More
Polar:把任意 Agent 框架变成 RL 环境的黑盒方案

Polar:把任意 Agent 框架变成 RL 环境的黑盒方案

Paper
May 29, 2026

NVIDIA NeMo 团队的 rollout 框架:在 LLM API 边界架代理捕获 token 级交互,把任意 agent harness 当黑盒做 scalable RL。Qwen3.5-4B + GRPO 在 Codex harness 上 SWE-Bench Verified 从 3.8...

#Agentic RL#NVIDIA#Rollout框架
Read More

LeJEPA 何时学到 World Model?JEPAs 的首个线性可辨识性理论

Paper
May 29, 2026

LeCun 团队用 Hermite 多项式谱分解证明:LeJEPA 在高斯潜变量下必然线性恢复 World Model(h(z)=Qz),且高斯是唯一满足此条件的分布。反转了经典 ICA 的结论——Gaussian 的旋转不变性从 bug 变成 feature。四个定理递进,Lean 4 形式化验证...

#World Model#JEPA#LeCun#可辨识性
Read More

DiffusionBlocks:残差连接就是扩散步,反向传播从此可选

Paper
May 28, 2026

残差连接天然等价于扩散去噪的欧拉离散化——利用这一等价关系,把网络拆成独立块训练,显存降 B 倍,效果和端到端训练几乎一样。五种架构验证通过,包括非扩散原生的自回归模型。...

#扩散模型#逐块训练#Sakana AI
Read More
RLVR 数据集的家谱:ATLAS 追踪 145 万条数据回到 20 个原子源头

RLVR 数据集的家谱:ATLAS 追踪 145 万条数据回到 20 个原子源头

Paper
May 27, 2026

给 RLVR 数据集做家谱:1.45M 条训练数据 90%+ 来自 20 个原子源,3.6 万条 benchmark 泄露。提出 SCA 源级归因和 Q 质量评分,用洞察打磨出 DAPO++ 数据集,两个规模上全面第一。...

#RLVR#数据溯源#北京大学
Read More
Language Models Need Sleep:让模型睡一觉再做推理

Language Models Need Sleep:让模型睡一觉再做推理

Paper
May 25, 2026

SSM-Attention 混合模型在深度推理上失败的原因不是记忆容量不足,而是巩固已驱逐上下文的计算量不够。解决方案:让模型在清除 KV cache 之前用循环前向传播反复精炼快速权重,推理延迟不变,睡得越久推理越深。...

#SSM#记忆巩固#深度推理
Read More

Project Glasswing 首月战报:AI 漏洞挖掘速度已超越人类修补速度

Paper
May 24, 2026

Anthropic 用 Claude Mythos Preview 联合 50 家合作伙伴,一个月发现超过 10,000 个高危漏洞。网络安全进步的瓶颈已从"发现"变为"修补"——传统 90 天披露窗口和志愿者驱动的补丁流程已不够用。...

#AI 安全#漏洞挖掘#Anthropic
Read More
EvolveMem:让记忆系统的

EvolveMem:让记忆系统的"检索引擎"自己进化

Paper
May 24, 2026

检索基础设施不该是静态的。把 BM25 权重、融合模式、上下文预算等十几个旋钮暴露为动作空间,LLM 读失败日志→诊断根因→提案调参→守卫回退的四步循环自动进化,从 F1 30.5% 七轮跑到 54.3%。...

#Memory#Agent#AutoResearch
Read More

AutoResearchClaw:让AI科研系统学会从失败中爬起来

Paper
May 23, 2026

五大机制(多Agent辩论、Pivot/Refine自修复、可验证结果报告、七档人机协作、跨Run进化)驱动的23阶段自主科研流水线。ARC-Bench上比AI Scientist v2高54.7%。...

#多Agent#自修复执行#自主科研
Read More

AlphaProof Nexus:AI 自动解决 9 个 Erdős 开放问题

Paper
May 23, 2026

LLM + Lean 编译器验证的 agentic loop 自动解决 9/353 Erdős 问题(含 56 年悬而未决难题)和 44 个 OEIS 猜想。最意外发现:最基础的 LLM+编译器循环就解决了全部成功案例,进化搜索反是锦上添花。...

#形式化证明#Agent#DeepMind
Read More

SkillOpt:把 Agent Skill 当成可训练的外部权重来优化

Paper
May 22, 2026

把 skill 文档当成 frozen agent 的外部权重,用训练的纪律来优化。52/52 全胜,skill 可跨模型跨环境迁移。...

#Agent#Skill 优化#微软
Read More

强老师不是必需品?LLM 预训练蒸馏的常识颠覆

Paper
May 22, 2026

知识蒸馏的黄金法则被推翻:弱老师也能教出好学生,强老师反而可能让蒸馏收益饱和甚至逆转。蒸馏的真正价值在泛化而非拟合。...

#知识蒸馏#预训练#泛化
Read More