Back to Blog LLM的科研品味比人类窄得多

LLM的科研品味比人类窄得多

Paper
都说LLM能帮科学家想点子了。但到底想出来的点子跟人类研究员差多远?这篇论文给出了最系统的回答——不是比单个想法的好坏,而是从分布层面测量LLM和人类在"科研品味"上的系统性差异。结论扎心:LLM的想法单独看都还行,但放在一起,它们反复在做同一件事——缝合已有文献。人类研究的广度,目前模型远未触及。

不比单个想法,比整个分布

之前评价LLM科研能力的方法,基本是拿一个想法出来让专家打分——新不新、可不可行、有没有影响力。这有个致命盲区:一个想法看着漂亮,不代表生成它的系统就有真正的科研品味。就像一个人能写出一句好诗,不等于他会写一万种风格的诗。

这篇论文换了视角:关注"分布"而非"单点"。他们定义了 research taste 的概念——一个研究者(或模型)在面对相似的文献语境时,倾向于提出什么样的研究机会、构造什么样的贡献。

怎么测?逆向工程人类论文

论文收集了机器学习和自然科学领域的真实论文,对每篇做两件事:用LLM辅助提取核心idea(动机+方法),然后逆向工程出4-8篇最相关的前置工作,只保留标题和摘要作为输入。接着让9个主流LLM在相同context下生成idea。这样人类idea和LLM idea基于完全相同的文献基础。

Research Taste Gap Overview
评测框架概览:从真实论文逆向工程出文献context,人类idea来自论文本身,LLM idea由9个模型在相同输入下生成,用两轴分类法做分布对比。

两轴分类法:捕捉"品味"

论文引入了一个二维 research-taste taxonomy,不是拍脑袋定的——作者们先研究了NSF、NIH、AHRQ、DARPA的研究提案指导文件,再用150篇论文迭代校准:

Opportunity Pattern(机会模式)轴:回答"为什么要做这个研究"。7个类别——发现矛盾、缺少解释、范围不匹配、证据缺失、连接断裂文献、发现失败/风险、资源瓶颈。

Method Paradigm(方法范式)轴:回答"怎么做出贡献"。7个类别——综合统一、放松/扩展范围、鲁棒化、形式推导、实证映射、造系统、优化搜索。

Distribution comparison
人类 vs 9个LLM 在两轴上的标签分布。人类(深色)几乎均匀分布在所有类别上,模型(浅色)高度集中在 bridge opportunity 和 synthesis 方法上。

核心发现:LLM疯狂扎堆在"缝合"和"综合"

Bridge Opportunity 比例
人类12.1%
LLM(9个模型平均)47.1%–64.2%
Synthesis/Unification 方法比例
人类5.1%
LLM(9个模型平均)22.5%–38.7%
Normalized Entropy(越高越分散)
人类0.926
Claude-4.6(最优)0.737
GPT-OSS-120B(最差)0.550

翻译成大白话:LLM看到一个研究空白,第一反应是"把这些东西整合一下"。人类研究者的反应五花八门——有时候是"这里有个矛盾需要解释",有时候是"这个假设可以放松",有时候是"现有方法在这个场景会失败"。

原因分析:模型在高频概念上套模板

Mechanism analysis
机制分析:模型idea更集中在先验文献集的embedding中心,人类idea分布更散。模型偏向高频技术关键词并天然携带"integrate/unify"语义,人类更关注局部机制。

把所有idea映射到共享embedding空间后,发现不同模型家族对同一个输入的相似度(0.8316)甚至高于人类与任一模型的相似度(0.72-0.78)。模型之间比模型和人类之间更像。

概念分析更直接:模型偏向multi-omics integration(95%模型份额)、diffusion policy(93.1%)、multimodal generation(91.2%)这类高频概念簇。人类则更关注局部机制——trajectories(63.5%人类份额)、tokenization、equivariance、entropy等。

更强的推理能力反而可能让问题更严重

一个反直觉的发现:开启thinking模式后,Qwen3-8B和DeepSeek-V4-Flash的synthesis比例反而进一步升高到36.1%和28.6%。推理能力让模型把"缝合"做得更自洽了,但没有拓宽品味。模型在模板化方向上走得更远。

这对AI辅助科研意味着什么

这篇论文的结论不是"LLM不能做科研",而是"LLM目前能做的科研只有一种口味"。如果你用LLM做头脑风暴,它会不断给你"把A和B结合"类建议。这些想法单独看合理,但你会错过所有其他类型的贡献机会——发现矛盾、放松假设、识别失败模式、构造新工具。

更根本的问题是:这个品味窄化可能跟预训练数据有关,也可能跟RLHF偏好"安全合理"的回答有关。在模型能够真正做出像人类一样多样的研究贡献之前,至少应该意识到这个gap的存在。用LLM做科研辅助时,人类的品味和判断仍然不可替代。

Tags: #Paper