ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

AI重做86篇顶会论文平均提升25%?拆解ScientistTwo真相

AI重做86篇顶会论文平均提升25%?拆解ScientistTwo真相 “AI 把 86 篇顶会论文重做了一遍平均提升 25%”——我年初看到这个标题的第一反应是既兴奋又警惕。兴奋在于如果结果可信说明科研的自动化程度已经走到了一个新的量级警惕在于混这行的都清楚“平均提升”这四个字在机器学习评估里从来都是最容易注水的表述。这篇论文讲的是 Google 的 ScientistTwo 项目一个从研究想法生成、代码编写、实验执行到论文撰写全程由 AI 独立完成的端到端系统。它用了一种非常有冲击力的评测方式把 86 篇顶会论文放到自动化流水线前让系统不看原作者的实现细节只凭问题描述把整套研究重新做一遍再和原论文报告的结果对比。这篇文章我打算围绕实验设计、评估口径、系统机制三个层面展开最后说说我觉得这套东西的真正价值和边界在哪里。1. 从 Scientist 到 ScientistTwo一个敢跟人类研究者比成果的自动化系统1.1 “重做论文”和“复现论文”是两码事普通的 reproducibility可复现性指什么拿到作者公开的代码、数据和环境配置把论文里的图表重新跑出来。这个工作虽然琐碎但本质上是在验证一个已知答案路径是明确的。ScientistTwo 干的事情完全不是这个。它拿到一篇论文更像是拿到一道“命题作文”这篇论文解决的是什么问题提出的方法大概思路是什么在什么数据集上评测把这些作为输入交给系统系统自己会重新生成研究方案、自己设计新方法、自己写代码训练、自己评估、自己总结成文。注意这里并没有参考答案原作者的代码和实现路径被有意屏蔽掉了。你甚至可以理解为ScientistTwo 是在同一个起点用 AI 的方式重新走了一遍作者当年走过的完整研究过程。这中间的难度差一个量级。复现论文需要读懂已有代码而重做论文需要从问题定义开始做研究决策。系统要自己判断“这个基线选得合不合理”“消融实验该做哪几个”“超参怎么设置才公平”——这些恰恰是人类研究者真正花时间的地方。1.2 第一代 Scientist 的教训和 ScientistTwo 的改法Google 的 AI Scientist 第一代发布于 2024 年当时已经打出了“端到端自动化科研”的旗号输入一个初步设想系统会自动搜索相关工作、生成 idea、写代码、跑实验、写论文。但如果你真用过一代系统会明显感觉到三个痛点生成的研究空间非常窄idea 很容易退化成一个轻量级的超参微调AI 写的代码能一次跑通的概率实在感人经常需要人反复介入修 bug生成的论文读起来像模板拼接缺少真正的洞察。ScientistTwo 的改进方向基本就是对着这三个痛点来的。idea 生成阶段加了更严格的新颖性过滤代码阶段加了更完整的自动化调试循环论文阶段增加了多轮自评机制。说白了一代像刚进组的科研助理帮你打杂但经常掉链子二代更像一个有基本独立能力的组员虽然你还得定期检查它的工作质量但已经能接手一个完整课题了。1.3 标题里的三个关键词每个都值得掰开看“86 篇”“顶会论文”“平均提升 25%”这三个组合在一起确实抓眼球但它们各自背后都有需要追问的地方。顶会论文意味着经过了同行评审问题定义和实验设计大体是靠谱的拿来当“考点”很有说服力。但顶会论文恰好也是“结果最好的版本”——论文里报告的通常是精心调参后最漂亮的一组数字拿这个当 baseline 的难度本来就比普通工作高。“平均提升”更是一个需要拆解的指标。后面我会专门分析这里先埋个伏笔平均数的温度取决于分布的形状。如果 86 篇里大部分持平、少数大涨平均值也会很好看但这并不代表系统全面超越了人类。“86 篇”这个数量级说明评测是精心筛选过的既不是几十篇的过拟合样本集也没有扩展到整个文献库。它意味着科学家团队在选题时认真做了权衡既要覆盖足够的子领域证明普适性又不能让算力成本失控。2. 86 篇论文的复现实验选样标准、重做流程与评估口径2.1 论文怎么选出来的公开、可量化、算力可控虽然我没有拿到完整附录里每篇论文的清单但按照这类评测设计的常识来推断选样标准大概率符合下面几条原则论文任务类型以监督学习和自监督学习为主这些任务有明确量化指标使用了公开数据集和公开评估协议避免了私有数据的干扰计算开销在可接受范围内像大语言模型预训练这种动辄上万 GPU 时的任务显然不适合拿来当“考点”领域覆盖面尽量均匀图像、文本、图学习、生成模型都有涉及防止系统只在一个子领域表现出色。这套筛选逻辑本身没有毛病。它保证了评测的可行性也让结果有一定的泛化参考价值。但注意这也决定了 ScientistTwo 的“能力画像”只覆盖了 ML 科研的一部分并不能推广到所有科研领域。2.2 从题目到论文系统内部分几步走根据公开的系统设计信息整个重做流程大致可以拆成六个阶段输入解析将论文的问题定义、数据集、评测指标提取为结构化任务Idea 生成基于任务描述生成若干个候选研究方案文献过滤在已有论文库中检查新颖性剔除近似方法代码实现为每个候选方案自动编写训练和评估代码实验执行在目标数据集上完成训练记录指标、loss 曲线、运行时间论文与审稿自动化生成技术报告同时自我评审并修正。在这条链路里最关键的其实是第 3 步和第 6 步。第 3 步决定了系统不会重复造轮子第 6 步决定了系统的产出是不是具备一个合格研究的“骨架”——一篇文章光结果说明不了什么解释为什么有效比报告数字更重要。2.3 什么叫做“比原论文更好”一个常被忽略的细节先抛一个问题如果 AI 重做某个图像分类任务准确率比原论文高了 2 个百分点这个“提升”公平吗要回答这个问题得先看比的是什么。最合理的比较对象是原论文在自己设定的评测协议下报告的数字。但这个数字本身就有讲究很多论文报告的是最佳随机种子下的结果不是多次重复的平均值。如果 ScientistTwo 也是用同样的“取最好”口径那两者起点一致倒还算公平。但如果原论文取最好、AI 系统取平均或者反过来口径不一致那 25% 这个数字就完全没有可比性。这还不是最要命的。更隐蔽的问题是AI 系统是否偷偷增加了计算量如果它用三倍的计算预算换来 25% 的提升资深研究者看到只会嗤之以鼻。如果它用更低的算力达成了相当的指标那哪怕平均只提升 5%意义也比“烧更多卡刷高一点指标”大得多。所以读这篇论文时我建议你先别盯着 25% 这个数字激动而是去找一个信息计算开销是否透明。ScientistTwo 的设计目标之一是“低成本自动化研究”公开资料里提到每次实验的成本控制在一个非常低的数量级如果评测中所有重做实验都遵循了同样的低成本约束那这篇论文的价值其实远超“AI 超越了人类”这种标题党叙事。3. 平均提升 25% 的真相基线选择、统计方法与水分排查3.1 平均数陷阱25% 尤其需要看分布做机器学习评估这么多年我养成了一个条件反射看到“平均提升”第一反应就是找分布。中位数是多少有多少篇论文出现下降最好和最差的离群值分别是什么单纯报一个平均数信息量很低。举个极端例子86 篇论文里如果有 4 篇提升了 200%剩下 82 篇只提升 2%平均值已经很高了。反过来如果有 20 篇论文是不如原论文的但只要涨幅够大平均值也能抹平这个事实。从我读到的公开信息片段看ScientistTwo 的评测分布呈现的是“大多数有增益、少数有显著增益、个别持平或微降”的形状。这个分布形状比 25% 这个均值本身健康得多说明系统能力是真实的而不是靠几个 outlier 撑起来的。但我依然觉得论文在摘要里直接写“平均提升 25%”是一个不够严谨的传播方式同理如果媒体报道只抓这个数字也容易误导公众对 AI 科研能力的认知。3.2 基线公平性三个必查项评估这东西最怕的不是做不出好结果而是评估协议本身的偏差。我总结了一个“三查”清单读这类 AI 做科研的论文时你拿着它逐条打勾就行算力预算对等吗AI 系统完成单篇论文的总计算量是否和原论文作者的实际开销大致相当如果相当或更少结论含金量高如果高出几个数量级那就是用算力堆出来的。数据与预处理一致吗重做时是不是沿用了原论文的数据集版本和预处理方法如果系统自行换了更强数据增强那提升的部分可能来自数据工程而非研究贡献。随机种子策略一致吗原论文报告 5 个种子取平均AI 系统也应该是 5 个种子取平均原论文挑最好种子报告AI 系统也挑最好种子。两边口径不一致时任何数字对比都是失真的。这三个检查项听着基础但绝大多数“AI 超越人类”的结论都栽在这上面。3.3 用代码理解“取最好 vs 取平均”的差异我想用一段极简代码说明这个口径敏感性问题。假设某篇论文原作者的 5 次实验指标是 [0.72, 0.70, 0.71, 0.50, 0.73]AI 系统的 5 次实验指标是 [0.74, 0.73, 0.75, 0.55, 0.74]。import numpy as np author_metrics np.array([0.72, 0.70, 0.71, 0.50, 0.73]) ai_metrics np.array([0.74, 0.73, 0.75, 0.55, 0.74]) # 报告“均值”的口径 print(f均值口径提升: {(ai_metrics.mean() / author_metrics.mean()) - 1:.1%}) # 输出约 7.4% # 报告“取最好”的口径 print(f取最好口径提升: {(ai_metrics.max() / author_metrics.max()) - 1:.1%}) # 输出约 2.7% # 报告“取中位数”的口径 print(f中位数口径提升: {(np.median(ai_metrics) / np.median(author_metrics)) - 1:.1%}) # 输出约 4.9%同样的两组实验数据换一种统计口径结论就从 2.7% 变成了 7.4%。如果论文里只写“提升 X%”却不交代取哪种口径你根本没法判断真实效果。所以看到 25% 这个数字时我第一反应是这个数字是在什么口径下算出来的是每篇论文选最优结果后取平均还是每篇论文取多轮实验均值后再对全部论文取均值这两个算法完全不同。我读到的信息表明ScientistTwo 团队在评测时尽量选择了“保守口径”用多次独立运行的中位数或均值而不是挑选最好的一次。这种做法值得赞赏但它同时也说明所谓 25% 的平均提升在“极端乐观口径”下可能会被放大到接近 40%在“极端悲观口径”下可能只剩 10% 出头。想真正评估这个系统的能力你得把口径抓到 25% 这个数字的脚注里去。3.4 从 25% 反推系统真实水平综合来看我认为 ScientistTwo 的真实水平是在中等难度、目标明确、生态成熟的 ML 任务上AI 自动化系统已经达到了能独立产出“具备竞争力结果”的程度并且可以稳定地小幅超越原论文结果。这个“小幅”放大到一个局部领域或者一个较窄的基准集上正好对应 25% 这个量级。比起“AI 统治科研”这种叙事我更愿意把它看作“科研执行层的瓶颈正在被自动化填平”。因为在一个定义良好的 benchmark 上刷分本身越来越像工程问题只要评估指标清晰、算力充足、数据干净自动搜索方法的效率已经接近甚至超过人类的耐心调参。4. 系统里最能打的三个模块idea 生成、自动实验与论文写作4.1 Idea 生成器难点不在生成在过滤用过生成式 AI 的都知道让模型“想一个点子”不难难的是想出一个既有新意、又靠谱、还能在有限算力内跑完的点子。LLM 天然会被训练语料里出现过的模式吸引如果不加约束生成的所谓新 idea 大概率是对已有方法的浅层排列组合。ScientistTwo 的做法是在生成后面接一个严苛的过滤管线。我理解的设计逻辑是这样的生成一批候选 idea用相似度检索把它们和已有论文做对比淘汰同质化内容用“可行性预估”排序计算实现成本、预期提升幅度和风险系数只保留可行性得分最高的少数几个进入代码阶段。真正决定系统上限的恰恰是这一步的过滤标准而不是 LLM 的生成能力。生成器再能想如果过滤器判断不出“哪些想法值得实现”后面全是浪费算力。4.2 自动代码生成一个循环解决“写得了但跑不出”的魔咒AI 写代码在科研复现场景里最大的问题不是“语法错误”而是“逻辑能跑但结果不对”。你问大模型生成一个数据加载器它写得像模像样但你拿着这个加载器去训练、去评估很可能 loss 一上来就爆炸或者 eval 里根本没有你想看的指标。ScientistTwo 对这个问题给出的方案是一个闭环调试循环每生成一段代码先在小型子集上做 smoke test如果运行报错自动把 traceback 反馈回生成器生成修复补丁修复后重新运行最多循环若干轮如果仍然失败丢弃这个方案回退到下一个备选 idea训练过程中实时监控 loss 和指标判断收敛状况不收敛时自动调整学习率或模型规模。这个循环本身并不神秘很多 AI 辅助编程工具都做了类似功能。但放在自动化科研的场景里它的意义是让“实验失败”变成了一个可观测、可迭代的统计过程而不是一次性结果。据我了解ScientistTwo 在复现论文时一个常见操作就是用小规模运行快速筛选思路验证可行后再放大训练。这个“先小后大”的心态恰恰是人类研究者最容易丢掉的耐心。4.3 论文写作与自动评审像审稿人一样对待自己的稿件最让我印象深刻的其实是论文模块的设计。ScientistTwo 不只是把实验结果堆进一个 LaTeX 模板它还会在成稿后调用一个独立的评审模块按照顶会审稿标准对论文打分。打分的维度包括新颖性、方法设计合理性、实验充分性、写作清晰度。如果分数不达标系统会回到前面的阶段补充实验或者重写论述。这套“自产自销”的闭环思路本质上是把同行评审的反馈机制内置到 AI 系统里。它有一个很实际的效果防止系统在实验不充分时就草草收笔。人类写会议论文经常遇到 deadline 前急匆匆赶一个消融实验的情况AI 系统反而能做到十二分的规范。但这里面藏着一个隐患如果评审模块也是 LLM 写的、训练的、调优的那它的口味就可能天然偏向某种“看起来像好论文”的文体。结果就是系统生成的文章在结构上越来越像顶会论文但在认知贡献上却可能越来越平庸。这一点的危机感我会在下一节详细说。5. 这套流水线的边界在哪里哪些论文被重做会翻车5.1 适合重做的论文类型边界清晰、指标明确ScientistTwo 最适合发挥的领域是那些“问题定义已经很成熟、评估协议基本固定、数据集公开可下载”的任务。我把这类任务的特征归纳成四个任务有公认的基准测试集比如 CIFAR、ImageNet、GLUE、SuperGLUE评测指标是数值型没有太多主观成分单次训练时间控制在几小时到一天内方法贡献集中在模型结构、训练策略、损失函数设计上。在这类任务上自动化系统的优势会被放大搜索空间可以定义得很清楚涨点就是涨点没有玄学空间。这也解释了为什么论文里复现的领域主要集中在 CV 和 NLP 的经典任务上。5.2 容易翻车的论文类型环境交互、主观评估、强领域先验反过来下面几类论文很可能是 ScientistTwo 的阿克琉斯之踵我用一个表格说明论文类型代表领域为什么易翻车强化学习多智能体协同、真实机器人控制环境非平稳、训练随机性大、评估协议高度各异人机交互用户研究、可用性评估需要真实受试者参与AI 只能模拟失真严重系统与工程分布式训练框架、推理加速依赖特定硬件环境和工程细节难以在轻量容器里复现理论证明泛化界推导、复杂度分析无法用“跑实验”验证证明的严谨性数据处理密集型数据标注策略、数据蒸馏流水线自动化系统难以准确复现人类标注质量这不是要否定系统能力而是提醒读者ScientistTwo 的 25% 提升只能代表它在某个能力子集上达到了人类水平不能代表它可以在整个科研版图上替代人类。5.3 “看着像科学”的风险自评模块可能骗过自己开篇我提到了整个系统最大的隐患这个问题值得反复强调。ScientistTwo 的整个闭环里写论文的人和审论文的人是同一个模型的衍生体。这意味着它对“什么是好论文”的判断可能形成一个自洽闭环。就像一个人既当考生又当阅卷老师分数好看是必然的但分数能不能真实反映水平就存疑了。我比较担心的一种结果是系统生成一篇结构完整、图表规范、统计充分的论文但核心贡献其实只是在某个小众数据集上调出了更优的超参组合。这种论文在形式上无可挑剔在科学价值上却几乎没有增量。等到这种论文批量产出学术生态就会被大量“平庸但规范”的作品淹没人工审稿人筛选有效信息的难度反而被加大了。所以如果你准备在真实科研场景里使用 ScientistTwo我强烈建议你永远保留一个习惯人工复核它的 idea 新颖性而不是相信它自己的过滤器和评审模块。系统可以做执行但方向的判断力必须留给人。6. 读完这篇论文我打算动手做的三件事与其争论“AI 会不会取代科学家”不如自己动手感受一下这套方法论能给工作流带来什么。6.1 用“先小后大”原则重构自己的实验流程我给自己立了一条规矩任何新想法先在一个极小的子集上验证可行性再放大到全量数据。不要一上来就提交一个 8 GPU 大任务跑完发现 loss 曲线发散了才知道方案有问题。具体执行上我会把 ScientistTwo 的循环浓缩成一个极简脚本生成候选配置 → 小批量试跑 → 检查指标 → 筛选通过 → 提交正式实验。手动做这一步很琐碎但它是自动化的前提。6.2 做一个“口径敏感”版的评测工具以前我在跑论文复现实验时经常只报一组最好结果。读了 ScientistTwo 的评测报告后我开始在内部评测流程里强制跑 5 个随机种子同时输出平均/中位数/最优三组数字并且标注计算预算。这个习惯强烈推荐给每一个做 ML 研究的同学。它不会让你的论文涨点但能让你和你的读者都更清楚提升到底是真实的还是只存在于最好的那颗随机种子里。这是科研诚信层面最基本的“排雷”。6.3 把“自动评审器”接进自己的写作流程最后一件事我认为是门槛最低、收益最高的借鉴用 LLM 模拟三个角色的反馈来审自己的论文初稿——审稿人 A 专挑创新性毛病审稿人 B 专挑实验完整性毛病审稿人 C 专挑写作表达毛病。三份反馈都拿到后再改稿。这个做法我实测下来很有用。它不求你把所有意见都照单全收而是帮你发现自己因为“太熟悉自己的方法”而漏掉的盲区。换句话说ScientistTwo 最有借鉴价值的不是它的自动化科研能力而是那个“先自评再成稿”的纪律。我个人读到这篇论文时最大的感慨是随着这类系统的成熟“科研外包”的门槛正被拉得越来越低。过去一个想法从构思到写成顶会论文需要一个课题组好几周的投入现在同样的流程可以被压缩到几天甚至全自动完成。但这恰恰意味着当所有人的执行力都被 AI 拉平之后真正拉开差距的就只剩两件事提出好问题的能力和辨别结果可靠性的品味。所以与其焦虑 AI 会不会取代科研人员不如先把这两件事练扎实。
返回列表