Nature重磅:AI开始“自己做科研”了,从选题到论文几乎全自动
2026-09-22
4398

场景再现
如果有一天,AI不再只是帮你查文献、改代码、润色论文,而是自己提出研究问题、设计实验、写代码、跑数据、画图、写论文,最后甚至再找一个AI来“审稿”——这样的科研,还算是传统意义上的科研吗?
这个场景已经不只是想象。

在今年,一篇题为 《Towards end-to-end automation of AI research》 的研究正式发表于《Nature》。研究团队提出了一套名为 The AI Scientist(AI科学家) 的系统,试图完成一件过去很难想象的事情:把一项机器学习研究从“想点子”一直推进到“形成论文并接受同行评审”,尽可能交给AI自动完成。=更值得关注的是,这并不只是一场实验室里的“自娱自乐”。研究人员真的把AI生成的论文送进了真实的学术同行评审流程。
01AI已经不满足于“辅助科研”了
过去几年,AI进入科研工作的速度其实已经非常快。有人用大模型查资料,有人让AI写代码,有人让AI总结论文、分析数据,也有人用AI辅助提出假设。但这些工作有一个共同特点:AI通常只负责科研流程中的某一个环节,人仍然是整个研究的组织者。
The AI Scientist想做的事情明显更进一步。它尝试把科研流程串成一条完整链条:
提出研究想法 → 搜索已有文献 → 判断创新性 → 制定实验方案 → 编写代码 → 运行实验 → 调参 → 分析结果 → 生成图表 → 撰写论文 → AI同行评审。

换句话说,它不再只是一个“科研助手”,而开始尝试扮演一个真正的“研究者”。论文中的流程图非常直观:整个系统主要分为 Ideation(提出想法)、Experimentation(实验)、Write-up(论文写作)和 AI Review(AI审稿) 几个阶段。
它首先会围绕某个研究方向提出多个研究设想,包括研究问题、核心假设和实验方案。随后,系统还会连接 Semantic Scholar 等学术搜索工具,检查这些想法是不是已经被别人做过。
如果发现一个想法和现有研究过于相似,它就会把这个方向淘汰掉。这其实已经非常接近研究生刚开始做课题时的状态:
先想一个问题,再查文献,然后判断“这个到底有没有人做过”。
只不过现在,这个过程开始被AI自动化了。
02它甚至会自己跑实验、Debug和做消融实验
真正让这项研究有意思的地方,还不只是“AI会想选题”。提出想法之后,The AI Scientist会直接进入实验。
系统根据自己的研究计划生成Python代码,然后把代码真正运行起来。如果程序报错,它会读取错误信息,再尝试修改代码和重新运行。也就是说,它不只是“给你一段看起来像代码的文字”,而是真的会经历:
写代码 → 运行 → 报错 → Debug → 再运行。

在更开放的 template-free 版本中,研究团队还引入了一套类似“树搜索”的实验机制。
AI不会只沿着一条实验路线一路跑到底,而是可以同时探索不同方案:有的节点用来修Bug,有的进行超参数调整,有的尝试新的实验方案,还有的专门进行消融实验。
整个实验过程被划分成四个阶段:
初步验证、超参数调优、正式研究实验、消融实验。每完成一个阶段,系统都会从已经尝试过的方案中挑出更有希望的结果,再继续向下探索。甚至连实验图画得好不好,它也会检查。论文介绍,系统会调用视觉语言模型去审查自己生成的图表。如果坐标轴有问题、图例不清楚,或者可视化方式容易产生误导,系统会给出反馈,再进行修改。
实验结束之后,AI还会把整个过程记录成“实验日志”,然后根据这些结果自动生成论文。
包括标题、摘要、引言、方法、实验、结论以及参考文献。至此,一个相当惊人的闭环就形成了:
AI提出问题,AI做实验,AI看结果,最后AI把结果写成论文。

而完成一次这样的开放式研究流程,根据论文报告,通常需要数小时到15小时以上。
03最炸裂的一步:他们真的把AI论文送去审稿了
如果事情只到“AI能生成一篇看起来像论文的PDF”,其实还不足以说明太多问题。
真正让这项研究出圈的,是研究人员做了一个更大胆的实验:把AI生成的论文送进真实的学术同行评审。研究团队与ICLR 2025相关负责人以及 I Can’t Believe It’s Not Better(ICBINB)Workshop 合作,将3篇由The AI Scientist生成的论文提交给该Workshop进行评审。
审稿人知道其中可能存在AI生成的论文,但不知道具体是哪几篇。结果,其中一篇AI论文拿到了:6分、7分、6分。
平均分达到 6.33分,超过了该Workshop的平均接受门槛。按照论文中的说法,如果不是因为研究团队事先规定“无论评审结果如何,AI论文最终都必须撤稿”,那么这篇论文很可能会被接收。论文甚至直接展示了这篇AI生成论文的部分页面。
它有完整的标题、摘要、技术方法、实验结果、可视化图表和参考文献。从版式来看,它已经和我们熟悉的机器学习会议论文非常接近。不过,这里有几个非常重要的细节不能忽略。
首先,这次通过评审的是 ICLR的Workshop,而不是ICLR主会。论文给出的数据是,这个Workshop的接受率约为 70%,而ICLR 2025主会接受率约为 32%。
其次,3篇AI论文中只有1篇达到了这一标准。

研究团队内部的人工专家评估也认为:这3篇论文都还没有达到ICLR主会论文的水平。
另外,在真正送审之前,研究人员还人工筛选了比较有潜力的候选结果。不过,对最终被选中的论文来说,从研究想法、实验代码到论文撰写,并没有再由人类直接修改研究内容。
所以,更准确地说,这项工作证明的不是:“AI已经可以取代顶尖科学家。”而是:
“AI已经第一次有能力较完整地跑通一条科研生产线。”这两者之间,区别非常大。
04科研人员真正需要担心的,可能不是“AI会不会写论文”
实际上,这篇Nature论文自己也列出了The AI Scientist目前非常明显的问题。
它可能提出过于简单甚至幼稚的研究想法,也可能把核心方法实现错,实验设计缺乏足够的严谨性。它仍然会产生幻觉,也可能出现错误引用。甚至有时候,一篇论文看起来结构完整、图表齐全,但真正深入检查之后,研究方法并没有想象中那么可靠。
这也是为什么,目前说“AI科学家已经取代人类研究者”显然还为时过早。但真正值得关注的是另一个变化:科研正在从“AI辅助某一个步骤”,进入“AI串联多个科研步骤”的阶段。
过去,我们讨论的是:“AI能不能帮我写代码?”后来变成:“AI能不能帮我做实验?”
现在,这篇Nature论文讨论的问题已经变成:“能不能把科研本身变成一个AI Agent可以持续运行的任务?”
如果这种模式继续发展,未来研究人员每天面对的科研工作,很可能会发生巨大变化。
大量文献检索、重复实验、超参数调优、代码Debug、数据整理、画图、论文初稿,可能越来越多地交给AI完成。
而人的价值则会被进一步推向一些更难自动化的部分:
什么问题真正值得研究?
一个实验结果到底可信吗?
这个发现有没有真正的科学意义?
当AI给出一个“看起来正确”的结论时,我们应该相信它吗?论文作者也提出了另一层担忧。如果未来AI能够低成本、大规模地生产论文,学术界可能面对的不只是效率提升,还有新的问题:同行评审系统可能被海量论文淹没,低质量研究可能大量增加,科研评价体系甚至可能因此受到冲击。
结语
所以,这篇论文最值得关注的,或许不是那句“AI已经会写论文了”。
真正重要的是——
过去,AI主要学习人类已经发现的知识;而现在,它开始尝试参与“发现知识”本身。
The AI Scientist距离真正意义上的“科学家”显然还有很长的路。但科研自动化的大门,已经被推开了。当有一天,一个AI可以在夜里自己查完几十篇文献、尝试几十组实验,第二天早晨把结果和论文初稿放在你的桌面上,我们可能才会真正意识到:
AI给科研带来的最大改变,也许从来不是“帮我们写得更快”,而是让科学发现本身开始拥有另一种速度。
