本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。
L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.
— 《进步者日报》编辑部 / La rédaction
2026年3月,一篇由自动化系统生成的科学论文通过了同行评审,并被ICLR研讨会接收。这篇论文的总成本:不到15美元。Sakana AI与牛津大学、不列颠哥伦比亚大学合作,将这一结果发表在《自然》杂志上。AI Scientist-v2由此成为首个生成全AI论文并通过机器学习会议研讨会同行评审的系统——尽管论文由Sakana团队提交,而非系统自主完成,且其他系统也声称实现了类似成果。
这个事实本身说明不了多少。它对知识基础设施的影响,才更值得关注。
核心要点
- AI Scientist v2由Sakana AI与牛津大学、不列颠哥伦比亚大学联合开发,是首个无需人工干预即可产出同行评审接收论文的系统,每篇成本低于15美元。相关研究于2026年3月发表于《自然》杂志,预印本见arXiv(arXiv:2504.08066)。
- 该系统执行完整的研究周期:生成假设、设计并运行计算实验、分析结果、撰写论文、提交并处理审稿意见。
- 现行同行评审机制并非为这一成本水平下的质量筛选而设计。AI辅助投稿引发的”貌似合理但空洞无物”的论文通货膨胀风险,已有文献记录。
- 核心问题不是技术层面的,而是制度层面的:什么样的保障、规范和治理机制,能让此类工具加速发现而非稀释学术文献?
从设想到验证,走了十五年
要理解AI Scientist v2的意义,需要回溯这个领域此前的状态。2009年,由阿伯里斯特威斯大学与剑桥大学合作开发的”Adam”项目展示了一台机器人能够自主提出酵母生物学假设并加以验证。这是一次优雅的演示,局限于特定领域,且止步于实验室门口——论文撰写仍由人类研究者完成。
此后十年,两条平行的技术路线同步推进。大型语言模型获得了生成连贯科学文本的能力。自动化执行环境——能够运行脚本、解析输出、循环修改代码——也成熟到足以在无人监督的情况下完成小规模计算实验。Sakana AI于2024年发布的AI Scientist第一版将这两项能力整合在一起。AI Scientist-v2于2025年开发完成(预印本发布于2025年4月);向ICLR研讨会提交论文的是Sakana AI的人类团队,而非系统自主完成。
这一结果改变了问题的性质。我们谈论的不再是帮助研究者更快写作的辅助工具,而是一个能够提出问题、选择方法、执行计算、解读结果、撰写论文并处理审稿往来的系统。工具与研究者之间的边界正在模糊,而现有的制度框架并未预见到这一点。
系统能做什么,不能做什么
AI Scientist v2的应用领域明确:计算机器学习。它明天不会发出一篇海洋生物学或奥斯曼历史的论文。它的专长是那种实验本质上是在现有数据集上训练和评估模型、比较架构、测量性能的研究。这是一个宽广而活跃的领域,但也是一个实验与计算之间界限最薄的领域。
该系统的具体工作流程:从文献库中生成假设,以代码形式提出实验方案,执行代码,解读输出,得出结论,并以标准学术格式撰写成文。第二版更进一步,能够处理审稿人的修改意见,调整论文并重新提交。被ICLR研讨会接收的论文代表真实的外部验证,而非内部练习。
该系统目前尚不具备的能力:提出需要新实证数据的实验,接触物理世界,调用需要判断哪些问题值得探索的隐性知识与直觉。它在一个既定空间内进行优化。这既是它的优势,也是它的局限。优势在于,这个空间恰恰是学术论文生产最为工业化的区域。局限在于,重大科学突破很少来自在已知空间内的优化。
这两种发现模式之间的区别——有边界的常规探索与跃向未知的飞跃——是争论的核心。前者可能被AI Scientist这样的系统大规模推进,后者目前仍难以触及。
可量化的加速,及其现实条件
支持科学自动化的人有一个有力的论点。科学面临结构性瓶颈:可提问的问题增长速度超过了人类验证的能力。在生物学、计算化学、材料物理等领域,数以千计的合理假设等待验证,缺的不是想法,而是人力和时间。一个能够以每篇15美元处理其中部分假设的系统,是真实的资源。
DeepMind开发并于2020年发布的AlphaFold 2,已经在蛋白质结构预测这一具体领域展示了这种加速潜力。不到两年,它生成了超过2亿个蛋白质结构的数据库,这项工作用传统实验方法需要数十年。这些成果解锁了从药物开发到进化生物学等数十个领域的研究项目。这是一个自动化明确服务于发现而非取代发现的案例。
AI Scientist的运作方式不同——它不预测,而是探索和撰写——但加速逻辑相似。如果该系统能可靠地识别出值得发表的参数组合,且其论文能为后续研究提供扎实基础,那么对研究节奏的累积效应可能相当可观。
关键词是”可靠地”。而这正是制度问题的起点。
同行评审并非为此而设
同行评审制度建立在一个隐性假设之上:每篇投稿都凝聚了相当的努力,错误或不足可以被发现,因为它们携带人类思维的痕迹。一个反复摸索的研究者会留下痕迹。一个为通过筛选而优化文本的系统留下的是不同的痕迹,而现有的审稿人并未具备识别这些痕迹的能力。
生产成本崩溃,检测门槛随之下降。对人类研究者而言,投稿意味着不可忽视的时间成本。这一成本起到自然过滤的作用:没人会投一篇自己知道站不住脚的论文。当每篇投稿的成本降至15美元,这道门槛消失了。学术文献的信噪比可能恶化——不是因为论文有误,而是因为论文貌似合理却毫无价值。
这一区别至关重要。一篇错误的论文,能干的审稿人可以识别。一篇表述准确、写作规范、方法严谨却毫无贡献的论文,要拒绝得多——尤其当审稿人本身就承受着巨大的工作量压力。风险不是大规模学术欺诈,而是重要研究被淹没在噪音中,越来越难以被发现。
先兆信号已经存在。多项研究记录了2023年以来机器学习会议中AI辅助投稿的可量化增长:对词汇模式的系统性审查在数百篇投稿中识别出共同特征,而同行评审流程无法有效区分这些论文与完全由人类撰写的论文。这一现象目前规模尚小,未必能一直如此。
制度的不可逆性才是真正的问题所在。科学评估系统的适应速度缓慢,需要经过层层叠加的规范、编辑惯例和学术传统。如果同行评审体系为应对数量压力而调低质量标准,这种调整会形成路径依赖,难以逆转。那些通过放宽标准来吸收投稿洪流的机构,很难再回到原有的严格要求。
正在构建制度回应的行动者
面对这一挑战,多项具体举措正在推进,它们的存在改变了整体格局。
Sakana AI已为AI Scientist v2设定了明确限制:系统不得在未声明其自动化性质的情况下向期刊投稿,人类作者对投稿正式负责。这不是技术约束,而是写入系统设计的主动治理选择。
NeurIPS和ICML等多个主要人工智能会议已于2024年和2025年更新政策,要求明确声明在论文撰写和实验设计中使用AI系统的情况。这些政策的执行并不完善——没有任何检测系统能达到百分之百的准确率——但它们建立了一套改变行为激励的规范框架。
最具结构性的举措或许来自发表格式的改革。一些会议正在试验将贡献拆分的投稿格式:方法部分与解读及背景分析部分分开提交。这样做的目的是让自动化系统能够生产的内容和不能生产的内容都变得可见,使两个维度可以分别接受评估。这是一种制度设计层面的回应,而非单纯的监管措施。
元科学研究——对科学生产过程本身的研究——也在开发新工具。相关团队正在研发能够识别自动化生产特征模式的分类器,目的不是禁止,而是让编辑能够以不同的协议来处理这类投稿。核心目标是在投稿量增加的环境下,维持评估系统的辨别能力。
这些回应尚未达到挑战的量级,但它们存在,并且正在推进。这与制度保持被动截然不同。
对研究者的现实影响
对于从事机器学习研究的人来说,AI Scientist v2首先是一个工具。作为一个能够提出实验变体、验证辅助假设、生成方法部分初稿的助手,它释放出时间,用于机器目前还无法完成的工作:判断哪些问题值得提出,在更宏观的框架中解读结果,在不同领域之间建立联系。
这与计算工具在1960至70年代对物理学的影响相似。计算机的到来并没有剥夺物理学家的理论工作。它让某些计算任务变得透明,释放出认知能力用于概念工作。条件是研究者知道哪些问题可以交给机器,哪些必须自己来解决。
同样的问题今天再次出现,且远比表面看起来复杂。在机器学习这样一个学科中,相当大比例的学术产出恰恰在于测试架构变体并测量效果,常规工作与概念工作之间的边界比其他领域更为模糊。这里才是真正的位移风险所在:不是研究者被取代,而是”有价值”的问题范围逐渐收窄,只剩下系统容易测量的那些。
这一问题与数字工具如何重塑智识劳动本质的更大争论相互呼应。远程办公的经验表明,一种工具可以交付常规工作,同时削弱催生新想法的交流;科学AI的动态在结构上与此相似。最大化可测量论文的产出,未必能最大化有用知识的产出。
临界点尚未到来
AI Scientist v2目前是一次验证,还不是大规模部署。其应用领域仍然有限。其成本虽低,但需要技术基础设施和专业人员来运营。每篇15美元不包括维护和引导系统的工程师成本。
但趋势清晰可辨。根据Epoch AI发布的基准测试数据,大型语言模型的推理成本在2022年至2025年间下降了约一百倍。如果这一趋势延续——哪怕只是部分延续——同等系统到2028年的运行成本可能降至每篇论文1美元或更低。届时,大规模采用的门槛——包括在投稿质量监督薄弱的环境中——将变得极低。
制度建设的窗口期因此短暂。规范自动化科学生产的标准,在投稿洪流到来之前更容易建立,事后则困难得多。现在就明确AI透明度政策、试验适应性投稿格式、投资于检测和识别工具的会议和期刊,正在积累制度资产——随着自动化系统使用的增长,这些资产的价值将随之上升。
新技术收益的归属——以及成本的承担——在此以制度形式呈现:如果生产端的节省由批量投稿者获益,而筛选成本由一个已经不堪重负的志愿审稿人群体承担,这种收益分配是失衡的。制度回应的一部分,必须明确处理这种不平衡。
科学经历过其他深刻变革。向开放获取出版的过渡历时二十年,至今仍未完成。21世纪初确认的可重复性危机,缓慢而不完整地推动了协议注册和数据共享实践的真实改变。AI Scientist这类系统的出现,带来了这样一个问题:科学机构的学习速度有多快,这次够不够快?