本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。
L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.
— 《进步者日报》编辑部 / La rédaction
2024年10月,诺贝尔委员会将奖项授予德米斯·哈萨比斯和约翰·江珀,以表彰他们开发的AlphaFold——DeepMind预测蛋白质三维结构的程序。结构生物学领域50年间共解析了约20万个蛋白质结构。AlphaFold在2021至2022年间,约一年内预测了超过2亿个结构。这是千倍级的差距,靠的不是招募更多研究人员,而是改变了从事科学的主体。
此后的变化更为根本。AlphaFold不是代理:它是极为强大的工具,但只回答人类提出的问题。下一代AI系统自行提出问题。它们提出假设、设计实验、分析结果、得出结论——全程只需数小时。研究者负责核查、确认、把握方向。研究者并未消失,但角色已经转移。
结构生物学是这场变革最早的实验场,很快将成为整个科学领域的参照。
核心要点
- AlphaFold在2021至2022年间约一年内预测了超过2亿个蛋白质结构,结构生物学50年的积累约为20万个。
- 自主AI代理——能够提出假设、设计方案、分析结果,无需人类逐步指令——已在多个大学和私人实验室投入使用。
- 产出加速带来了新的张力:AI代理生成结果的速度,使现有验证体系——从同行评审到开放数据库——能否跟上这一流量的问题日益突出。
- 未来十年的核心任务不是限制产出速度,而是建设与之匹配的验证系统。
AlphaFold仅仅是开始
要理解接下来会发生什么,必须先看清AlphaFold改变了什么。几十年来,解析一个蛋白质结构需要数月X射线晶体学或冷冻电镜工作。这些技术仍是金标准,但速度慢、成本高。AlphaFold证明,一个基于已知结构训练的深度学习模型,能以接近实验方法的精度预测未知结构,对大多数蛋白质而言尤为如此。
基于AlphaFold构建的公共数据库,如今覆盖了几乎整个人类蛋白质组及数十种其他生物的蛋白质组,免费开放。在内罗毕或布宜诺斯艾利斯、没有同步辐射光源的研究人员,现在可以在几秒内查询蛋白质结构。这切实改变了获取前沿结构生物学的条件。
但AlphaFold回答的是问题。它不提出问题。
提出假设的代理
这一区别是根本性的。科学AI代理不只是执行定义明确的任务。它扫描现有文献,识别空白或矛盾,提出解决方案的实验设计,模拟或分析由此产生的数据,生成结构化报告。从假设到结果的完整周期可能只需数小时,博士生完成同样流程则需数周。
此类系统已有多个问世。卡内基梅隆大学团队开发的Coscientist于2023年发表于《自然》,实现了化学合成的端到端自动化:文献检索、方案撰写、机器人操控、结果分析。该系统在无人工中间指令的情况下合成了已知分子。Sakana AI于2024年发布的AI Scientist更进一步:生成研究想法、编写实验代码、开展计算实验,并产出包含章节、图表和结论的完整论文草稿。
这些系统不取代科学判断,而是加速并转移科学判断。资深研究者成为设定方向、核查方案严谨性、决定哪些成果值得发表的人。这是知识生产链中位置的转变,不是被淘汰。
这种转变与其他高分析性行业发生的情况相似。美国科技行业的实证研究显示,初级岗位消失,高级岗位得到强化:机器承接重复性任务,人类保留高层级判断。科学遵循同样的逻辑,但多了一层后果:科学中的重复性任务不只是重复,它们还在培养研究者。
数据库跑在验证前面
问题不在于AI代理产出错误结果,而在于产出速度超过验证系统的承接能力。
同行评审目前仍是手工作坊式流程。投稿《自然》或《细胞》的论文,平均需要等待数月,才能由两三位同行各花数小时评估。这个节奏是按人类投稿量校准的。如果AI代理每周能生成数百篇论文草稿,瓶颈就不再是生产,而是验证。
数据库面临同样的问题。蛋白质数据银行(PDB)用50年积累了20万个经实验验证的条目。AlphaFold建立了独立数据库AlphaFold DB,收录超过2亿个预测结构,与官方实验性PDB分开——这些预测不等同于经实验验证的结构。科学界能分辨两者,但下游用户——医生、工程师、制药初创公司——未必能做到。
真正的风险在这里。不是AI代理蓄意捏造结果,而是大量似是而非、未经验证的结果作为已验证结论流通。科学界早已在小范围内经历这一现象:自2010年代起,心理学和生物医学领域记录的可重复性危机显示,某些领域超过半数的已发表结果无法复现。AI代理没有制造这个问题,但可能大幅放大它。
谁在构建防护机制
多项举措正在推进适应新节奏的验证基础设施。
欧洲分子生物学实验室欧洲生物信息学研究所(EMBL-EBI)正在开发自动注释协议,以区分数据库中的实验结构和预测结构。目标是让每条记录都带有可供自动化系统读取的置信度标识,而不只是专家才能解读。这是用基础设施方案应对基础设施问题。
《eLife》等科学期刊正在试验新出版模式:论文投稿即公开,附带同行的开放评审,而非锁在审稿流程之后。这种开放评审预印本模式更适合加速环境:学界可以迅速反应,修正公开可见,作者声誉与每篇发表挂钩。
OpenAI、Anthropic及多个学术实验室正在投资科学一致性的自动化评估系统。思路是:一个AI代理可以用来验证另一个AI代理的结果,前提是两者基于不同目标训练,架构差异足以产生独立的错误。这是以多样性换稳健性的赌注,有其自身局限。
开放获取问题在此背景下尤为紧迫。如果科学AI代理主要在私人实验室中开发——微软和亚马逊正在吸纳顶尖AI实验室而不收购它们,将能力集中于公立大学之外——由此产生的发现可能无法自由进入公共知识库。AlphaFold获得诺贝尔奖,其数据库是公开的:这是一个显著的例外,不是行业常态。
长远视角:构建或错失的十年
展望未来十年AI代理对科学的影响,需要区分两条并行轨迹。
第一条轨迹合理且乐观:AI代理能够探索人类科学因时间不足而永远无法覆盖的假设空间。药物化学领域潜在活性分子的空间估计有10^60个化合物,没有任何人类研究项目能遍历这个范围。能够筛选这一空间、提出最有前景的合成候选、完成计算验证,再将最佳分子交给研究者进行实验确认的代理,将大幅加速药物开发。麦肯锡全球研究所的保守估计认为,到2030年,AI应用于生命科学每年可产生4000亿至8000亿美元经济价值——这已计入仍由人类主导的临床验证周期。
第二条轨迹同样合理,但更令人担忧:如果开放的验证基础设施未能同步建成,科学产出加速,经过验证的知识却不以同样速度增长。出版物数量翻倍或翻三倍,可核实部分停滞甚至萎缩。公共传播中,产出结果与确立结论之间的界限日益模糊。无力获取验证工具的参与者——全球南方大学、资源匮乏的学术实验室——成为他们无力检验的结果的消费者。知识鸿沟恰恰在数据获取渠道扩大的地方加深。
这两条轨迹不相互抵消,已经同时存在。选择不在于走哪条路,而在于投入到每条轨迹的制度力量。产出加速已经到来。验证基础设施仍有待建设。
代际问题也值得正视。今天培养的博士生将是2040年的研究主管。如果他们的训练环境是AI代理包办重复性和探索性工作,某些能力就不会形成。这可能是净收益——从耗时任务中解放,更早发展出高层级判断力。也可能是损失——某些科学直觉来自长期沉浸于原始数据,来自逼迫自己理解尚不理解之物的耐心摸索。目前没有数据可以裁定。华盛顿大学大卫·贝克研究组(2024年诺贝尔化学奖得主,因蛋白质设计获奖)等多个实验室,有意保留了让学生先学实验方法、再使用计算工具的培养路径。
生物学是范本,不是例外
结构生物学的变化不是孤例。这是第一个转型足够迅速且记录充分、因而清晰可辨的领域——蛋白质结构预测问题定义明确,成功标准可量化,使其成为深度学习的自然目标。这一逻辑适用于整个实验科学。
材料物理学领域,AI代理已在识别新一代电池和超导体的候选材料,遍历实验化学需要数十年才能探索的成分空间。天文学领域,詹姆斯·韦伯望远镜产生的数据量超过人类天文学家在合理时间内手动处理的上限:自动化系统检测异常,标记不寻常的星系候选体,为观测团队生成假设。流行病学领域,预测模型在疫情暴发前识别出具有跨物种传播风险的病原体。
与过去几十年的区别,不在于AI进入科学——自1990年代已然如此——而在于当前系统作用于科学周期的完整逻辑,而非某个孤立步骤。提出假设、设计实验、分析结果、撰写结论:每个环节至今都是研究者的专属领域。如今在越来越多的情境下,这些环节可以实现自动化。
挑战不在于减缓或哀叹这一转变,而在于以同等紧迫性同步建设能够验证机器产出的开放基础设施:具有透明评审机制的开放获取期刊;由公共机构维护和注释的数据库;自动化复现协议;以及不让研究者沦为被动监督者、而是赋予他们质疑和纠正所监督代理能力的培养方案。
科学历来通过不连续的加速推进。印刷术扩大了思想流通,也制造了新的验证问题,文人共和国花了一个世纪才解决。高通量基因组测序使数据库充满变异信息,其临床解读三十年后仍不完整。科学AI代理提出了同样的结构性问题,速度更快。答案不在工具本身,而在围绕工具的制度。
来源
- Sciences et Démocratie / Nature — L’IA accélère la découverte scientifique : promesse et vertiges : https://www.sciences-et-democratie.net/intelligence-artificielle-33106-ia-accelere-decouverte-scientifique-promesse-vertiges
- AlphaFold Protein Structure Database (EMBL-EBI / DeepMind) : https://alphafold.ebi.ac.uk
- Boiko et al., « Autonomous chemical research with large language models » (Nature, 2023) — Coscientist
- Lu et al., « The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery » (Sakana AI, 2024)
- RCSB Protein Data Bank — statistiques historiques des dépôts de structures
- McKinsey Global Institute — The economic potential of generative AI (2023)
- Comité Nobel de chimie — annonce du prix 2024, Royal Swedish Academy of Sciences
- Nobel Prize 2024 Chimie – Communiqué officiel : https://www.nobelprize.org/prizes/chemistry/2024/press-release/
- EMBL – AlphaFold Nobel 2024 : https://www.embl.org/news/science-technology/alphafold-wins-nobel-prize-chemistry-2024/
- RCSB PDB – Milestone 200 000 entrées : https://www.rcsb.org/news/639b9e337f8444f313d20414
- AlphaFold DB – Site officiel : https://alphafold.ebi.ac.uk/
- PubMed – AlphaFold DB in 2024 (214 millions de structures) : https://pubmed.ncbi.nlm.nih.gov/37933859/
- ScienceDirect – Facteur 1000 AlphaFold vs PDB : https://www.sciencedirect.com/science/article/pii/S0966842X25001106
- Nature – Coscientist (papier original) : https://www.nature.com/articles/s41586-023-06792-0
- Carnegie Mellon – Communiqué officiel Coscientist : https://www.cmu.edu/news/stories/archives/2023/december/cmu-designed-artificially-intelligent-coscientist-automates-scientific-discovery
- Nature – AI Scientist (Sakana AI, 2026) : https://www.nature.com/articles/d41586-026-00899-w
- Nature – AlphaFold (papier original 2021) : https://www.nature.com/articles/s41586-021-03819-2