本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。
L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.
— 《进步者日报》编辑部 / La rédaction
十亿蛋白质免费开放:开放科学押注打破私有医学垄断
陈-扎克伯格生物中心(Chan Zuckerberg Biohub)于2026年5月底发布了一份包含逾十亿个蛋白质结构的图谱,由ESMFold2模型生成。免费,可下载,使用不受限制。这是迄今最大的开放获取结构生物学数据库。发布时机恰好是学术实验室与科技巨头争夺生命数据产权的竞争加速之际。
核心问题并不复杂:谁将控制未来几十年医学所依赖的数据基础设施?
要点
- 2026年5月底,陈-扎克伯格生物中心发布超过十亿个蛋白质结构的开放获取图谱,由该中心自主开发的ESMFold2模型生成。
- 该图谱覆盖整个生命界的68亿个蛋白质,包含大量宏基因组序列(土壤、海洋等),并非专门针对人类蛋白质组——后者仍是DeepMind/EMBL-EBI旗下AlphaFold数据库的核心功能。
- 发布背景是开放科学与生物数据私有化之间的张力持续升温,Alphabet将AlphaFold转化为商业服务组件是重要节点。
- 真正的考验在于全球学术和制药团队的采用情况:一个开放数据库只有被持续使用和扩充,才能体现其价值。
蛋白质结构预测意味着什么——以及为何耗时一个世纪
蛋白质是执行生命功能的分子。它运输氧气、摧毁病毒、传递神经信号、调节基因表达。其功能几乎完全取决于三维形状:由相同氨基酸以不同顺序组成的两种蛋白质,形状不同,功能也截然不同。
从基因序列预测这种形状,即”蛋白质折叠”问题,困扰研究人员超过五十年。根源在于数学:一个中等大小的蛋白质理论上可以呈现天文数字级别的构型。X射线晶体学或冷冻电镜等实验方法精度极高,但每个结构耗时数月,成本达数万欧元。
2021年,DeepMind改变了这一局面。Alphabet子公司的AlphaFold2以接近实验方法的精度,预测了近2亿个蛋白质的结构。该数据库与EMBL-EBI联合开发,以开放获取形式发布,覆盖几乎完整的人类蛋白质组。效果立竿见影:被忽视疾病、罕见治疗靶点、工业用酶的相关研究出现可量化的提速。发布数月内,AlphaFold2成为近年被引用最多的科学论文之一。
但DeepMind并未维持这一开放姿态。2024年,Alphabet推出AlphaFold3,模型参数受到部分限制,并附带独立的商业使用许可。开放科学在2021年赢得了一场战役;基础设施的开放访问权,并未因此得到保障。
ESMFold2与生物中心的十亿结构
ESMFold2由陈-扎克伯格生物中心开发,延续了Meta AI Research(FAIR)此前的ESMFold(v1)路线。ESMFold2背后的核心团队——尤其是EvolutionaryScale围绕Alex Rives的成员——已被生物中心招募。与AlphaFold依赖多步序列比对预测结构不同,ESMFold基于大型蛋白质语言模型,速度更快,但在部分复杂蛋白质类别上精度略低。
速度优势正是这份图谱得以实现的关键。用现有实验方法生成十亿个结构,需要数千年时间和难以想象的资源。ESMFold2在生物中心计算基础设施上大规模部署,只需几个月。
陈-扎克伯格生物中心是马克·扎克伯格和普莉希拉·陈于2016年创立的慈善机构,初始资金6亿美元,使命明确指向开放科学与跨学科合作。2026年5月发布的图谱延续这一定位:结构可下载,元数据有完整文档,商业用途不受限制。
最后一点值得注意。若一份”开放”图谱禁止商业使用,学术价值真实存在,但在药物开发中作用有限——因为价值链不可避免地涉及产业参与者。不加限制,是一个有意为之的选择。
该图谱覆盖整个生命之树的68亿个蛋白质,宏基因组成分占比较大,包含土壤、海洋及其他环境来源的序列。它的定位不是专门绘制人类蛋白质组图谱——那是AlphaFold数据库的角色——而是提供对生命多样性的大范围覆盖。
免费获取与利益攫取之间的张力——一个在其他领域已为人熟知的故事
分子生物学不是第一个经历这种张力的领域。在人工智能领域,开源运动——Meta的LLaMA、欧洲的Mistral、阿联酋的Falcon——正面临OpenAI、Anthropic和谷歌对最强模型的日益集中控制。这种类比不只是修辞:两个领域面临的问题相同——基本认知基础设施是留作公共物品,还是成为少数参与者掌控的资源。本刊此前关于微软和亚马逊吸收顶尖AI实验室的报道,清晰呈现了这一攫取机制:无需正式收购,凭借计算资源的体量即可实现控制。
基因组学领域的这种张力更为古老。人类基因组计划(1990-2003)在某种程度上是一场竞赛:一边是国际公共联盟,另一边是Craig Venter的塞莱拉基因组学公司(Celera Genomics),后者试图为基因组申请专利。联盟通过逐步公开数据、使专利申请失效而部分获胜。但这场胜利并未终结争论:此后,23andMe、Ancestry.com及其后继者建立了拥有数千万份基因组档案的私有数据库,长期治理问题至今悬而未决。
蛋白质图谱延续了这一历史脉络。蛋白质是药物的作用层面。抗体、小分子、细胞疗法,都针对特定构象的特定蛋白质。谁掌握完整的三维人类蛋白质组图谱,谁就拥有他人难以轻易复制的药物发现基础设施。
开放数据库对制药研究的实际改变
药物发现遵循一个有据可查的漏斗模型。初始阶段筛选出的1万个候选分子中,约10个进入人体临床试验,最终只有1个获得上市许可。据估计,获批药物的平均成本超过10至20亿美元,但因统计口径不同,这一数字存在较大争议。
蛋白质结构数据库最能改变局面的环节是虚拟筛选阶段。研究团队在合成和实物测试数千个分子之前,先通过计算机模拟,判断哪些分子可能与靶蛋白在特定构象下结合。模拟质量直接取决于可用蛋白质结构的精度。
常见癌症、心血管疾病、糖尿病等领域的主要靶点,实验结构已存入蛋白质数据库(PDB),该库目前收录逾22万个结构。但对于研究较少的蛋白质、新兴病原体、罕见病相关变体,结构通常只有预测版本,甚至完全缺失。
生物中心图谱改变局面的对象,正是那些无力承担产业级资源的团队。肯尼亚一所大学、巴西一个研究热带病的实验室、越南一个研究本地病原体的团队,都无法资助大规模晶体学项目。有了这份开放图谱,它们获得的起点与诺华或辉瑞的团队相同。
这一逻辑有一个必须说清楚的局限。ESMFold2的精度并不均匀。对于本质无序蛋白、多蛋白复合物、膜蛋白——这些类别对药理学尤为重要——蛋白质语言模型的预测不如AlphaFold3所用的混合方法或实验方法可靠。这份图谱打开了访问通道,但并未解决所有精度问题。
生命数据的长期争夺战
这份图谱的意义超出结构生物学范畴。在二十到三十年的时间跨度内,真正在博弈的是精准医学的控制架构。
精准医学的核心前提是:疾病并非千篇一律。两种肺癌可能具有完全不同的分子谱,因而对不同治疗有不同反应。绘制这些分子谱、确定适配疗法,需要大规模整合基因组、蛋白质组、代谢组和临床数据。掌握这些交叉数据,就掌握了预测能力。
目前,这种能力正在集中。英国NHS生物样本库和美国主要学术中心(NIH All of Us、UK Biobank、芬兰FinnGen)保持受控但开放的访问。但私有数据也在快速积累:Eric Lefkofsky创立的Tempus AI已建成美国最大的私营临床肿瘤学数据库之一,2024年估值达数十亿美元;被罗氏收购的Flatiron Health从数百家医院的电子病历中聚合肿瘤学数据。这些数据的治理问题——谁可访问、价格如何、用途范围——目前没有任何稳定的国际框架。
生物中心的发布没有解决这一问题。但它确立了一个有分量的先例:如此体量的基础数据基础设施,可以通过慈善资金,以可接受的成本维持开放获取。这一先例将在未来监管辩论中具有参考价值,尤其是在欧洲——《欧洲健康数据空间》(EHDS)法规自2022年起试图推动全欧范围内的医疗数据共享。
使局势更趋复杂的,是结构数据与基因组数据的融合趋势。Isomorphic Laboratories(DeepMind子公司,2021年成立)和Recursion Pharmaceuticals等公司,正在开发整合蛋白质结构、细胞数据与临床数据的模型,目标不只是预测蛋白质形状,而是直接预测药物效果。如果这些整合模型保持封闭,生物中心的开放图谱将有其价值,但仍嫌不足:它是拼图中一块自由的碎片,但拼图的关键仍是私有的。这是开放战略的一个结构性弱点,值得明确指出。
反过来,如果该图谱真正被全球学术界使用和扩充——非洲、东南亚、拉丁美洲的团队在此基础上开展研究——它将形成一个使攫取变得困难的临界规模。没有哪家公司能轻易替代一个数千个团队已在其上建立工作的基础设施。Linux、Apache软件、维基百科走过的都是这条路:用户社区的规模,成为抵御私有化的屏障。
这种动态还有代际维度。今天以开放获取方式进入职业生涯的研究人员,将对数据访问的”正常状态”形成不同的直觉。他们将构建出相应的实践、工具与预期,使得二十年后关闭类似基础设施在政治上变得困难。技术先例同时也是文化先例。
十八个月后,采用数据将说明问题
图谱已发布。下一个问题是实证性的:有多少团队在使用它,用于什么,取得了什么结果?
下载量和引用量是第一个信号,但并不充分:一个被下载却未产出成果的数据库说明不了什么。更可靠的标志是:引用该图谱作为主要结构来源的论文、通过实验验证而确认或修正ESMFold2预测的新结构提交,以及最初基于该图谱数据发现的药物所进入的临床试验。
AlphaFold2的先例值得参考。据EMBL-EBI数据,AlphaFold数据库发布后两年内被下载逾150万次,在超过1.4万篇科学论文中被引用。研究疟疾、利什曼病、恰加斯病等被忽视热带病的团队,都将AlphaFold结构列为筛选项目的起点。疟疾药物风险投资公司(Medicines for Malaria Venture)从AlphaFold结构中识别出新的治疗靶点,多种候选分子目前已进入临床前试验。
生物中心图谱的起点更宽,模型不同,覆盖范围可能更广。其精度局限已有文档记录,公开透明。这种透明本身就是良好实践:高估自身精度的数据库是危险的;诚实说明误差范围的数据库,才能被可靠地使用。
十八个月后,如果东南亚或撒哈拉以南非洲的团队发表以该图谱为基础设施的研究,生物中心将证明慈善机构很少能证明的一件事:开放科学不只是一种理想,它可以是一种有效策略。如果该图谱仍主要由那些本来就能获得替代资源的团队使用,这次发布有其价值,但并未改变研究的地理格局。
这种转变并无保证。但多年来在这个领域,这是第一次有一个主要参与者,有意识地、大规模地选择不去攫取本可攫取的东西。
来源
- Futura Sciences / 陈-扎克伯格生物中心 — 十亿蛋白质图谱,2026年5月
- EMBL-EBI — AlphaFold数据库(使用数据和下载统计):alphafold.ebi.ac.uk
- 蛋白质数据库 — rcsb.org(已提交结构统计)
- Nature — AlphaFold2原始论文(Jumper等人,2021年),无保证链接
- DeepMind / Isomorphic Laboratories — 成立公告,2021年(机构来源,无保证URL)
- NIH All of Us研究计划 — allofus.nih.gov
- UK Biobank — ukbiobank.ac.uk
- 生物中心关于ESMFold2 / ESM图谱的官方公报(2026年5月27日)— biohub.org/news/world-model-of-protein-biology/
- Google DeepMind — AlphaFold(官方页面):deepmind.google/science/alphafold/
- AlphaFold3 — 参数使用条款(GitHub DeepMind):github.com/google-deepmind/alphafold3
- EMBL-EBI — AlphaFold数据库:alphafold.ebi.ac.uk
- 维基百科 — 陈-扎克伯格生物中心:en.wikipedia.org/wiki/Chan_Zuckerberg_Biohub
- Science(2012)— 蛋白质折叠问题,50年后:science.org/doi/10.1126/science.1219021
- Nature — 23andMe计划出售其庞大的基因数据库:nature.com/articles/d41586-025-01004-3
- STBIO — 蛋白质结构成本:stbio.de/kosten_en.html