本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。
L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.
— 《进步者日报》编辑部 / La rédaction
欧洲的博物馆、图书馆和档案馆藏量丰厚,但它们在 AI 训练语料中的存在仍然零散。Europeana 汇集了来自 4 000 多家机构的 6 000 万件藏品。Google Books 在差不多同样的时间里数字化了约 4 000 万本书,语料以英语为绝对主导。大语言模型在这些数据上训练,学到的是按照”谁先数字化、由谁数字化”形成的方式来描述、分类和解读世界文化遗产。
要点
- AI 训练语料决定它将产出怎样的叙事:数字化欧洲文化遗产同样是文化主权问题。
- Europeana 汇集了来自 4 000 多家欧洲机构的 6 000 万件藏品,但欧盟委员会 2024 年的一份报告指出,为 2030 年设定的数字化目标面临无法达成的风险。
- Google Books 数字化了约 4 000 万本书,语料由英语主导,为 AI 模型提供了一个以英美为主的文化参照系。
- 如果欧洲资源在训练数据中仍代表性不足,AI 就会依据外部来源重建欧洲遗产,带着外部来源的视角和盲区。
- 一些公共和学术项目试图纠正这种失衡,但推进速度和资金是最关键的两个变量。
语料即信息
大语言模型背后有一个简单的原则:它们学到的是人们展示给它们的东西。一个在数百万篇英文文本上训练出来的模型,会对意大利文艺复兴绘画知道很多,但那是从伦敦或纽约看过去的版本。一个用意大利语原始资料、佛罗伦萨博物馆藏品目录、罗马艺术史家通信喂养出来的模型,会知道另一些东西,并且会用不同方式讲出来。
达·芬奇的出生日期不会因为语料语言不同而改变。但解读、框定方式、联想,以及作品、艺术家和时期之间那些隐性的高低排序,取决于谁写的、用什么语言写的、这些文字是否被数字化。法律与文化符号学研究者已记录了这一机制:有偏的语料会产出有偏的推论,即便在文化遗产这类看似中立的主题上也不例外。
这与其说是技术问题,不如说是政治问题。文化遗产的数字化,既关乎保存和开放获取,也关乎界定 AI 认为什么是合理的、典型的、核心的,什么又会被它当作边缘的或异域的。
6 000 万件藏品,但 2030 年目标面临风险
Europeana 是一项实打实的成果。该平台于 2008 年启动,如今汇集了 6 000 万件数字化藏品——绘画、手稿、照片、地图、乐谱——来自全欧 4 000 多家机构。它是世界上规模最大的文化语料之一,它的存在本身说明,让欧洲文化遗产在线可及是真实的政治意愿。
欧盟委员会 2024 年的一份报告给这种乐观降了温。欧洲数字化战略为 2030 年设定的目标,尤其是数字化速度方面的目标,被判定为面临风险。原因有多重:多个成员国资金不足,大型国家级机构与小型地方博物馆之间技术能力悬殊,各国之间缺乏足够的协调。6 000 万件藏品这个总量掩盖了更零散的现实:有些馆藏数字化率达到 80%,有些则不到 5%。
这种滞后对 AI 有直接影响。没有数字化的东西,对语言模型来说就不存在。这个空缺会被其他来源填补,通常是英语来源。
关于法国文化遗产消失的那篇文章,已就实体传承给出了同样的诊断。数字化是同一问题的数字版本:没有有组织的行动,结果就是默认放弃。
Google Books 作为全球参照系
Google Books 于 2004 年启动。二十年间,该项目数字化了约 4 000 万本书,大部分来自美国和英国的大学图书馆——哈佛、斯坦福、牛津、密歇根。这个语料规模巨大,对语言模型的影响难以低估:GPT、Gemini 及其竞争对手,都直接或间接地在部分源自这批藏书的文本上训练过。
语言偏倚有据可查。在 Google 数字化的图书中,英语占据压倒性主导,西班牙语、法语和德语远远落在后面。中欧和东欧语言——波兰语、罗马尼亚语、匈牙利语、捷克语——在结构上代表性不足。国际使用人数少的语言,如马耳他语、爱尔兰语、卢森堡语,则几乎不见踪影。
这种失衡不是 Google 的道德过失。它反映的是参与项目的图书馆的真实情况,以及最容易获得版权许可的图书是用什么语言出版的。但影响是真实的。一个读到的关于巴洛克艺术的英文文本比波兰语或匈牙利语文本多十倍的 AI 模型,它形成的联想、参照和高低排序,会与克拉科夫或布达佩斯的历史学家不同。
实际问题在于,欧洲将如何应对这一差距。
欧洲机构尝试做出的纠正
多个公共和学术主体已认识到问题的严重性,正在研究具体的应对办法。
Europeana 自身也在演变。该平台不再只是汇集元数据,它正在推进数据互操作性,好让它汇集的语料能够被用作欧洲 AI 模型的训练数据。在”欧洲文化数据云”框架下启动的 Europeana Data Space 计划,目标正是让这 6 000 万件藏品可供研究者和 AI 开发者使用,而不只是让网民浏览。
由 11 所欧洲大学组成的 Una Europa 高校联盟,已就文化遗产在数字语料中的呈现展开研究。核心思路是:欧洲大陆的语言和文化多样性必须转化为数据的多样性,否则欧洲自己开发的 AI 工具会不自觉地把外来范畴当作自己的思考框架。
欧盟委员会已将文化遗产数字化纳入其数字战略。2024 年通过的《人工智能法案》对高风险模型的训练数据引入了透明度要求。这些条款有可能形成监管压力,促使 AI 开发者记录并多样化自己的语料。这是一根间接的杠杆,但确实存在。
这一点与本刊此前发表的一个思考相通:AI 进入组织时更像一个系统,而不是一件工具。同样的逻辑适用于文化机构:在不对训练数据作任何反思的情况下引入 AI,只会复制既有的等级秩序,而不去重新审视它。
文化软实力在语料中见分晓
文化软实力的历史从来都是在基础设施上见分晓:罗马帝国的图书馆、17 世纪的法国学院、20 世纪的好莱坞。每个时代都产生了文化生产与传播的中心,其影响力越过了政治边界。
AI 训练是新的基础设施。一个被英语来源大量喂养的语言模型,会用这些来源的范畴、参照和排序来描述世界,包括欧洲遗产。当前 AI 对欧洲遗产的描述并非错误,但它们读到的版本经过了过滤。这一版本将大规模扩散:进入教学工具、文化导览应用、研究助手、博物馆目录的自动翻译。
到 2030 年,如果欧洲的数字化目标仍面临风险,AI 在解读欧洲遗产时对英语语料的依赖,就可能从过渡阶段固化为稳定状态。构建有竞争力的语料,窗口期并非无限:下一代模型将用未来五到十年间可获得的数据来训练。
决定成败的变量:资金、协调、数据开放
三个因素决定欧洲能否缩小这一差距。
首先是资金。大规模数字化成本高昂:实体扫描、元数据、版权、存储、维护。多个成员国对本国项目投入不足,使地方机构缺乏资源。委员会 2024 年的报告把资金缺口列为 2030 年目标的主要障碍之一。有针对性的预算加码——尤其是通过结构基金或”创意欧洲”计划——会是最直接的杠杆。
其次是协调。Europeana 的 4 000 家机构使用的标准、格式和成熟度差异极大。数据互操作性是这些语料能用于训练 AI 的必要条件,而它所需要的统一,无论市场还是各国机构都不会自发产生。这本就是欧洲协调机构该扮演的角色,前提是它拥有足够的授权和资源。
最后是数据开放。一部分已数字化的藏品仍处于复杂的权利制度之下,无法用于训练模型。公有领域的作品在理论上是自由的,但对数字化成果本身,出资机构有时会主张邻接权。简化这些制度——尤其是针对研究和非营利 AI 训练用途——可以在不等新一轮数字化的前提下,释放一部分现有语料。
这三项工作都是已知的,它们出现在欧洲各类报告中已有多年。根据 2024 年的报告,缺的是执行速度。紧迫性来自 AI 的时间表,而不是文化遗产的时间表。
算法与档案
AI 的发展给欧洲遗产带来的问题,在结构上并不新鲜。它类似 JdP 曾记录过的调查新闻面对算法的情形:当传播和分类的基础设施被语料和利益都与内容生产者不同的一方掌控时,内容生产者就会逐渐失去对自己可见度和自身被解读方式的掌控。
对文化遗产而言,机制类似,但多了一重时间上的不对称。一篇新闻稿可以重新发布、以不同方式被索引、明天就进入新的语料。一个大语言模型的训练语料是在某个时点一次性构成的,它的偏倚会在多年里塑造这个模型。可行动的窗口更窄,不作为的代价也更持久。
欧洲手里有一张体量牌:6 000 万件数字化藏品已构成一个可观的语料,出自拥有合法性和历史深度、任何私人项目都难以在短期内复制的机构。条件是这个语料要在下一代模型完成训练之前,在技术上、法律上和资金上都变得可用。
谁先数字化,谁就书写 AI 将讲述的历史。欧洲已经数字化了很多。它必须现在决定,是否也要界定这些数据如何喂养那些将重新解读它自身遗产的工具。
来源
- 欧盟委员会,数字战略:2024 年文化遗产数字化报告
- Europeana,2023 年汇总数据(europeana.eu)
- Springer《法律与符号学国际期刊》,2023 年,数字语料与语言模型中的文化偏倚
- Una Europa,AI 训练语料中文化遗产呈现问题研究
- 欧盟委员会,《人工智能法案》,2024 年,训练数据透明度条款(eur-lex.europa.eu)



