本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。
L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.
— 《进步者日报》编辑部 / La rédaction
每当一个大型AI模型在上一代模型的输出上训练时,它都会再多抹去一点原始数据中本就属于少数的东西。这不是可以修复的漏洞,而是迭代训练的统计学属性。机器最先遗忘的,是稀有语言、从未数字化的叙事传统、在英语语料库中从来无足轻重的文学经典。世界文化正在收窄。这一现象隐蔽而渐进,今天的语料选择会把它写入基础设施,持续一代人。
要点
不加区分地在合成输出上进行递归训练,在某些条件下可能给模型引入不可逆的缺陷。欧洲人很大一部分观看时长花在美国内容上,非西方创作者在训练数据中代表性不足。平台及其推荐系统影响着可见度和收入,这个市场的收入集中在大厂牌和流行艺人手中。这一机制会自我强化:把边缘创作者排除在外,使未来的数据变得贫瘠,进而产出更加狭窄的模型。可行路径包括语料库多样性配额、对推荐算法的监管、创作者的集体权利,但落地仍然有限。
模型崩溃:一个循环如何吃掉多样性
语言模型从大型文本数据集中学习,这些数据历史上主要来自人类,但也可以包含合成内容;图像和声音则属于多模态模型的范畴。当真实数据在每一代都被合成数据取代时,初始分布中的信息可能在每次迭代中丢失,但这一结果并非普遍成立。最先丢失的,正是原始数据中本就属于少数的部分。
Shumailov 等人(2024)研究了多代在生成数据上递归训练的模型。研究显示,在合成数据上递归训练的场景中,生成模型出现退化,但该研究并未评估某个普遍的文化阈值。数字代表性低的语言在后续世代中往往被代表得更少。非英语文学参照逐渐消失。
口述文化或非数字化史诗传统所特有的叙事结构,可能无法被后续模型忠实地再现。
技术术语叫”model collapse”(模型崩溃),即模型塌缩到一个缩小的可能回答集合。但在这个说法背后,是极为具体的东西:一个不再会写富拉尼族故事的模型,一个不再认得当代日本小说结构的模型,一个把”文学”系统性地等同于少数几部西方经典的模型。
这一机制源自合成数据上迭代训练的统计学属性,单靠调试无法修复。输出的分布向主导众数收敛,而当今数字语料库的主导众数,压倒性地是美国和英语的。
欧洲人观看时长的61%花在美国内容上
美国内容在全球平台上的主导地位早于生成式AI。大型生成模型在影响内容生产的层面上,可能会强化这种失衡。
据欧洲视听观察站的数据,在2022年9月至2023年9月间研究的9个欧盟国家中,美国作品占SVOD观看时长的61.2%。Netflix、YouTube或Spotify的算法优化的是参与度,而平均参与度奖励的是熟悉、平滑、似曾相识的东西——认知科学研究者称之为”处理流畅性”,即大脑理解它所认出的内容时的轻松程度。
非西方传统在训练数据中代表性不足或代表性失真,算法策展可能进一步不利于知名度较低的创作者。Daryani 等人考察了大语言模型带来的文化同质化和叙事结构趋同风险。
用于训练大模型的语料库,对口述传统、未数字化档案或少数语言内容的收录有限。UNESCO 记录的7,000种语言在其中的代表性极不对称:约一百种语言集中了绝大部分可用数据,其余语言的代表性极低。除非采取明确的再平衡和评估措施,这种失衡将反映到模型中。
十年间,创作者的报酬已大幅下滑
注意力经济从来就不平等。但向生成式AI的转型造成了程度上的断裂。
创作者可以通过版税和授权获得报酬。数字收入在创作者收入中的比重越来越大,但不稳定、收入波动以及与知识产权相关的风险也在加剧。一些音乐人的作品被用来训练生成模型,却既没有明确同意,也没有可辨认的补偿,其数据的使用往往缺乏透明度。
这个问题既关乎体系的存续能力,也关乎分配正义。文化价值与创作者报酬之间的关系,早在AI之前就已经松动。生成式AI通过加入第三个玩家放大了这一趋势:模型生产出”受”整个语料库”启发”的内容,而没有人能清楚指出哪一份贡献在其中占了多少分量。
一些创作者减少活动,或调整产出以贴合推荐算法的期待。文化多样性可能因此受损,进而影响未来的训练数据。循环就此闭合。
UNESCO的尝试及其局限
制度框架并非沉默。UNESCO后续的数字指导方针和2021年《人工智能伦理问题建议书》,都涉及算法对文化多样性的影响。但该公约是软法工具,设定的是方向,不是有约束力的义务。
欧盟走得更远。《视听媒体服务指令》要求大型平台在其目录中至少保留30%的欧洲内容。但目录配额不等于推荐配额:一部存在于Netflix片库中、却从未被推荐算法推到前台的欧洲电影,对61%的美国观看时长占比毫无改变。
平台监管通常针对内容供给,而真正的影响力是通过推荐行使的。如果推荐算法继续把用户引向平均参与度占优的内容,强制目录多样性就不够用。算法透明度的问题——公布推荐标准的义务、对文化偏见的独立审计——在大多数司法辖区仍悬而未决。
算法合法性的问题超出了文化领域:当一个自动化系统决定什么可见时,它的决策标准就成为头等政治问题。
2026-2030窗口期:在退化被写入基础设施之前
未来几年具有决定性。目前正在设计中的大模型,其语料选择与加权方式将影响下一个周期的数字文化生产。
若干技术路径已有严肃的学术发表。通过主动筛选和加权,使语料库纳入代表性不足的语言和传统,是短期内最有希望的一条。这要求大模型的训练团队把文化多样性当作质量目标,与事实准确性或逻辑一致性同等看待。数字化口述档案、翻译冷门文本、给多语种标注者付酬,这些成本没有理由完全由私人实验室承担:这既是技术问题,也是组织和经济问题。
第二个杠杆是监管训练数据。强制模型开发者公布语料库构成,并遵守语言和文化多样性的最低门槛,在技术上可行。欧盟已在《人工智能法案》中写入透明度要求,但没有关于文化多样性的量化规定。用精确、可审计的指标补全这一框架,是一个可以在2026-2028年间做出的政治决定。
第三个杠杆是经济性的:为作品被用于训练语料的创作者建立集体报酬机制。已有若干参考模式——音乐领域的集体管理、新闻界的邻接权——但还没有一个被改造以适应大语言模型的复杂度。UNESCO 2025年建议探索这条路径,成员国尚未将其转化为立法。
这三个杠杆都预设了同一点:必须集体决定,文化多样性是值得公共投资和监管约束的共同财富。这一预设存在争议。一些行为者主张,过重的干预可能把互联网割裂成封闭区域,每个地区强加自己的文化配额,表面上的多样性掩盖了交流的巴尔干化。这个论点值得认真对待。但它建立在一个假设之上:市场若放任自流,会产出更多多样性。
不干预的情况下,存在内容向少数几个实验室集中、趋向主流文化注册的风险。Shumailov 等人(2024)在合成数据递归训练场景中记录了生成模型的退化,但未评估普遍的文化阈值。目前,已有多代大模型在训练中纳入了合成数据。
已在推进中的具体举措
来自实地的压力已经存在。
Mozilla的Common Voice项目收集代表性不足语言的语音数据,已积累逾30,000小时、涵盖约一百种语言的录音——相对于实际需求仍是少数,但证明了社区采集的可行性。非洲研究者集体Masakhane专注于撒哈拉以南非洲语言的自然语言处理,成果以开放获取方式发布。AI4Bharat为印度语言做同样的工作。
这些项目在主要商业平台之外运作,资源有限,开发者没有义务采用其成果,影响力因此有限。监管可以介入:资助缺失数据的生产,并建立代表性标准,而不必干预模型的审美取向。
韩国自2021年起资助一项国家项目,将非物质文化遗产数字化为AI模型可用的格式,提供了定向公共政策的一个范例。法国于2024年宣布的法语与多语主义计划也在推进类似反思。这些举措仍属孤立,在欧洲或国际层面的协调尚未实现。
语料库治理——即将构成未来模型文化记忆的数据集——目前没有明确的归属。工业实验室在前沿模型开发中居主导地位,但语料选择并非纯粹的私人事务:各国监管机构可以主张权力,但这带来巴尔干化的风险;目前没有专门负责AI语料治理的多边机构,而UNESCO已有负责数字文化多样性的现成机制。未来数年的决定,将决定文化多样性能否被纳入下一代模型的设计之中。
来源
- Frontiers Communication(2026),生成模型对文化多样性的退化影响:https://www.frontiersin.org/journals/communication/articles/10.3389/fcomm.2026.1828344/full
- Zolynski 等人(2026),模型崩溃与文化粒度(引自 Frontiers Communication 2026)
- Daryani 等人(2026),推荐算法与伪文化多样性,SAGE Publications
- ACM CHI(2026),训练语料库中的文化遗产与代表性
- UNESCO(2025),文化表达多样性公约工作组



