本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。
L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.
— 《进步者日报》编辑部 / La rédaction
地球上现有约7,000种活语言。如今为语音助手、翻译工具、教育平台和搜索引擎提供支持的大型语言模型,能够正确处理的语言只是其中一小部分。这不是技术偶然。模型从网络上已有的内容中学习,而网络内容反映的是三十年来构建数字世界的权力、基础设施和投资失衡。
太平洋地区是一个典型例证。仅巴布亚新几内亚就有约840种语言,占全球总量的10%以上。但太平洋岛屿语言在大型模型的训练数据中几乎没有存在感。这一失衡在各大科技中心鲜有人关注,却产生了切实影响:在数字化取代口头传承的地方,这些语言在可用的工具和服务中缺席。
这个案例并非孤例。它揭示了一种结构性现象,波及非洲语言、美洲原住民语言、东南亚方言及更多其他语言。凡是一种语言缺乏数字存在感的地方,模型就处理不好它。而模型处理不好它的地方,它的数字存在感就会进一步萎缩。
核心要点
太平洋地区集中了1,200多种活语言,但几乎没有通用大型语言模型覆盖它们。至少存在一个针对萨摩亚语优化的开放模型,但所有上述语言是否完全没有大型语言模型尚未得到证实(UNESCO,2025年)。
大型模型的训练数据以英语为主:根据现有估算,英语占词元总量的45%至65%,数据来源包括Common Crawl、维基百科及国际学术文献等语料库分析。
在训练数据中代表性不足的语言上,大型语言模型的事实准确性更低——多项关于模型多语言表现的近期研究已通过实证方式确认这一结论。
2035年前的可能走向包括:无声的数字性消亡、无实际使用的遗产式保存,或通过开放语料库和社区合作实现语言复兴。
已有一些举措在推进——Mozilla的Common Voice、南非的MzansiLM、Orange与Meta和OpenAI就沃洛夫语和富拉尼语开展的合作项目——但面对挑战的规模,这些举措资金不足、分散零碎。
一种机械性失衡,而非宿命
大型模型从网络、数字图书馆、新闻档案中的文本学习。一种数字文本存在感不足的语言——网站少、数字化书籍少、网络媒体少——在这些语料库中必然处于弱势。
这不仅仅是数量上的偏差,而是一种自我强化的结构性偏差。在训练数据中代表性不足的语言,产生了处理它时表现欠佳的模型,这可能打击用该语言生产文本的积极性,从而加剧代表性不足。循环就此形成。
研究人员将这一现象称为”过度代表与代表不足偏差”:某些群体、某些文化、某些语言在语料库中被过度代表,另一些则几乎缺席。模型复制并放大了这些失衡,因为它们优化的是主导性统计模式。研究越来越清楚地表明,大型语言模型在使用者较少、训练数据中存在感较弱的语言上事实准确性更低。这不是可以修补的边缘缺陷,而是这些系统架构本身的直接后果。
还存在一种交叉干扰:即使多语言模型用少数语言生成内容,英语——训练数据中的主导语言——的痕迹也会渗入语言形式、句法结构和文化联想之中。生成的语言在技术层面存在,但在文化层面已经变形。
太平洋语言:一种普遍机制的典型案例
太平洋是世界上语言多样性最丰富的地区之一。仅巴布亚新几内亚就有约840种不同语言。瓦努阿图拥有30万居民,境内语言超过130种。这些语言承载着航海、植物学、习惯法和宇宙观等知识体系,任何英文词典都无法容纳。
数百年来,这些语言的传承运作正常:口耳相传,以身示范,代代相继。这条渠道并未消亡。但第二条渠道出现了,而这些语言在其中没有立足之地。
对于太平洋多种岛屿语言而言,数字代表性不足的循环一旦启动,若无外部干预将难以扭转。制约因素是多方面的:网络连接有限、数字技能匮乏、用于语料库采集的资金不足(包括录音、转录、标注、整理),以及在往往分散的举措之间调整互操作标准的必要性。
限制这些语言模型开发的不只是技术复杂性。在非洲、东南亚和美洲,都有人为低资源语言构建模型。而在太平洋地区,对数字语言基础设施的投入始终有限。
非洲与美洲:同一机制,不同面孔
太平洋只是众多案例之一。在非洲,全球估计三分之一的语言在这里被使用,情况在结构上大致相同。尽管其中一些语言有数千万使用者,非洲语言在全球数字世界中仍严重代表不足。多语言复杂性、有利于殖民语言的主流政策、薄弱的机构支持以及数字基础设施匮乏,共同维持着这些语言在AI系统中的弱势地位。
影响是可测量的。GPT-4o在英语上的准确率超过90%,对多种非洲语言的表现却跌破40%——这一差距已被近期基准测试记录在案。豪萨语、约鲁巴语、伊博语等语言各有数千万使用者,但历史上一直缺乏高质量数据集,难以融入先进AI系统。
一些举措正在涌现。在南非,开普敦大学的研究人员开发了MzansiLM,一个能够处理该国11种官方语言的模型,依托名为MzansiText的专项语料库。Orange正与OpenAI和Meta合作,针对沃洛夫语和富拉尼语——西非两种各有数千万使用者的语言——微调模型。这些举措展示了一种新兴势头,但在一个由数十种语言主导的格局中,它们仍是例外。
这一现象超越了非洲。在美洲,原住民语言——从克丘亚语到纳瓦特尔语,再到加拿大原住民各族的语言——处于类似境地。在东南亚,数百种地区方言在通用模型中仍然缺席。所有这些案例的结构都相同:预先存在的数字存在感薄弱,训练语料库将其忽视,模型进一步将其边缘化。
数字化压力下的语言传承
口头传承有其自身的生存条件:它需要人与人的共处、社区的延续、语言在日常生活中发挥作用的空间。在世界许多地区,这些条件正在城镇化、经济移民和殖民语言或强势语言教育的冲击下不断侵蚀。
数字化转变改变了这一问题的性质。当一个12岁的汤加孩子搜索自己文化的相关信息时,他面对的是一个用英语回复的搜索引擎。当尼日利亚的约鲁巴族学生使用语音助手时,助手回应他的不是他自己的语言。当一个社区想用自己的语言生产数字内容时,它面对的是现有工具的种种缺口:适配的键盘、拼写检查、语音合成。
数字化在口语从未占据的空间里制造了一种向强势语言靠拢的压力。年轻一代很快发现,母语在家庭领域运作,在数字领域却隐而不见。
一些分析认为,将大型语言模型作为文化传承基础设施的转变,可能会制造一种新的合法性过滤器。在模型中的代表性不足可能降低一种文化的数字可见度和可及性。若缺乏支持,一些社区可能面临不充分的代表性,但它们也可以参与数据治理,创建或改编自己的工具。
这一机制与我们在AI对文化多样性的冲击中记录的情况相互印证:AI工具放大了已占主导地位的事物,将已处于脆弱状态的事物进一步边缘化。
通向2035年的三条路径
2025年UNESCO路线图呼吁加强弱势语言在数字基础设施中的存在感。问题在于这些语言将以何种方式存在于数字空间,以及这种存在或缺席将对其长期活力产生什么影响。
根据2035年前干预措施的力度和性质,可以区分出三条轨迹。
第一条轨迹是无声的数字性消亡。缺乏有针对性的投资,弱势语言在训练语料库中的代表性受限。数字工具可以在强势语言中运作,却对其他语言残缺不全,甚至付之阙如。随着时间推移,更多在屏幕前学习的世代可能形成这样的认知:母语属于私人领域,而强势语言主宰着有用的数字应用。在这一情景下,口头传承可能因使用场景收缩而受到影响。
第二条轨迹是遗产式保存。语料库被采集,档案被建立,但缺乏将其转化为活态工具所需的整理工作。语言作为文献记录对象得以留存,可供研究者查阅,陈列于数字档案之中,但在日常使用和常规教学中依然缺席。这是许多语言的命运——它们受益于文献记录的努力,却未能受益于语言复兴的努力。档案取代了实践。
第三条轨迹需要一次机制性转变。由国际机构、国家政府、地区大学和社区协同推进的公共投资,可以为开放模型建立语言语料库创造条件。语言数据社区所有权标准有助于社区掌控其数据的使用方式。将这些模型融入教育工具、数字平台和地方媒体,可以强化相关语言的存在感。语言可以在数字空间占有一席之地,从而强化而非取代其口头或家庭传承。这是在资源和协调方面要求最高的一条轨迹。
已有的成果与仍然缺失的部分
Mozilla Common Voice是多语言语音数据开放式众包采集的主要平台之一。它采用参与式模式:使用者录制句子,其他人进行验证。过去几年,数十种语言被添加进来,其中包括若干非洲和美洲原住民语言。太平洋岛屿语言中,几乎没有哪种在该平台上拥有可观的语料库。
研究人员正在为面临数字性消亡风险的语言开展语料库采集项目。但这些项目绝大多数仍处于框架制定阶段或资金不足阶段。关于数据社区治理的规范尚未确立。
太平洋地区的大学——南太平洋大学、巴布亚新几内亚国立大学——设有语言记录项目。研究人员生产语法书、词典和音频档案。但从学术语言档案到可用于训练语言模型的语料库,之间存在相当大的距离。这项转化工作需要专业技能,而这类技能在该地区供给十分有限。
数据权利问题同样敏感。这一问题在非洲、美洲以及所有社区数据被采集和利用却未能惠及相关社区的地区,都以同等尖锐的方式存在。民族志和基因研究的经历留下了持久的不信任感。任何可信的项目都必须提出社区知识产权框架,确保语言数据属于使用者,而非利用这些数据的平台。
这一挑战与我们在其他地方记录的更广泛张力相互呼应:采用数字工具却不培训本地人才,等同于将自身发展轨迹外包出去。若缺乏数据和社区参与,工具就可能无法准确代表当地语言和需求。
可供观察的信号
未来几年,有三个指标可以帮助判断弱势语言在上述三条轨迹之间的位置。
第一个指标是在Hugging Face或Common Voice等平台上拥有开放语料库的语言数量增长情况。萨摩亚语、斐济语、沃洛夫语或斯瓦希里语已有一些资源,但对于绝大多数相关语言而言仍然十分有限。若2028年前出现显著增长,则意味着局势已经改变。
第二个指标是UNESCO就濒危语言数字保护标准所展开的讨论进展。这一磋商涉及对UNESCO 2015年关于文献遗产(包括数字遗产)建议书的跟踪落实。若缺乏统筹协调的框架,各项举措将持续分散。
第三个指标是各国政府自身的投资决策——无论是太平洋岛国政府、非洲各国政府,还是拥有原住民社区的国家。其中一些国家已在教育系统中推行国家语言促进政策。若这些政策延伸至数字领域——将语言语料库纳入学校课程、资助语言工程师、与地区大学建立合作——则将是走向第三条轨迹的有力信号。
AI不是注定要成为一台语言压路机。它也可以成为语言复兴的工具,前提是数据存在,且社区权利得到尊重。新西兰的毛利语已在这方面有所尝试,并取得了令人鼓舞的成果:与使用者共同建立语料库,训练模型,逐步整合进教育工具。这条路是已知的。大多数情况下,缺的不是方法,而是政治意愿和资金。
参考来源
- Artsjournal – 大重新谈判:关于2026年文化走向的五个思路
- UNESCO濒危语言项目2025年报告,关于面临数字性消亡风险的语言(unesco.org/endangered-languages)
- 乔治城大学亚洲-大洋洲研究所,《太平洋数字鸿沟:数字殖民主义与语言代表性简报》,2026年
- Mozilla Common Voice,可用语言清单
- Hugging Face Datasets,低资源语言语料库清单
- Alain Grandjean,《大型语言模型与范式偏差:各学科分析框架》,2026年(alaingrandjean.fr)
- 国际治理创新中心,关于非洲语言与AI的要点,Ife Adebara,第216号备忘录,2025年11月(cigionline.org)
- AfricaNLP研讨会2025,多语言与多文化感知大型语言模型(sites.google.com/view/africanlp2025)
- Orange新闻室,Orange将非洲地区语言整合进开源AI模型,2025年
- Osiris.sn,AI:南非推出适配11种官方语言的模型,2025年



