关于本中文版的说明  /  Note sur cette version chinoise

本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。

L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.

— 《进步者日报》编辑部  /  La rédaction

核心要点

  • LATAM-GPT汇聚了15个国家的65家机构、8 TB数据和1000万美元基础设施投入。发布六个月后,尚无任何企业合同记录在案(TechPolicy.Press,2026年)。
  • 80%的拉丁美洲企业使用ChatGPT。商业偏好跟随的是感知性能与使用习惯,而非模型的产地。
  • 非洲的Masakhane和东南亚的SEA-LION出现过同样的落差:学术成果扎实,商业采用缺位。这是一种结构性规律,不是地区性失败。
  • 全球7000种语言中,仅500种在网络上有所呈现(联合国教科文组织)。LATAM-GPT的文化合理性真实存在,但仅凭这一点无法创造市场。
  • 核心问题:在没有旨在创造需求的公共政策支撑下,主权模型能否找到商业可行性?

65家机构、一个模型、商业采用仍缺乏记录

截至2026年7月28日,即发布后第五个月第十八天,已查阅的公开资料尚未对私营合同情况进行完整记录。

LATAM-GPT源于一种共同判断。来自智利塔拉帕卡大学、墨西哥国立自治大学、巴西圣保罗大学及数十家机构的研究人员认为:以英语为主体大规模训练的主流语言模型,复制了与伊比利亚美洲现实不符的文化与语言偏见。LatamGPT 1.0语料库包含2965亿个词元,以西班牙语和葡萄牙语为主,来源涵盖网络、机构和学术资料。据CENIA称,相关计算基础设施预计投入1000万美元,但已查阅的原始资料无法证实该资金已实际到位。相比之下,OpenAI和谷歌近期模型的精确训练成本,同样没有可供对比的公开数据。

技术成果是严肃的。目前未找到任何原始资料能证明,发布时公布的基准测试已确立与GPT-3相当的性能。但基准测试签不了合同。

截至2026年7月28日,距官方发布不足六个月。无法断言在所有相关行业和国家均未宣布任何实际采用。模型已存在、已运行,仍在等待。

企业忠于ChatGPT的原因

简单的答案是:ChatGPT好用。拉丁美洲部分企业技术团队使用ChatGPT,能够将其界面整合进工作流程,在OpenAI的API上培训开发者,并搭建原型。更换模型有实际成本:迁移集成、团队再培训、对性能持续性的不确定。

这种商业成熟度的不对称性会随时间自我强化。一种方案积累的用户越多,集成商就越倾向于投入精力掌握这一方案,新进入者转向替代品的成本也随之升高。在职业习惯已经形成之后才出现的主权模型,面对的不只是竞争对手的技术性能,还有数千个已将自身流程建立在另一种方案之上的团队的组织惯性。

还有一个更深层的原因。OpenAI及其美国竞争对手出售的,与其说是一个模型,不如说是一项服务。LATAM-GPT目前出售的是一种理念和一段代码。现有文档尚不完整,上述其他因素在企业决策中的相对权重,均尚未得到证实。

学术成果与商业成熟之间的落差,在其他情境中也有记录。非洲本地语言模型联盟Masakhane产出了具有影响力的研究成果,并开发了用于人道主义场景的工具,但未能构建可持续的商业产业链。由AI Singapore为东南亚语言开发的SEA-LION走了一条类似的路:被公共试点项目采用,在私营部门中却处于边缘地位。压制经济增长的地缘政治碎片化,以一种悖论式的方式,创造了数字主权诉求的土壤,却没有提供为之融资的机制。

语言代表性的结构性问题

构建区域性模型有充分的理由,且这一理由超越民族自尊。根据联合国教科文组织《数字语言多样性报告》,全球7000种语言中,仅有500种在网络上有所呈现。在互联网文本上大规模训练的模型机械地继承了这种集中性:英语出色,普通话、标准西班牙语和法语尚可,一旦超出主流变体,表现便急剧恶化。

对于一家服务巴西东北部客户的企业,或一个处理克丘亚语文件的玻利维亚政府机构而言,一个针对本地现实进行校准的模型具有实际的功能优势。LATAM-GPT正是为覆盖这些代表性不足的变体而设计,纳入了超越学术卡斯蒂利亚语和欧洲葡萄牙语的语料库。

但这种优势不会自动转化为采用。服务边缘方言人群的企业,往往也是技术预算最有限的企业。有能力投资复杂AI解决方案的大企业,服务的市场已足够标准化,ChatGPT便已够用。LATAM-GPT的自然目标受众与其潜在商业目标受众并不完全重叠。

缺乏外部支持的主权模型的局限

没有系统性的公共采购,该模型可能更难吸引私人集成商,进而触达企业客户。技术咨询公司倾向于投入精力掌握那些预期有稳定付费需求的工具。合作国政府缺乏明确信号,这些公司可能不愿在一个市场尚待建立的解决方案上培训自己的团队,进一步限制该模型进入企业端的渠道。

自2022年以来,训练大型语言模型的成本已大幅下降,但对于一个没有经常性收入的学术联盟而言,量级仍属高昂。据业内流传的非官方估算,GPT-4的训练成本超过1亿美元。与LATAM-GPT项目相关的超算基础设施预计投入1000万美元,没有任何原始资料能证明这笔投入产出了与GPT-3等效的模型。这一差距无法仅靠积累学术伙伴关系来弥补。

关键在于政治层面,而非技术层面。那些建立了具有竞争力数字替代方案的地区——中国的百度和阿里云、以色列在国防和网络安全领域的AI企业、韩国的三星和Kakao——都将大规模公共投资、固定公共采购与明确的产业政策结合在一起。国家创造初始需求,本地企业响应,生态系统形成自身动能。

多个国家已就LATAM-GPT开展了合作政策、机构支持或基础设施方面的工作,但尚不清楚这究竟指向具体的公共采购,还是笼统的国家优先政策。现有公开信息不足以确认:公共服务是否已采用该模型、是否存在优先考虑该模型的招标公告,以及合作国是否已出台针对AI解决方案的本地优先政策。监管云而不是建设云,恰好造成这类僵局:规则被施加在自己并不掌控的基础设施上,却没有创造出可行替代方案的条件。

伙伴关系仍可触及的成果

LATAM-GPT并非注定停留于研究项目,其多机构治理模式具备商业方案无法复制的优势。

第一是数据可信度。处理敏感数据的大型企业和公共行政机构——医疗、司法、税务数据——有充分理由偏好训练数据来源清晰、代码可审计的模型。LatamGPT 1.0在Llama 3.1许可证下公开可用,并附有初步文档;完整文档和详细语料库目录在发布时仍处于待发布状态。对于阿根廷的公立医院或秘鲁的司法机构而言,这种透明性具有实际价值。

第二是行业适配性。通用基础模型主导大众市场,但垂直行业——医疗、法律、教育、农业——仍大量开放。一个基于拉丁美洲法律语料库或热带地区农业数据训练的模型,相对于ChatGPT将具有真实的差异化优势。联盟中多个合作方已提及这些方向,但尚无结构性商业开发计划宣布。

网络内的大学正与多个成员国教育部合作,推进在公共教学平台上的集成工作。这些用途不能立即产生商业收入,但能建立参照案例、提升可见度,并形成用户反馈,推动模型改进。许多开源模型正是走过这条路,先找到用户,再找到市场。

Masakhane和SEA-LION尚未能传授的教训

拉丁美洲不是第一个面对这一问题的地区,也不会是最后一个。Masakhane证明了以有限资源为非洲语言构建高质量模型的可能性,通过动员分布式研究社区实现了这一目标。但该项目未能完成从研究到市场的跨越。由AI Singapore承担、政府支持力度更强的SEA-LION,获得了更多机构采用,但在区域私营部门中,面对美国和中国模型仍处于边缘位置。

技术性能可能是采用因素之一。根据官方文档,LatamGPT 1.0在某些基准测试上落后于其他模型。障碍尤其可能来自缺乏需求创造机制,而这种机制不能完全交由市场决定。市场在自行运作时,倾向于向已拥有最大用户基础、最佳开发工具和最完善支持团队的方案集中。即便在专业领域表现更优,主权模型在这种竞争中仍带着结构性劣势入场。

应对这种不对称性,是公共决策者的责任,而非研究者的责任。如果拉丁美洲各国政府决定将LATAM-GPT用于其数字服务,将部分技术类公共采购与使用主权模型相挂钩,或资助使该模型在特定垂直领域具备竞争力的行业专项计划,局面将会改变。此类决定目前尚无完整记录。商业生态系统围绕美国和中国解决方案固化之前,行动的窗口仍然开着,但很可能不会永远开着。

问题悬而未决:一种技术雄心在何时转化为产业政策,这个地区中谁有能力、有意愿完成这一跨越?


资料来源