关于本中文版的说明  /  Note sur cette version chinoise

本日报作者不通中文。这些译文由人工智能自动生成,作者本人无法亲自核对其语言准确性和文化适切性。我们以谦逊和真诚的态度发布此版本,希望与中文读者建立连接。若发现翻译错误、表达不当或文化误读之处,恳请告知 — 我们将虚心接受并改进。

L'auteur du Journal d'un Progressiste ne parle pas chinois ; ces traductions sont produites par intelligence artificielle et n'ont pas été vérifiées par lui. Cette version est publiée dans un esprit d'échange et d'humilité — vos retours sur les erreurs éventuelles ou les contresens culturels sont les bienvenus.

— 《进步者日报》编辑部  /  La rédaction

核心要点

2026年4月,泰国推出ThaiLLM,当局将其定位为国家AI基础设施。东南亚各国正以不同方式组合本国、区域及全球供应商服务。对于一个7000万人口的国家,这一押注值得认真审视。

  • 泰国通过NSTDA于2026年4月在国家超算ThaiSC上启动ThaiLLM,为部分敏感用途提供本地处理选项。
  • 这一主权模型与新加坡战略形成直接对比——新加坡将引入外国超大规模云服务商与主权云机制及本国算力相结合。
  • 核心矛盾:自建成本高昂,需要稀缺的技术人才;云服务可能造成对供应商的依赖,并涉及数据由第三方处理,但数据本地化程度和传输方式取决于所选架构和服务。
  • 印度尼西亚、印度和巴西正在观望:若ThaiLLM证明有效,2028年前其他国家可能走同一条路。

NSTDA以本国实力对抗加州引力

ThaiLLM由包括NSTDA在内的联合体开发,借助ThaiSC运营的LANTA超算训练,使用来自政府和学术来源的泰语数据。官方目标:通过在本地超算上处理数据,将敏感数据保留在国家管控之下。

存储于境外云端的政府数据存在真实的法律和战略问题:谁可以访问、在什么条件下、受哪个司法管辖区约束。泰国不是第一个对此感到忧虑的国家,但它是东南亚最早以自建基础设施而非保密合同来回应这一问题的国家之一。

该模型原生支持泰语,这一点举足轻重。美国或中国的大型模型也能处理泰语,但性能参差不齐,文化理解的缺口也显而易见。基于本地语料训练的模型能够理解语言使用场合、行政参考体系和国内特有的法律细节。对政府用途而言,这种精确性价值极大。

新加坡与泰国:两种截然不同的AI路径

新加坡在部分地区AI准备度排名中位居前列,其战略在一定程度上解释了这一结果。这座城市国家吸引了超大规模云服务商:谷歌、微软、AWS均在其领土上建设了大型数据中心。新加坡以地理位置、监管稳定性和电力基础设施,将自己打造为区域算力枢纽,并从中获取高技能就业岗位、投资和国际技术曝光度。

泰国走的是另一条路。它在继续引进和使用全球供应商基础设施的同时,发展本国算力。两种模式并非纯粹对称:新加坡是600万人口的城市国家,比较优势在于连接性;泰国是拥有工业、农业和旅游经济的大陆国家,7000万人口产生大量需要主权管理的数据。

这种比较揭示了两种不同的技术进步理念。枢纽战略认为,进步来自融入全球算力网络;主权战略认为,进步来自对本地数据和模型的掌控。这两种逻辑此前停留在理论层面,2026年,它们在相距数百公里的地方同时付诸实践。

这种分歧让人想起工业界一场类似的争论:亚洲工业界也正在构建两种截然不同的自动化模式,分别押注于全面机器人化或人机协作。两种情况下,核心问题都是:谁拥有构建生产体系的技术?

数字主权的真实代价

对实体部件的依赖揭示了一种结构性矛盾,主权论述往往低估这一点:应用层面的独立与硬件层面的独立并不以同样的速度推进。一个国家可以通过将数据托管在本国领土上重获数据控制权,同时在驱动这套基础设施运转的部件上仍完全依赖境外决策。这种不对称性并不否定主权项目本身,但它要求将主权定义为层层递进的过程,而非非此即彼的状态。每减少一层依赖都是真实的收益,即便其他层面的依赖仍然存在。

建设国家AI基础设施代价高昂。一台能够训练大型语言模型的超算需要数亿美元投资、能够操作它的工程师,以及一条本身就依赖美国和台积电的图形芯片供应链。数字主权有其自身的依赖。

这是将主权思路套用于AI时的第一个陷阱:实体基础设施仍集中在少数人手中。英伟达GPU被广泛用于现代模型训练,谷歌TPU等替代加速器同样用于训练现代模型,而华盛顿自2022至2023年出台限制措施以来一直管控其出口。一台超算可能在某些部件上依赖境外供应商,但对美国出口管制的暴露程度取决于具体的芯片、供应商、目的地和适用规则。欧洲在自己的半导体计划上付出了代价:投入《芯片法案》的数十亿欧元,未能建立完整的独立供应链。

尽管如此,对实体部件的依赖比对应用云的依赖更不直接。一台购买并安装完毕的超算可以运行多年。敏感用途可以在本地基础设施上处理,将敏感数据保持在国家管控之下。建设国家基础设施被认为是减少外部依赖、降低安全和连续性风险的手段。这是一个理性的押注,尽管收益需要时间来衡量。

资金问题是实实在在的。NSTDA是公共机构,ThaiSC是国家投资。泰国AI的治理模式因此不同于新加坡——后者吸引的是境外私人资本。泰国动用公共资金购买一种市场不会自发提供的独立性。

语言作为战略资产

一种语言的战略价值不仅在于语言特性本身,更在于伴随它积累的庞大制度语料。一种行政语言积累了数十年的法律文件、监管程序和官僚往来,这些文本编码了一个国家思考和行动的方式。它们构成一张隐性地图,描绘行政体系对世界分类和决策的认知框架。在这类语料上训练的模型内化了一种制度逻辑,通用模型无法通过简单翻译重建这种逻辑。标准基准测试很难衡量这个维度,因为它们评估的是通用任务的能力,而非与特定行政体系的契合度。

对于希望实现内部流程自动化或辅助公务员工作的政府而言,制度相关性的差距比通用任务性能的差距更重要。语言因此成为将模型嵌入特定行政文化的锚点,而不仅仅是众多技术参数之一。主权模型的价值随着所调用的制度语料的规模和质量而增长,这为系统性汇聚和整理公共数据创造了持久动力。

泰语有约7000万使用者,主要分布在泰国。这是一种有独立书写系统的声调语言,其语法和行政词汇与大型全球模型大量训练所依赖的英语语料并不对应。GPT-4或Gemini能够理解泰语,但对本地官僚、医疗或法律语境的深度理解仍然有限。

泰国的数据——包括公共文件和文化材料——旨在改善语言和文化覆盖,该项目还单独规划了专门的医疗模型。据财政总局简报,泰国政府机构已参与该项目。这正是ThaiLLM的目标所在。

这里有一个超越泰国的启示。缺乏共享数据基础设施会动摇整个项目:这正是非洲科学面对西方机构主导的数据库时所遭遇困境的写照。整合良好的本地数据是战略资产。泰国认识到,其政府数据有价值,内部利用比向外输送更合算。

这一逻辑同样吸引企业关注。一家在本国模型上处理客户数据的泰国银行或保险公司,面临的跨境数据传输合规风险更低——东南亚自2024年以来对此的监管日趋严格。

东南亚乃至全球的试验场

泰国的这场实验正被该地区密切观察。印度尼西亚、越南和菲律宾分别拥有5000万至2.7亿人口,各自的语言在全球语料库中代表性不足,各国领导人也不愿将政府数据托管在圣何塞。ThaiLLM因此提出了一个具体问题:一个中等规模国家能否在没有中美两国资源的情况下,训练出一个在本国需求尺度上具有竞争力的模型?

答案取决于”有竞争力”的含义。ThaiLLM的目标是更好地覆盖泰国的语言和文化语境,并为各机构的本地化应用提供基础。这是一个定位狭窄但逻辑自洽的选择。

印度和巴西也在酝酿类似的决定。这两个国家具备足够的体量,可以考虑在全球范围内真正有竞争力的模型。若ThaiLLM在2027至2028年前证明其运营效果,这些国家将获得一个有用的先例。选择窗口是开放的:模型训练成本每年都在下降,开源工具日趋成熟,对商业API的依赖也越来越容易降低。

AI地缘政治的博弈部分就在于此——在这些围绕基础设施和数据反复出现的国家抉择中。当足够多的中等规模经济体做出主权选择后,大型模型的全球市场将与今天大不相同。技术标准、安全规范、互操作性规则将在新的论坛、以新的力量格局加以讨论。曼谷在2026年还没有坐上这张桌子,但它刚刚预订了自己的位置。

未来数月,泰国各政府机构将面临选择:在最敏感的用途上使用这一国家模型,还是继续依赖更为成熟的境外解决方案。真正检验这场押注成效的,是这些日常抉择,而非2026年4月的发布仪式。


来源