La planète compte environ 7 000 langues vivantes. Les grands modèles de langue qui alimentent aujourd’hui les assistants vocaux, les outils de traduction, les plateformes éducatives et les moteurs de recherche n’en traitent correctement qu’une poignée. Ce n’est pas un accident technique. C’est le résultat d’un mécanisme précis, documenté, et pour l’instant peu contesté : les modèles apprennent à partir de ce qui existe déjà en ligne, et ce qui existe en ligne reflète les déséquilibres de pouvoir, d’infrastructure et d’investissement qui structurent le monde numérique depuis trente ans.
Le Pacifique en offre une illustration saisissante. Il abrite un nombre important de langues — la Papouasie-Nouvelle-Guinée seule en compte environ 840, soit plus de 10 % du total mondial. Mais les langues insulaires du Pacifique sont très peu représentées dans les données d’entraînement des grands modèles. Ce déséquilibre passe inaperçu dans les grandes capitales technologiques. Il produit pourtant un effet concret : là où le numérique prend le relais de la transmission orale, ces langues sont absentes des outils et services accessibles.
Ce cas n’est pas isolé. Il illustre un phénomène structurel qui touche les langues africaines, les langues autochtones des Amériques, les dialectes d’Asie du Sud-Est et bien d’autres encore. Partout où une langue manque de présence numérique, les modèles la gèrent mal. Et partout où les modèles la gèrent mal, sa présence numérique se réduit davantage.
L’essentiel
- Le Pacifique concentre à lui seul plus de 1 200 langues vivantes, mais très peu de grands modèles de langue généralistes les couvrent ; il existe au moins un modèle ouvert optimisé pour le samoan, mais l’absence totale de LLM pour toutes les langues citées n’est pas établie (UNESCO, 2025).
- Les grands modèles sont entraînés sur des données massivement anglophones : l’anglais représente entre 45 % et 65 % des tokens selon les estimations disponibles, selon des analyses de corpus comme Common Crawl, Wikipédia ou la littérature académique internationale.
- Les LLM sont moins factuels dans les langues moins représentées dans les données d’entraînement — un constat établi empiriquement par plusieurs études récentes sur la performance multilingue des modèles.
- Des trajectoires possibles d’ici 2035 incluent l’extinction numérique silencieuse, la préservation patrimoniale sans usage actif, ou la revitalisation par des corpus ouverts et des partenariats communautaires.
- Des initiatives existent — Common Voice de Mozilla, MzansiLM en Afrique du Sud, les projets d’Orange avec Meta et OpenAI pour le wolof et le pulaar — mais elles restent sous-financées et fragmentées face à l’échelle du défi.
Un déséquilibre mécanique, pas une fatalité
Comprendre pourquoi tant de langues sont absentes des corpus d’entraînement exige de regarder comment ces corpus sont construits. Les grands modèles apprennent à partir de textes disponibles sur le web, dans les bibliothèques numériques, dans les archives journalistiques. Une langue qui a peu de présence textuelle numérique — peu de sites web, peu de livres numérisés, peu de médias en ligne — est mécaniquement sous-représentée dans ces corpus.
Ce n’est pas simplement un biais de volume. C’est un biais structurel qui se renforce lui-même. Une langue sous-représentée dans les données d’entraînement produit des modèles qui la gèrent mal, ce qui peut décourager la production de textes dans cette langue, et aggraver la sous-représentation. Le cycle se referme.
Les chercheurs ont un nom pour ce phénomène : le biais par sur-représentation et sous-représentation. Certains groupes, certaines cultures, certaines langues sont surreprésentés dans les corpus ; d’autres en sont presque absents. Les modèles reproduisent et amplifient ces déséquilibres, parce qu’ils optimisent pour les patterns statistiques dominants. Ce que la recherche établit de façon croissante, c’est que les LLM sont moins factuels dans les langues qui ont moins de locuteurs et moins de présence dans les données d’entraînement. Ce n’est pas un défaut corrigeable à la marge : c’est une conséquence directe de l’architecture même de ces systèmes.
Il existe en outre une forme d’interférence croisée : même lorsqu’un modèle multilingue génère du contenu dans une langue minoritaire, les traces de l’anglais — dominant dans ses données d’entraînement — s’invitent dans la forme linguistique, la syntaxe, les associations culturelles. La langue produite est techniquement présente, mais culturellement déformée.
Les langues du Pacifique, cas d’école d’une mécanique universelle
Le Pacifique est l’une des régions les plus riches du monde en diversité linguistique. La Papouasie-Nouvelle-Guinée seule abrite environ 840 langues distinctes. Le Vanuatu, avec ses 300 000 habitants, en compte plus de 130. Ces langues portent des systèmes de navigation, de botanique, de droit coutumier et de cosmologie que ne contient aucun dictionnaire anglais.
Pendant des siècles, leur transmission a fonctionné : orale, incarnée, intergénérationnelle. Ce canal n’est pas mort. Mais un second canal s’y est ajouté, et celui-là, ces langues ne l’occupent pas.
Pour plusieurs langues insulaires du Pacifique, le cycle de sous-représentation numérique peut s’amorcer et s’avérer difficile à inverser sans intervention. Les contraintes sont multiples : connectivité limitée, compétences numériques restreintes, financement insuffisant pour les projets de capture de corpus — enregistrement, transcription, annotation, structuration — et nécessité d’adapter des standards interopérables entre initiatives souvent fragmentées.
D’autres obstacles que la complexité technique limitent le développement de modèles pour ces langues. Des modèles ont été construits pour des langues à faible ressource en Afrique, en Asie du Sud-Est, dans les Amériques. Dans le Pacifique, l’investissement dans les infrastructures linguistiques numériques a été limité.
L’Afrique et les Amériques : le même mécanisme, d’autres visages
Le Pacifique n’est qu’un cas parmi d’autres. En Afrique, où l’on estime qu’un tiers des langues du monde sont parlées, la situation est structurellement similaire. Les langues africaines restent largement sous-représentées dans l’univers numérique mondial, malgré des dizaines de millions de locuteurs pour certaines d’entre elles. Des facteurs comme la complexité multilingue, les politiques dominantes en faveur des langues coloniales, un appui institutionnel faible et le manque d’infrastructure numérique contribuent à maintenir ces langues dans une position de faiblesse dans les systèmes d’IA.
Les effets sont mesurables. Là où GPT-4o dépasse 90 % de précision en anglais, ses performances chutent en dessous de 40 % pour plusieurs langues africaines — un écart documenté par des benchmarks récents. Des langues comme le haoussa, le yoruba ou l’igbo, pourtant parlées par des dizaines de millions de personnes, ont historiquement manqué de jeux de données de haute qualité pour leur intégration dans les systèmes d’IA avancés.
Des initiatives émergent pour corriger le tir. En Afrique du Sud, des chercheurs de l’université du Cap ont développé MzansiLM, un modèle capable de traiter les onze langues officielles du pays, appuyé sur un corpus spécifique baptisé MzansiText. Orange collabore avec OpenAI et Meta pour affiner des modèles sur le wolof et le pulaar, deux langues d’Afrique de l’Ouest parlées par plusieurs dizaines de millions de personnes. Ces initiatives illustrent une dynamique naissante, mais elles restent des exceptions dans un paysage dominé par quelques dizaines de langues.
Le phénomène dépasse l’Afrique. Dans les Amériques, les langues autochtones — du quechua au nahuatl en passant par les langues des Premières Nations canadiennes — sont dans une situation comparable. En Asie du Sud-Est, des centaines de dialectes régionaux restent absents des modèles généralistes. Dans tous ces cas, la structure est la même : une faible présence numérique préexistante, un corpus d’entraînement qui l’ignore, un modèle qui la marginalise davantage.
La transmission face à la pression du numérique
La transmission orale a ses propres conditions de survie. Elle exige la coprésence, la continuité des communautés, des espaces où la langue est utile au quotidien. Ces conditions s’érodent dans de nombreuses régions du monde, sous l’effet de l’urbanisation, de l’émigration économique et de l’enseignement en langues coloniales ou dominantes.
Mais c’est la bascule numérique qui change le régime de la question. Lorsqu’un enfant tongien de douze ans cherche une information sur sa propre culture, il passe par un moteur de recherche qui répond en anglais. Lorsqu’un élève yoruba au Nigéria utilise un assistant vocal, celui-ci lui répond dans une langue qui n’est pas la sienne. Lorsqu’une communauté veut produire du contenu numérique dans sa langue, elle se heurte à des lacunes dans les outils disponibles : claviers adaptés, correcteurs orthographiques, synthèse vocale.
Le numérique crée une pression vers les langues dominantes dans des espaces que l’oral n’occupait pas. Les jeunes générations apprennent vite que leur langue maternelle fonctionne dans la sphère familiale et reste invisible dans la sphère numérique.
Selon certaines analyses, la bascule vers les grands modèles de langue comme infrastructure de transmission culturelle risque de créer un nouveau filtre de légitimité. La sous-représentation dans les modèles peut réduire la visibilité et l’accès numériques d’une culture. Sans soutien, des communautés risquent une représentation inadéquate, mais elles peuvent aussi participer à la gouvernance des données et créer ou adapter leurs propres outils.
Ce mécanisme rejoint ce que nous avons documenté sur l’impact de l’IA sur la diversité culturelle : les outils d’IA amplifient ce qui est déjà dominant et marginalisent ce qui est déjà fragile.
Trois chemins vers 2035
La feuille de route UNESCO de 2025 appelle à renforcer la présence numérique des langues sous-dotées dans les infrastructures numériques. La question est ce qu’elles seront dans l’espace numérique, et ce que cette présence ou cette absence fera à leur vitalité à long terme.
Trois trajectoires se distinguent selon l’ampleur et la nature des interventions engagées d’ici 2035.
La première trajectoire est celle de l’extinction numérique silencieuse. L’absence d’investissement ciblé limite la représentation des langues sous-dotées dans les corpus d’entraînement. Les outils numériques peuvent fonctionner dans les langues dominantes mais rester lacunaires, voire inexistants, pour les autres. Au fil du temps, les générations apprenant davantage sur écran pourraient développer l’idée que leur langue maternelle appartient à la sphère privée tandis que les langues dominantes régissent les usages numériques utiles. Dans ce scénario, la transmission orale pourrait être affectée par la contraction des contextes d’usage.
La deuxième trajectoire concerne la préservation patrimoniale. Des corpus sont capturés et des archives constituées, mais sans la structuration nécessaire à leur usage comme outils vivants. La langue survit comme objet de documentation, accessible aux chercheurs et présenté dans des archives numériques, mais demeure absente des usages quotidiens et de la pédagogie régulière. C’est le sort de nombreuses langues qui ont bénéficié d’efforts de documentation sans bénéficier d’efforts de revitalisation. L’archive remplace la pratique.
La troisième trajectoire suppose un changement de régime. Des investissements publics coordonnés, associant institutions internationales, États, universités régionales et communautés, pourraient faciliter la constitution de corpus linguistiques pour les modèles ouverts. Des standards de propriété communautaire sur les données linguistiques peuvent aider les communautés à contrôler les usages de leurs données. L’intégration de ces modèles dans les outils éducatifs, les plateformes numériques et les médias locaux pourrait renforcer la présence des langues. La langue pourrait avoir une présence dans l’espace numérique qui renforce, plutôt que de supplanter, sa transmission orale ou familiale.
C’est la trajectoire la plus exigeante en ressources et en coordination.
Ce qui existe déjà et ce qui manque encore
Plusieurs outils et projets existent déjà dans ce domaine. Mozilla Common Voice est l’une des principales plateformes ouvertes de collecte participative de données vocales multilingues. Elle fonctionne sur un modèle participatif : des locuteurs enregistrent des phrases, d’autres les valident. Des dizaines de langues y ont été ajoutées ces dernières années, dont plusieurs langues africaines et amérindiennes. Peu de langues insulaires du Pacifique y disposent d’un corpus significatif.
Des chercheurs travaillent sur des projets de capture de corpus pour les langues à risque d’extinction numérique. Mais ces projets restent, dans leur grande majorité, dans une phase de cadrage ou de financement insuffisant. Les protocoles de gouvernance communautaire des données ne sont pas encore arrêtés.
Des universités de la région Pacifique — l’Université du Pacifique Sud, l’Université nationale de Papouasie-Nouvelle-Guinée — ont des programmes de documentation linguistique. Leurs chercheurs produisent des grammaires, des lexiques, des archives audio. Mais la distance entre une archive linguistique académique et un corpus utilisable pour entraîner un modèle de langue est considérable. Ce travail de conversion exige des compétences spécialisées dont la disponibilité dans la région est limitée.
La question des droits sur les données est tout aussi sensible — et elle se pose avec la même acuité en Afrique, dans les Amériques, dans toutes les régions où des données communautaires ont été captées et exploitées sans bénéfice pour les communautés concernées. L’expérience de la recherche ethnographique et génétique a créé une défiance durable. Tout projet crédible devra proposer des cadres de propriété intellectuelle communautaire garantissant que les données linguistiques appartiennent aux locuteurs, pas aux plateformes qui les exploitent.
Ce défi rejoint une tension plus large que nous avons documentée ailleurs : adopter les outils numériques sans former les locaux revient à externaliser sa propre trajectoire. L’enjeu est symétrique : sans données et participation communautaires, les outils risquent de mal représenter les langues et besoins locaux.
Les signaux qui permettront de savoir
Trois indicateurs permettront, dans les prochaines années, de situer les langues sous-dotées entre ces trajectoires.
Le premier est la progression du nombre de langues disposant d’un corpus ouvert sur des plateformes comme Hugging Face ou Common Voice. Certaines ressources existent pour le samoan, le fidjien, le wolof ou le swahili, mais demeurent limitées pour la grande majorité des langues concernées. Une progression significative d’ici 2028 indiquerait que la dynamique a changé.
Le deuxième est l’avancement des discussions engagées par l’UNESCO sur les standards de préservation numérique des langues en danger. Cette consultation porte sur le suivi de la Recommandation UNESCO de 2015 relative au patrimoine documentaire, y compris numérique. Sans cadre coordonné, les initiatives restent fragmentées.
Le troisième est la décision d’investissement des États eux-mêmes — qu’il s’agisse des gouvernements des îles du Pacifique, des États africains, ou des pays abritant des communautés autochtones. Certains d’entre eux ont engagé des politiques de promotion de leurs langues nationales dans les systèmes éducatifs. L’extension de ces politiques au numérique, par l’intégration de corpus linguistiques dans les programmes scolaires, le financement de linguistes-ingénieurs et les partenariats avec les universités régionales, constituerait un indicateur solide d’engagement vers la troisième trajectoire.
L’IA n’est pas condamnée à être un rouleau compresseur linguistique. Elle peut aussi être un outil de revitalisation, si les données existent et si les droits des communautés sont respectés. Des expériences en ce sens ont été menées pour le maori en Nouvelle-Zélande, avec des résultats encourageants : des corpus constitués avec des locuteurs, des modèles entraînés, une intégration progressive dans les outils éducatifs. Le chemin est connu. Ce qui manque, dans la plupart des cas, ce n’est pas la méthode. C’est la volonté politique et le financement.
Sources
- Artsjournal – The Great Renegotiation: Five Ideas About Where Culture Is Going in 2026
- UNESCO Endangered Languages Project 2025, Rapport sur les langues en danger d’extinction numérique (unesco.org/endangered-languages)
- Georgetown Institute Asia-Oceania, Pacific Digital Divide: Brief on Digital Colonialism and Linguistic Representation, 2026
- Mozilla Common Voice, Inventaire des langues disponibles (commonvoice.mozilla.org)
- Hugging Face Datasets, Inventaire des corpus de langues à faible ressource (huggingface.co/datasets)
- Alain Grandjean, Grands modèles de langage et biais paradigmatiques : une grille d’analyse par discipline, 2026 (alaingrandjean.fr)
- Centre for International Governance Innovation, Points principaux sur les langues africaines et l’IA, Ife Adebara, Mémoire n° 216, novembre 2025 (cigionline.org)
- AfricaNLP Workshop 2025, Multilingual and Multicultural-aware LLMs (sites.google.com/view/africanlp2025)
- Newsroom Orange, Orange intègre les langues régionales africaines dans les modèles d’IA open-source, 2025 (newsroom.orange.com)
- Osiris.sn, IA : un modèle adapté à 11 langues officielles voit le jour en Afrique du Sud, 2025 (osiris.sn)



