Chaque fois qu’un grand modèle d’IA s’entraîne sur les sorties de son prédécesseur, il efface un peu plus ce qui était déjà minoritaire dans les données d’origine. Ce n’est pas un bug corrigeable : c’est une propriété statistique de l’entraînement itératif. Et ce que la machine oublie en premier, ce sont les langues rares, les traditions narratives non numériques, les canons littéraires qui n’ont jamais pesé lourd dans les corpus anglophones. La culture mondiale se resserre. Le phénomène est discret, progressif, et les choix de corpus faits aujourd’hui l’inscriront dans l’infrastructure pour une génération.

L’essentiel

  • L’entraînement récursif indiscriminé sur des sorties synthétiques peut introduire des défauts irréversibles dans certaines conditions.
  • Une part significative du temps de visionnage européen est consacré à du contenu américain ; les créateurs non occidentaux sont sous-représentés dans les données d’entraînement.
  • Les plateformes et leurs systèmes de recommandation influencent la visibilité et les revenus dans un marché marqué par une concentration des recettes chez les grands labels et artistes populaires.
  • Le mécanisme est auto-renforçant : l’exclusion des créateurs périphériques appauvrit les données futures, qui produisent des modèles encore plus étroits.
  • Plusieurs pistes existent : quotas de diversité dans les corpus, régulation des algorithmes de recommandation, droits collectifs pour les créateurs. Leur déploiement reste limité.

Le model collapse, ou comment une boucle mange la diversité

Les modèles de langage apprennent à partir de grandes collections de données textuelles, historiquement surtout humaines mais pouvant inclure des contenus synthétiques; les images et sons relèvent des modèles multimodaux. Lorsque les données réelles sont remplacées à chaque génération par des données synthétiques, des informations de la distribution initiale peuvent se perdre à chaque itération; ce résultat n’est pas universel. Pas au hasard : ce qui se perd en premier, c’est ce qui était déjà minoritaire dans les données d’origine.

Shumailov et al. (2024) ont étudié plusieurs générations de modèles entraînés récursivement sur des données générées. L’étude montre une dégradation de modèles génératifs dans des scénarios d’entraînement récursif sur données synthétiques, sans évaluer de seuil culturel universel. Les langues à faible représentation numérique tendent à être encore moins représentées dans les générations suivantes. Les références littéraires non anglophones s’effacent.

Les structures narratives propres aux cultures orales ou aux traditions épiques non numériques risquent de ne pas être reproduites fidèlement par les modèles successifs.

Le terme technique est “model collapse”, l’effondrement du modèle vers un ensemble réduit de réponses probables. Mais derrière la formule se cache quelque chose de très concret : un modèle qui ne sait plus écrire de conte peul, qui ne reconnaît plus les structures du roman japonais contemporain, qui associe systématiquement “littérature” à une poignée de canons occidentaux.

Ce mécanisme résulte des propriétés statistiques de l’entraînement itératif sur données synthétiques et ne peut pas être corrigé par débogage seul. La distribution des sorties converge vers son mode dominant, et le mode dominant des corpus numériques actuels est, massivement, américain et anglophone.

61 % du temps européen sur des écrans américains

La domination du contenu américain sur les plateformes mondiales précède l’IA générative. Les grands modèles génératifs risquent de renforcer ce déséquilibre aux niveaux où ils influencent la production de contenu.

Selon l’Observatoire européen de l’audiovisuel, les œuvres américaines représentaient 61,2 % du temps SVOD dans neuf pays de l’UE étudiés entre septembre 2022 et septembre 2023. Les algorithmes de Netflix, YouTube ou Spotify optimisent l’engagement, et l’engagement moyen récompense le familier, le lisse, le déjà-vu, ce que les chercheurs en sciences cognitives appellent la « fluence de traitement », soit la facilité avec laquelle le cerveau assimile un contenu qu’il reconnaît.

Les traditions non occidentales sont sous-représentées ou mal représentées dans les données d’entraînement, tandis que la curation algorithmique peut défavoriser les créateurs moins connus. Daryani et al. examinent les risques d’homogénéisation culturelle et de convergence des structures narratives par les LLM.

Les corpus utilisés pour entraîner les grands modèles incluent une représentation limitée de contenus issus des traditions orales, des archives non numérisées ou des langues minoritaires. Les 7 000 langues recensées par l’UNESCO sont représentées de façon asymétrique : une centaine de langues concentrent l’essentiel des données disponibles, les autres sont très faiblement représentées. Ce déséquilibre risque de se refléter dans les modèles, sauf mesures explicites de rééquilibrage et d’évaluation.

La rémunération des créateurs s’est effondrée en dix ans

L’économie de l’attention a toujours été inégalitaire. Mais la transition vers l’IA générative a provoqué une rupture de degré qui ressemble à un changement de nature.

Les créateurs peuvent être rémunérés par des redevances et licences. Les revenus numériques prennent une place croissante dans les revenus des créateurs, mais la précarité, l’instabilité des revenus et les risques liés à la propriété intellectuelle se renforcent. L’écart est considérable. Certains musiciens dont les œuvres servent à entraîner des modèles génératifs ne reçoivent pas d’accord explicite ni de compensation identifiée, avec une transparence souvent insuffisante sur l’utilisation de leurs données.

La question touche à la viabilité du système autant qu’à la justice distributive. La relation entre valeur culturelle et rémunération des créateurs s’était déjà fragilisée bien avant l’IA. L’IA générative amplifie ce mouvement en ajoutant un troisième larron : le modèle qui produit du contenu « inspiré » de l’ensemble du corpus, sans que personne ne puisse identifier clairement quelle contribution a pesé combien dans le résultat.

Certains créateurs réduisent leur activité ou adaptent leur production pour mieux correspondre aux attentes des algorithmes de recommandation. La diversité culturelle risque de s’en trouver appauvrie, affectant les données d’entraînement futures. La boucle se referme.

Les tentatives de l’UNESCO et leurs limites

Le cadre institutionnel n’est pas muet. Des instruments UNESCO ultérieurs, notamment les orientations numériques et la Recommandation de 2021 sur l’éthique de l’IA, abordent les enjeux algorithmiques pour la diversité culturelle. C’est un pas. Mais la convention est un instrument de droit souple, elle fixe des orientations, pas des obligations contraignantes.

L’Union européenne a été plus loin. La directive sur les services de médias audiovisuels impose aux grandes plateformes un quota minimum de 30 % de contenu européen dans leurs catalogues. Mais un quota de catalogue n’est pas un quota de recommandation : un film européen présent dans la bibliothèque de Netflix mais jamais mis en avant par l’algorithme de recommandation ne change rien au ratio de 61 % de temps de visionnage américain.

La régulation des plateformes a généralement porté sur l’offre de contenu, alors que l’influence véritable s’exerce par la recommandation. Imposer une diversité du catalogue ne suffit pas si les algorithmes de recommandation continuent à orienter les utilisateurs vers les contenus dominant l’engagement moyen. La question de la transparence algorithmique, obligation de publier les critères de recommandation, audit indépendant des biais culturels, reste largement ouverte dans la plupart des juridictions.

Ce problème de légitimité des algorithmes dépasse le domaine culturel : quand un système automatisé décide de ce qui est visible, la question de ses critères de décision devient une question politique de premier ordre.

La fenêtre 2026-2030, avant que la dégradation ne soit inscrite dans l’infrastructure

Les prochaines années sont déterminantes : les choix de corpus et de pondération pour les grands modèles actuellement en conception influenceront la production culturelle numérique du cycle suivant.

Plusieurs pistes techniques ont fait l’objet de publications sérieuses. La constitution raisonnée de corpus, par sélection active et pondération pour représenter les langues et traditions sous-représentées, est la plus prometteuse à court terme. Elle exige que les équipes d’entraînement des grands modèles considèrent la diversité culturelle comme un objectif de qualité, au même titre que la précision factuelle ou la cohérence logique. Numériser des archives orales, traduire des textes mineurs et rémunérer des annotateurs multilingues représente un coût que les laboratoires privés n’ont aucune raison d’assumer seuls : l’enjeu est organisationnel et économique autant que technique.

Un deuxième levier passe par la régulation des données d’entraînement. Obliger les développeurs de modèles à publier la composition de leurs corpus et à respecter des seuils minimaux de diversité linguistique et culturelle est techniquement faisable, l’Union européenne a déjà inscrit des exigences de transparence dans l’AI Act, mais sans spécifications quantitatives sur la diversité culturelle. Compléter ce cadre avec des métriques précises et auditables est une décision politique qui peut être prise dans la fenêtre 2026-2028.

Un troisième levier est économique : créer un mécanisme de rémunération collective pour les créateurs dont les œuvres alimentent les corpus d’entraînement. Plusieurs modèles existent, la gestion collective en musique, les droits voisins pour la presse, mais aucun n’a encore été adapté à la complexité des grands modèles de langage. L’UNESCO 2025 recommande d’explorer cette voie ; les États membres n’ont pas encore traduit cette recommandation en législation.

Ces trois leviers supposent qu’il faut décider collectivement que la diversité culturelle est un bien commun qui mérite un investissement public et une contrainte réglementaire. Ce présupposé fait débat. Certains acteurs soutiennent qu’une intervention trop lourde risque de fragmenter internet en zones fermées, chaque région imposant ses propres quotas culturels, un scénario où la diversité de surface masque la balkanisation des échanges. L’argument mérite d’être pris au sérieux. Mais cet argument repose sur l’hypothèse que le marché, laissé libre, produirait davantage de diversité.

Sans intervention, existe un risque de concentration du contenu généré par un nombre limité de laboratoires vers des registres culturels dominants. Shumailov et al. (2024) montrent une dégradation de modèles génératifs dans des scénarios d’entraînement récursif sur données synthétiques, sans évaluer de seuil culturel universel.

Plusieurs générations de grands modèles ont déjà intégré des données synthétiques dans leur entraînement.

Les initiatives déjà engagées sur le terrain

Plusieurs initiatives montrent que la pression n’est pas absente du terrain.

Common Voice, le projet de Mozilla pour collecter des données vocales dans des langues sous-représentées, a atteint plus de 30 000 heures d’enregistrements dans une centaine de langues, une fraction des besoins, mais une preuve que la collecte communautaire est possible. Masakhane, un collectif de chercheurs africains spécialisés en traitement automatique des langues, produit des ressources linguistiques pour les langues d’Afrique subsaharienne et publie ses travaux en accès libre. L’initiative AI4Bharat fait de même pour les langues indiennes.

Ces projets opèrent en dehors des grandes plateformes commerciales et disposent de ressources limitées. Leur impact demeure limité faute d’obligation pour les développeurs de les intégrer. La régulation pourrait intervenir en finançant la production de données manquantes et en établissant des critères de représentation, sans dicter les choix esthétiques des modèles.

La Corée du Sud, qui finance depuis 2021 un programme national de numérisation de son patrimoine culturel immatériel en formats utilisables par les modèles d’IA, offre un exemple de ce que peut faire une politique publique ciblée. La France a engagé une réflexion similaire via le plan pour la langue française et le multilinguisme annoncé en 2024. Ces initiatives restent isolées ; leur mise en cohérence à l’échelle européenne ou internationale n’a pas encore eu lieu.

La gouvernance des corpus qui formeront la mémoire culturelle des modèles reste indéterminée. Les laboratoires industriels jouent un rôle dominant dans le développement des modèles de pointe, mais les choix de corpus ne sont pas exclusivement privés ; des régulateurs nationaux pourraient le revendiquer, avec le risque de fragmentation que cela implique ; il n’existe pas d’organe multilatéral spécialisé exclusivement dans la gouvernance des corpus d’IA, tandis que l’UNESCO possède déjà des organes compétents sur la diversité culturelle numérique. Les décisions prises au cours des prochaines années détermineront si la diversité culturelle est prise en compte dans la conception des prochaines générations de modèles.


Sources

  1. Frontiers Communication (2026), Dégradation de la diversité culturelle par les modèles génératifs : https://www.frontiersin.org/journals/communication/articles/10.3389/fcomm.2026.1828344/full
  2. Zolynski et al. (2026), Model collapse et granularité culturelle (cité dans Frontiers Communication 2026)
  3. Daryani et al. (2026), Algorithmes de recommandation et pseudo-diversité culturelle, SAGE Publications
  4. ACM CHI (2026), Cultural Heritage et représentation dans les corpus d’entraînement
  5. UNESCO (2025), Groupe de travail sur la Convention pour la diversité des expressions culturelles