IA MULTILINGUE · DONNÉES POUR L'IA
Pangeanic

IA multilingue · Données pour l'IA

Qu'est-ce qu'une langue peu dotée ?

Une langue n'est pas pauvre parce qu'elle manque de mots. Elle est « peu dotée » parce qu'elle manque de données lisibles par une machine, d'outils et de jeux d'évaluation. Ce guide explique la définition, la manière dont on mesure cette situation, les endroits où elle pèse le plus (du breton au wolof, du créole haïtien à l'inuktitut, du valencien au quechua) et les questions à poser avant de faire confiance à un modèle qui affirme « prendre en charge » ces langues.

Par Manuel Herranz, fondateur et PDG de Pangeanic · Publié le 30 septembre 2026 · 20 min de lecture

7 000+
langues parlées dans le monde aujourd'hui
2 191
langues dans la classe la moins dotée (« The Left-Behinds »), Joshi et al., ACL 2020
7
langues dans la classe la mieux dotée, dont le français, même étude
75
« langues de France » recensées par le rapport Cerquiglini (1999)

Définition

Langue peu dotée

Une langue peu dotée (on parle aussi de langue sous-dotée, à faibles ressources ou, en anglais, de low-resource language) est une langue pour laquelle il n'existe pas assez de textes numériques, d'enregistrements vocaux, de corpus parallèles, de données annotées, d'outils logiciels ou de jeux d'évaluation pour construire et mesurer des technologies de la langue (traduction automatique, reconnaissance vocale, grands modèles de langage) aussi performantes que pour l'anglais. Le terme décrit une situation des données, et non la langue elle-même, et cette situation varie selon la tâche, le domaine, la modalité et le moment de l'évaluation.

Terme opposé : langue bien dotée (l'anglais, l'espagnol, l'allemand, le japonais et le français occupent le sommet de la taxonomie la plus citée). Notions voisines mais distinctes : langue régionale, langue minoritaire, langue minorisée et langue en danger.

01 · La notion

Une situation des données, pas un verdict linguistique

Le terme est né du traitement automatique des langues (TAL) et de la linguistique computationnelle, et il porte la marque de son origine : il mesure une langue à ce qu'une machine peut en apprendre. Une langue dotée d'une tradition littéraire millénaire, d'une morphologie riche et de millions de locuteurs peut rester « peu dotée » si très peu de textes propres, sous licence et lisibles par une machine, ou de paroles transcrites, sont disponibles. À l'inverse, une langue moins parlée mais qui a bénéficié de décennies d'investissement public dans les corpus, les correcteurs orthographiques, les treebanks et les mémoires de traduction peut ne pas l'être du tout. Le nombre de locuteurs et les ressources numériques sont deux axes différents, et l'IA ne voit que le second.

Le cadre académique le plus utile vient de Hedderich et ses collègues (NAACL 2021), qui décrivent un scénario peu doté plutôt qu'une langue peu dotée. Ce scénario se définit selon 3 dimensions : la disponibilité de données étiquetées pour la tâche visée, celle de textes non étiquetés dans la langue ou le domaine, et celle de données auxiliaires (dictionnaires, langues apparentées, bases de connaissances). C'est pourquoi une même langue peut être bien servie pour la correction orthographique et mal servie pour la reconnaissance vocale, ou solide sur les textes de presse et faible sur les comptes rendus cliniques. Même l'anglais, ou le français, devient un scénario peu doté dans un domaine technique étroit sans données annotées. Haddow et ses collègues (Computational Linguistics, 2022) ajoutent une dimension temporelle pour la traduction automatique : certaines paires de langues jugées rares il y a dix ans disposent aujourd'hui de bien plus de données grâce à l'exploration du web et à l'exploitation de textes monolingues.

L'étiquette a toutefois un coût. Certains chercheurs soulignent que « peu dotée » définit une langue par ce qui lui manque et peut masquer les savoirs, les pratiques et les priorités de ses locuteurs. J'y reviens plus loin, car cette critique a des conséquences concrètes sur la manière de collecter les données. Pour l'instant, la définition opérationnelle compte, parce que les appels d'offres, le financement de la recherche et les notes de version des modèles l'utilisent, souvent sans préciser à laquelle des 3 dimensions ils font référence.

Terminologie

Une langue peu dotée est-elle une langue régionale, minoritaire ou en danger ?

Non. Ces catégories se recoupent souvent, mais chacune repose sur un critère différent. Les confondre produit de mauvaises politiques publiques et de pires jeux de données.

Terme Défini par Lien avec les ressources pour l'IA
Langue peu dotée La rareté des données lisibles par une machine, des outils et des jeux d'évaluation pour une tâche donnée C'est le critère computationnel lui-même ; il varie selon la tâche, le domaine, la modalité et l'année
Langue bien dotée Des données étiquetées et non étiquetées abondantes, des outils et une évaluation matures L'anglais, l'espagnol, l'allemand, le japonais et le français forment la classe supérieure chez Joshi et al. (2020)
Langue régionale Un statut juridique et patrimonial ; en France, l'article 75-1 de la Constitution (2008) dispose que « les langues régionales appartiennent au patrimoine de la France » La reconnaissance patrimoniale ne crée pas à elle seule de corpus : sans production de textes dans la sphère publique, les données restent rares
Langue minoritaire Une position sociopolitique au sein d'un territoire ou d'un État Coïncide souvent avec la rareté des données, mais une langue minoritaire peut être bien dotée
Langue minorisée Un processus historique de déplacement social par une langue dominante Ce déplacement réduit généralement les textes produits dans l'espace public, ceux-là mêmes qui deviennent ensuite des données d'entraînement
Langue en danger Une transmission intergénérationnelle interrompue ou affaiblie La plupart des langues en danger sont peu dotées ; la plupart des langues peu dotées ne sont pas en danger

02 · Inventaire

Qu'est-ce qu'une « ressource » ?

Il n'existe pas de seuil universel de tokens ou d'heures au-delà duquel une langue cesse d'être peu dotée. Les ressources nécessaires dépendent de l'application, tout comme les lacunes. Voici l'inventaire que nous utilisons pour cadrer un projet de données.

Couche de ressources Ressources typiques Lacunes fréquentes dans les langues peu dotées Ce qui se casse dans l'IA
Texte Corpus monolingues, livres et archives numérisés, presse, encyclopédies, textes administratifs Faible volume, domaines étroits, doublons, encodage défectueux, textes étiquetés dans la mauvaise langue Préentraînement des LLM, fluidité, connaissance du contexte local
Traduction Corpus parallèles, mémoires de traduction, glossaires bilingues et terminologie Peu de paires de phrases, concentration sur des textes religieux ou administratifs, traductions de mauvaise qualité Qualité de la traduction automatique, transfert interlinguistique, cohérence terminologique
Parole Enregistrements, transcriptions, lexiques de prononciation, métadonnées sur les locuteurs Peu d'heures transcrites, variétés et accents sous-représentés, métadonnées manquantes Reconnaissance vocale, synthèse vocale, assistants vocaux, transcription des débats publics
Annotation Parties du discours, entités nommées, dépendances, sentiment, intentions, données de préférence Échantillons minuscules, consignes incompatibles, trop peu d'annotateurs qualifiés Fine-tuning, alignement RLHF et DPO, détection des contenus haineux et sécurité
Infrastructure et évaluation Claviers, polices, tokeniseurs, analyseurs morphologiques, correcteurs, benchmarks, métriques Orthographes instables, couverture incomplète des écritures, licences restrictives, absence de jeux de test Impossible de savoir si un système fonctionne, ni pour quelle variété

L'existence d'un fichier n'en fait pas une ressource. La qualité, la représentativité, la documentation, le format et la licence déterminent si des données sont réutilisables. L'avertissement le plus clair vient de Kreutzer et ses collègues (TACL, 2022), qui ont audité manuellement 205 corpus spécifiques à une langue, issus de 5 grands jeux de données collectés sur le web (CCAligned, ParaCrawl, WikiMatrix, OSCAR et mC4). Les corpus des langues les moins dotées présentaient des problèmes systématiques : au moins 15 corpus ne contenaient aucun texte utilisable, et une part importante ne comptait que moins de 50 % de phrases de qualité acceptable, beaucoup étant mal étiquetés ou associées à des codes de langue ambigus. Un simple décompte de tokens peut donc donner une image erronée de la couverture.

Wikipédia, l'indicateur par défaut du « texte non étiqueté », a ses propres pathologies. Tatariya et ses collègues (2024) ont relevé, dans les éditions des langues peu dotées, des mélanges d'écritures et de langues, des articles vides et une forte proportion de contenus générés par des robots, et ont montré que des modèles entraînés sur des données filtrées égalent ou dépassent ceux entraînés sur le dump brut. Le cebuano en est le cas d'école : l'une des plus grandes Wikipédia en nombre d'articles, en grande partie générée automatiquement. Il faut aussi nommer une boucle de rétroaction. La traduction automatique de mauvaise qualité publiée sur le web est à nouveau collectée dans les corpus d'entraînement, si bien que la langue qui a le plus besoin de bonnes données est aussi la plus exposée aux erreurs recyclées. Pour nous, chez Pangeanic, c'est l'argument en faveur d'une validation humaine par des locuteurs natifs dès l'entrée des données dans la chaîne de traitement (un sujet que j'ai développé dans pourquoi la qualité des données d'IA multilingues est si difficile à garantir, en anglais).

03 · Mesure

Comment mesure-t-on le niveau de ressources d'une langue ?

La tentative la plus citée de classer les langues du monde selon leurs ressources est « The State and Fate of Linguistic Diversity and Inclusion in the NLP World » de Joshi, Santy, Budhiraja, Bali et Choudhury (ACL 2020). Les auteurs ont construit une taxonomie en 6 classes selon 2 axes : le nombre de ressources étiquetées (d'après le catalogue du LDC et la carte de l'ELRA) et le volume de texte non étiqueté (approché par Wikipédia). Le résultat est une pyramide très pointue.

Classe Nom dans l'étude Profil de ressources Exemples de langues Nombre de langues
0 The Left-Behinds (les laissées-pour-compte) Pratiquement aucune donnée, étiquetée ou non Dahalo, warlpiri, popoloca, wallisien, bora 2 191
1 The Scraping-Bys (celles qui se débrouillent) Un peu de texte non étiqueté, presque aucune donnée étiquetée Cherokee, fidjien, groenlandais, bhojpuri, navajo 222
2 The Hopefuls (les prometteuses) Un peu des deux, des communautés actives Zoulou, konkani, lao, maltais, irlandais 19
3 The Rising Stars (les étoiles montantes) Forte présence sur le web, peu de ressources étiquetées Indonésien, ukrainien, cebuano, afrikaans, hébreu 28
4 The Underdogs (les outsiders) Beaucoup de données non étiquetées, moins de ressources étiquetées que la classe 5 Russe, hongrois, vietnamien, néerlandais, coréen 18
5 The Winners (les gagnantes) Données étiquetées et non étiquetées abondantes Anglais, espagnol, allemand, japonais, français 7

Source : Joshi et al. (2020), ACL. Photographie du paysage des ressources au moment de la publication ; l'appartenance à une classe dépend des catalogues et des indicateurs utilisés et ne constitue pas un classement permanent. Les traductions des noms de classes sont les nôtres.

Remarquez le wallisien dans la classe 0 : une langue parlée dans une collectivité française d'outre-mer, Wallis-et-Futuna, alors que le français trône dans la classe 5. Comparez aussi les classes 1 et 2. Le bhojpuri, parlé par des dizaines de millions de personnes en Inde et au Népal, figure parmi les « Scraping-Bys » ; le maltais, avec moins d'un million de locuteurs, se situe une classe plus haut. Le maltais est une langue officielle de l'Union européenne, et les institutions européennes produisent des textes traduits dans cette langue depuis deux décennies. Le statut institutionnel crée des données ; les données créent des capacités d'IA.

L'Europe a développé un second instrument, plus contextuel. Le projet European Language Equality (ELE) a défini la métrique d'égalité linguistique numérique (Digital Language Equality, DLE), qui combine des facteurs technologiques (ressources et outils disponibles) et des facteurs contextuels de nature sociale et économique. Gaspari et ses collègues l'ont appliquée à 89 langues européennes. La différence est importante : Joshi compte ce qui existe, tandis que la DLE demande aussi si l'écosystème environnant peut le faire vivre.

Le débat se poursuit en 2026. Lors d'AmericasNLP 2026, Coleman, Coleman et Krishnamachari ont proposé une Resource Abundance Notation (RAN) qui rend compte séparément du nombre de locuteurs, du texte monolingue et des corpus parallèles, au lieu de réduire une langue à une étiquette unique. Pour un acheteur de données d'IA, cette séparation correspond exactement à ce qu'un cahier des charges devrait contenir.

04 · Conséquences

Pourquoi les systèmes d'IA échouent-ils dans les langues peu dotées ?

Les grands modèles de langage apprennent de ce que contient le web, et le web est linguistiquement déséquilibré. Blasi, Anastasopoulos et Neubig (ACL 2022) ont documenté des inégalités de performance systématiques entre les langues du monde en traduction automatique, en questions-réponses, en compréhension écrite, en synthèse vocale, en analyse syntaxique et en flexion morphologique, et ont montré que ces écarts sont liés à des facteurs économiques, démographiques et académiques plutôt qu’à la difficulté linguistique. Les modèles multilingues étendent la couverture, mais partager un même ensemble de paramètres entre des centaines de langues ne garantit pas des résultats équivalents pour chacune d’elles. Le projet No Language Left Behind de Meta (NLLB-200, publié dans Nature en 2024) a porté la traduction automatique neuronale à 200 langues et à environ 40 000 directions de traduction, en combinant apprentissage par transfert et extraction de données à grande échelle, et sa propre évaluation montre à quel point la qualité reste inégale sur cet ensemble.

L'échec le plus subtil tient à l'écart entre couverture nominale et utilité effective. Une langue peut figurer dans la liste des langues « prises en charge » d'un modèle et obtenir des résultats très inférieurs à ceux de ses voisines, ou n'avoir été évaluée que sur un registre restreint, comme la Bible ou Wikipédia. Sans jeux d'évaluation fiables construits par des humains, il est même impossible de le savoir. C'est pourquoi les données d'évaluation ne sont pas un luxe pour les langues peu dotées : elles sont le seul instrument qui distingue une affirmation d'une capacité.

Scène

Vous écrivez en créole à l'assistant en ligne d'un service public ultramarin. Il vous répond dans un français standard impeccable, confond deux expressions propres à votre île avec celles d'un autre créole et bascule sans prévenir en français dès que votre question porte sur un formulaire administratif. Le modèle « comprend les créoles ». Personne n'a mesuré s'il vous comprend, vous.

05 · France et Europe

Les langues de France et l'agenda européen de l'égalité linguistique numérique

La France : une langue bien dotée, 75 langues de France

La France offre un contraste saisissant. Le français fait partie des 7 langues de la classe supérieure chez Joshi, et le pays investit dans des modèles souverains centrés sur le français, comme Lucie-7B, développé par la communauté OpenLLM-France sous l'impulsion de LINAGORA et entraîné sur le supercalculateur Jean Zay. Mais le rapport remis en avril 1999 par Bernard Cerquiglini aux ministres de l'Éducation nationale et de la Culture recensait 75 « langues de France », en métropole et outre-mer : breton, basque, catalan, corse, occitan, alsacien, flamand occidental, francoprovençal, créoles, langues kanak, langues de Guyane, et bien d'autres. La même année, la France signait la Charte européenne des langues régionales ou minoritaires, sans jamais la ratifier.

Depuis la révision constitutionnelle de 2008, l'article 75-1 reconnaît que les langues régionales « appartiennent au patrimoine de la France ». La loi du 21 mai 2021 relative à la protection patrimoniale des langues régionales et à leur promotion, dite loi Molac, a été partiellement censurée le même jour par le Conseil constitutionnel, qui a écarté l'enseignement immersif et l'usage de signes diacritiques des langues régionales dans les actes de l'état civil. Un « ñ » dans un prénom breton pose donc problème à l'administration : on mesure mieux pourquoi ces langues produisent peu de texte dans la sphère publique, et donc peu de données d'entraînement.

La recherche publique s'est emparée du sujet. Le défi Inria COLaF (Corpus et Outils pour les Langues de France), porté par les équipes ALMAnaCH et Multispeech, développe des corpus et des outils libres pour le français d'ici et d'ailleurs, les langues régionales, les créoles à base française (y compris hors de France), les langues autochtones, les langues de l'immigration et la langue des signes française. Côté parole, le breton est présent sur Mozilla Common Voice grâce aux contributions de ses locuteurs.

L'Europe : une décennie de politique linguistique numérique

L'Union européenne compte 24 langues officielles et plus de 60 langues régionales et minoritaires, et traite l'inégalité technologique entre elles comme un problème de politique publique depuis plus de dix ans. La chronologie mérite d'être connue, car elle explique pourquoi le financement public européen se tourne aujourd'hui vers les données linguistiques.

2012

Livres blancs META-NET

La série de livres blancs META-NET a évalué 30 langues européennes. Au moins 21 présentaient un soutien technologique faible ou nul dans au moins l'un des 4 domaines étudiés et étaient décrites comme menacées d'« extinction numérique ».

2018

Résolution du Parlement européen

Le 11 septembre 2018, le Parlement a adopté sa résolution sur l'égalité des langues à l'ère numérique (2018/2028(INI)), appelant à une politique, à des financements et à des infrastructures coordonnés.

2021 à 2022

Projet European Language Equality

Un consortium de 52 partenaires a évalué le soutien technologique des langues européennes, défini la métrique DLE et produit des rapports par langue ainsi qu'une feuille de route vers l'égalité linguistique numérique à l'horizon 2030.

2023

Publication de l'agenda stratégique

Les résultats ont paru dans un ouvrage Springer en libre accès, dirigé par Georg Rehm et Andy Way. L'anglais restait loin devant ; le français, l'allemand et l'espagnol formaient un second groupe au soutien modéré ; la plupart des autres langues présentaient un soutien fragmentaire, faible ou inexistant.

J'ai coécrit le chapitre « Deep Dive: Machine Translation » de European Language Equality: A Strategic Agenda for Digital Language Equality, et la conclusion que je retiens de ce travail est pratique plutôt que rhétorique : la traduction automatique entre langues européennes bien dotées était devenue une commodité, tandis que la qualité pour les langues moins répandues, les domaines spécialisés et les paires sans l'anglais dépendait encore de qui avait investi dans les données. C'est la même logique qui a guidé NTEU, le projet européen dans lequel notre consortium a construit 552 moteurs de traduction automatique neuronale couvrant les 24 langues officielles de l'UE, dont des combinaisons pour l'irlandais, le maltais et d'autres langues que la taxonomie de Joshi place dans les classes inférieures.

06 · Francophonie

Afrique francophone, créoles et Canada : la francophonie face aux langues peu dotées

L'espace francophone rassemble une langue parmi les mieux dotées du monde et des dizaines de langues parmi les moins dotées. Pour un organisme public, une ONG ou une entreprise qui opère en français, c'est souvent dans ces autres langues que se joue l'accès réel au service.

Afrique francophone : de Masakhane au medumba

L'Afrique concentre une part très importante de la diversité linguistique mondiale et demeure faiblement représentée dans les corpus et les modèles. Une revue de 884 articles de TAL africain publiés entre 2020 et 2025 (Alabi, Hedderich, Adelani et Klakow, EMNLP 2025) décrit une croissance soutenue de la recherche, avec une couverture très inégale selon les langues, les tâches et les régions. Masakhane, communauté de recherche distribuée fondée en 2019, a changé la méthode autant que les résultats : son étude participative sur la traduction automatique (Nekoto et al., 2020) a produit des données et des systèmes pour plus de 30 langues africaines, sous la conduite de chercheurs et de locuteurs locaux. Le jeu de données de reconnaissance d'entités nommées MasakhaNER 2.0 (Adelani et al., EMNLP 2022) couvre 20 langues d'Afrique subsaharienne, dont plusieurs sont parlées dans des pays francophones : le bambara, le wolof, le fon, l'éwé, le mooré et le ghomálá'.

Les obstacles ne tiennent pas seulement au volume. Pour le medumba, langue bamiléké du Cameroun, voisine du ghomálá', des chercheurs ont documenté des problèmes de méthodes d'écriture et d'encodage, l'absence de terminologie technique normalisée, la rareté des ressources numériques et un financement limité (Moteu Ngoli et al., AfricaNLP 2025). Quand nous collectons des jeux de données africains pour l'entraînement de l'IA, l'alternance codique (souvent avec le français ou l'anglais) et les conditions acoustiques réelles (marchés, transports, milieu rural) comptent autant que le vocabulaire.

Créoles : la leçon d'Haïti

Les créoles à base française illustrent à quel point le manque de données peut constituer un enjeu humanitaire. Après le séisme de janvier 2010 en Haïti, les SMS envoyés en créole haïtien au service d'urgence Mission 4636 ont dû être traduits à toute vitesse. Ces messages sont devenus la tâche phare du WMT 2011, l'atelier de référence en traduction automatique : environ 17 000 phrases parallèles de SMS pour l'entraînement, un langage bruité, abrégé et sans orthographe stable. La leçon reste valable : quand une crise survient, il est trop tard pour commencer à constituer les données.

Canada : l'inuktitut et la valeur des débats parlementaires

Au Canada, le Conseil national de recherches a publié le corpus parallèle inuktitut-anglais du Hansard du Nunavut (Joanis et al., LREC 2020) : environ 1,3 million de paires de phrases alignées tirées des débats de l'Assemblée législative du Nunavut entre 1999 et 2017, présenté par ses auteurs comme le plus grand corpus parallèle d'une langue polysynthétique ou d'une langue autochtone des Amériques publié à ce jour. L'exemple montre une règle que nous retrouvons partout : les institutions qui produisent des débats bilingues créent, souvent sans le savoir, les ressources les plus précieuses pour l'IA.

07 · L'Espagne, laboratoire à ciel ouvert

Le catalan est-il une langue peu dotée ? Catalan, valencien, basque et galicien

De l'autre côté des Pyrénées, l'Espagne est l'un des meilleurs endroits au monde pour observer la relativité de l'étiquette : quatre langues aux histoires très différentes y coexistent au sein d'un même État et d'un même système de recherche, chacune illustrant une stratégie distincte. Deux d'entre elles, le catalan et le basque, sont aussi des langues de France.

Catalan : bien organisé, encore fragmentaire

Le catalan dispose d'une communauté numérique solide (Softcatalà, corpus ouverts, correcteurs, logiciels libres) que les chercheurs décrivent comme un cas de résilience numérique. Pourtant, le rapport ELE de 2022 sur la langue catalane, signé par Maite Melero, Blanca C. Figueras, Mar Rodríguez et Marta Villegas, classait son soutien technologique global dans la catégorie « fragmentaire », avec de grands écarts entre le texte, la parole et la traduction automatique. La Generalitat de Catalunya a répondu avec le Projecte AINA, développé par le Barcelona Supercomputing Center (BSC), qui a publié des corpus et des modèles ouverts pour le catalan. En avril 2025, le gouvernement espagnol a lancé via le BSC la famille ALIA, une infrastructure publique et ouverte pour l'espagnol et les langues coofficielles ; ses modèles Salamandra ont été entraînés sur 35 langues européennes sous licence Apache 2.0.

Pour nous, chez Pangeanic, ce n'est pas une étude de cas abstraite. Nous avons travaillé avec le BSC sur des jeux de données personnalisés de segments bilingues classés par domaine et par style (avec une attention particulière au catalan), sur l'annotation de données avec contrôle qualité dans notre plateforme d'annotation PECAT, sur l'apprentissage par renforcement à partir de retours humains avec des données pour modèles de récompense, et sur des jeux de données multilingues de détection des discours haineux pour réduire les biais des modèles de langage. Le périmètre complet est décrit dans notre cas d'utilisation avec le Barcelona Supercomputing Center.

Valencien : la variété au sein de la langue

La rareté des ressources n'est pas uniforme au sein d'une même langue. Le rapport ELE reconnaît que, dans la Communauté valencienne, la langue porte le nom traditionnel de valencià, et il recense des ressources propres au valencien, comme le Corpus Informatitzat del Valencià et le Corpus Toponímic Valencià, tout en signalant que plusieurs corpus sont réduits, soumis à des licences restrictives ou dépourvus de jeux d'évaluation comparables. Le jeu de données CATalog d'AINA indique ouvertement que l'essentiel de son contenu relève du catalan central et que des textes valenciens et baléares sont en cours d'ajout afin de réduire le biais de variété. Côté parole, le projet VIVES a publié un corpus de plus de 270 heures issues des Corts Valencianes, conçu en partie pour pallier la rareté des données vocales en valencien. Un système entraîné surtout sur le catalan central peut prendre en charge le catalan sur le papier et offrir une couverture plus faible des formes valenciennes ou baléares.

C'est aussi là que les données vocales rencontrent le service public. Nous assurons la transcription par IA du Parlement valencien depuis 2021, et en 2024 nous avons remporté le marché visant à introduire la transcription par IA au Congrès des députés espagnol, qui couvre les interventions en catalan, en galicien et en basque aux côtés de l'espagnol. La parole parlementaire est exactement le type d'audio long, à plusieurs locuteurs et riche en alternances codiques, qui révèle les écarts de ressources entre variétés.

Basque : un isolat qui a construit son propre modèle

Le basque, parlé de part et d'autre de la frontière franco-espagnole, n'a aucune langue proche : il ne peut donc pas s'appuyer sur le transfert interlinguistique comme le galicien s'appuie sur le portugais ou le valencien sur le reste du catalan. Le centre HiTZ (Université du Pays basque) a répondu avec Latxa, une famille de modèles ouverts de 7 à 70 milliards de paramètres, préentraînés sur un nouveau corpus basque de 4,3 millions de documents et 4,2 milliards de tokens, et publiés avec 4 nouveaux jeux d'évaluation construits à partir d'examens de compétence linguistique, de compréhension écrite, de culture générale et de concours publics. L'article a remporté le prix du meilleur article de ressource à l'ACL 2024. La leçon vaut pour tous : la suite d'évaluation était tout aussi importante que le modèle.

Galicien : le transfert depuis un grand voisin

Le galicien illustre la stratégie inverse. Le Proxecto Nós, mené par le CiTIUS de l'Université de Saint-Jacques-de-Compostelle avec la Xunta de Galicia, a produit des corpus galiciens et des modèles génératifs ouverts (dont Carballo), y compris un modèle bilingue galicien-portugais qui exploite la proximité des deux langues. La proximité aide, mais elle a un effet secondaire connu : les modèles dérivent vers l'orthographe et le vocabulaire du voisin plus grand, à moins que des données et une évaluation par des locuteurs natifs ne les ramènent dans le droit chemin.

Tableau de référence

Les langues peu dotées en un coup d'œil : exemples, lacunes et initiatives

Une comparaison de langues représentatives en France, en Europe, dans l'espace francophone, en Amérique, en Afrique et en Asie. La colonne « situation » résume des évaluations publiées ; elle est qualitative par choix, car le niveau de ressources dépend de la tâche et évolue dans le temps.

Langue Où Situation (évaluation publiée) Principales lacunes pour l'IA Initiatives de référence
Langues régionales de France (breton, occitan, alsacien, corse…) France métropolitaine Reconnues comme patrimoine (Constitution, art. 75-1) ; ressources numériques très inférieures à celles du français Textes contemporains dans la sphère publique, parole transcrite, jeux d'évaluation, variation dialectale COLaF (Inria), Mozilla Common Voice (breton)
Créoles à base française Haïti, Antilles, Guyane, La Réunion, Maurice, Seychelles Créole haïtien au cœur du WMT 2011 après le séisme de 2010 ; ressources inégales selon les créoles Orthographes variables, textes informels, confusion entre créoles et avec le français Tâche WMT 2011, COLaF (créoles, y compris hors de France)
Catalan Catalogne, Communauté valencienne, Baléares, Andorre, Pyrénées-Orientales Soutien global « fragmentaire » (ELE, 2022) ; forte communauté et investissement public depuis Couverture des variétés, données spécialisées, jeux d'évaluation, licences Projecte AINA, CATalog, ALIA, Softcatalà, Apertium
Valencien Communauté valencienne Couvert formellement au titre du catalan ; moins de corpus propres à la variété (ELE, 2022) Données vocales, évaluation par variété, terminologie locale Corpus VIVES des Corts Valencianes (270 h et plus), Corpus Informatitzat del Valencià
Basque Pays basque, Navarre, Pays basque français Isolat linguistique ; LLM et benchmarks dédiés depuis 2024 Transfert limité depuis des langues apparentées ; volume de préentraînement Latxa et sa suite d'évaluation (HiTZ), ALIA
Galicien Galice Ressources ouvertes en croissance ; tire parti de la proximité avec le portugais Dérive vers les normes portugaises ou espagnoles ; évaluation native Proxecto Nós, Carballo, ALIA
Irlandais, maltais Irlande ; Malte Classe 2, « Hopefuls » (Joshi et al., 2020) ; langues officielles de l'UE Volume de données parallèles hors des domaines institutionnels Données de traduction des institutions européennes, moteurs NTEU
Inuktitut Nunavut, Territoires du Nord-Ouest, Nunavik (Québec) Langue polysynthétique ; grand corpus parallèle parlementaire (Joanis et al., 2020) Morphologie complexe, données hors du domaine parlementaire Corpus du Hansard du Nunavut (1,3 million de paires de phrases)
Bambara, wolof, fon, éwé, mooré Mali, Sénégal, Bénin, Togo, Burkina Faso Couverts par MasakhaNER 2.0 (2022) ; recherche africaine en TAL en forte croissance Données annotées, alternance codique avec le français, parole en conditions acoustiques réelles Masakhane, MasakhaNER 2.0
Medumba, ghomálá' Cameroun Obstacles documentés à la collecte de ressources pour le medumba (AfricaNLP 2025) Méthodes d'écriture et d'encodage, terminologie technique, financement Projets de documentation communautaires et universitaires, MasakhaNER 2.0 (ghomálá')
Quechua Pays andins Peu doté malgré des millions de locuteurs ; nombreuses variétés Parole transcrite, corpus parallèles, variation orthographique Tâches partagées AmericasNLP ; ressources de reconnaissance vocale pour le quechua de Puno (2026)
Bhojpuri Inde, Népal Classe 1, « Scraping-Bys », malgré des dizaines de millions de locuteurs Presque aucune donnée étiquetée ; confusion avec l'hindi Initiatives indiennes de données linguistiques
Lao Laos Classe 2, « Hopefuls » (Joshi et al.) Écriture sans espaces entre les mots : tokenisation et segmentation Projets de collecte de données en Asie du Sud-Est

Sources : Joshi et al. (ACL 2020) ; rapport Cerquiglini (1999) ; rapport ELE sur la langue catalane (2022) ; Etxaniz et al. (ACL 2024) ; Joanis et al. (LREC 2020) ; Adelani et al. (EMNLP 2022) ; WMT 2011 ; Moteu Ngoli et al. (AfricaNLP 2025) ; Huaman et al. (AmericasNLP 2026). Références complètes en fin d'article.

08 · Au-delà de l'Europe

Amérique latine et Asie

Amérique latine : les langues autochtones selon leurs propres termes

En Amérique latine, la position technologique de l'espagnol et du portugais contraste fortement avec celle des langues autochtones. La difficulté vient rarement d'un petit nombre de locuteurs : elle vient de l'absence de corpus numériques, d'orthographes pas toujours stabilisées et de la rareté des outils de segmentation, des données parallèles, de la parole enregistrée et des jeux d'évaluation (Mager et al., COLING 2018). L'atelier AmericasNLP, lancé en 2021 au sein de l'Association for Computational Linguistics, a organisé la première tâche partagée de traduction automatique ouverte pour 10 langues autochtones associées à l'espagnol : aymara, bribri, asháninka, guarani, wixarika, nahuatl, hñähñu, quechua, shipibo-konibo et rarámuri. En 2026, un projet centré sur la communauté a construit des ressources de reconnaissance vocale pour le quechua de Puno à partir de dizaines d'heures d'enregistrements et de transcriptions, avec la participation de la communauté à la conception et à la collecte. Ce modèle de travail, où les communautés fixent les objectifs et valident les résultats, devient la norme plutôt que l'exception.

Asie : écritures, segmentation et échelle

L'Asie montre que « peu doté » ne veut pas dire « petit ». Le bhojpuri figure dans la classe 1 de Joshi malgré des dizaines de millions de locuteurs ; le konkani et le lao dans la classe 2 ; le cebuano et l'indonésien dans la classe 3. Les lacunes y sont souvent techniques avant d'être statistiques : les écritures sans espaces entre les mots (lao, thaï, khmer) mettent en échec les tokeniseurs naïfs, et des langues proches sont fréquemment étiquetées comme la langue dominante, ce qui gonfle la couverture apparente de la grande langue et efface la petite. Ma lecture, qui est une inférence et non une mesure publiée, est que la prochaine vague d'IA utile pour les langues asiatiques viendra de données vocales et textuelles collectées sur place, soigneusement segmentées et correctement étiquetées, et non de collectes web toujours plus vastes. C'est le principe de nos jeux de données d'Asie du Sud-Est pour l'entraînement de l'IA.

09 · Techniques

Comment construire une IA pour une langue peu dotée ?

La littérature (Hedderich et al., 2021 ; Haddow et al., 2022 ; Ranathunga et al., 2023) converge vers 6 familles de techniques. Aucune n'est universelle, et chacune comporte un risque précis.

01

Apprentissage par transfert

Affiner un modèle préentraîné multilingue (mBERT, XLM-R, mT5, BLOOM ou des LLM ouverts) sur la langue cible.

Risque : faible efficacité quand la langue cible est éloignée des langues qui dominent le préentraînement.

02

Traduction automatique multilingue et langues apparentées

Entraîner conjointement avec des langues apparentées mieux dotées pour que la plus petite profite de la structure commune.

Risque : dérive vers les normes du voisin le plus grand.

03

Augmentation de données

Les données synthétiques et la rétrotraduction créent des paires d'entraînement supplémentaires à partir de textes monolingues.

Risque : les données synthétiques amplifient les erreurs du système qui les a produites.

04

Apprentissage semi-supervisé et supervision distante

Exploiter des textes non étiquetés, des règles et des dictionnaires pour générer des étiquettes faibles à grande échelle.

Risque : des étiquettes bruitées, qu'il faut des jeux de test validés par des humains pour détecter.

05

Connaissances linguistiques et règles

Lexiques, grammaires et analyseurs morphologiques quand les données ne permettent pas une approche purement statistique. Apertium, la plateforme libre de traduction automatique à base de règles lancée en 2005 à l'Universitat d'Alacant, reste une référence pour les paires de langues apparentées, y compris pour l'occitan et le breton.

Risque : temps d'expert coûteux ; couverture limitée des domaines ouverts.

06

Collecte participative de données

Les locuteurs fournissent, valident et gouvernent les données textuelles et vocales, comme dans Mozilla Common Voice, Masakhane ou les projets AmericasNLP.

Risque : demande du temps, de la coordination, une rémunération équitable et de vrais mécanismes de consentement.

10 · La critique

« Peu dotée » est-elle la bonne étiquette ?

La communauté du TAL utilise toujours ce terme comme standard, mais ses critiques ont précisé ce qu'il occulte. Steven Bird soutient que l'étiquette regroupe des situations très différentes (langues standardisées sans soutien technologique, langues locales de tradition principalement orale, langues de contact), dont les fonctions sociales et les attentes technologiques ne sont pas comparables, et il se demande si le TAL doit nécessairement être extractif (ACL 2024). Traiter les données linguistiques comme une matière première à exploiter peut reproduire des rapports coloniaux et marginaliser les autorités communautaires. Mager, Mager, Kann et Vu (ACL 2023) ont interrogé des responsables communautaires, des enseignants et des militants, et concluent que l'inclusion des locuteurs est indispensable à une traduction automatique utile et éthique des langues autochtones, ce qui conduit à la notion de souveraineté des données linguistiques : les communautés gardent le contrôle sur l'usage des matériaux qu'elles fournissent pour entraîner l'IA.

Je partage cette critique, et je pense qu'elle a une traduction commerciale que le secteur a tardé à accepter. Des données dont la provenance, le consentement et la licence ne peuvent pas être documentés constituent un passif, et dans les langues peu dotées ce passif est concentré, car les mêmes rares sources sont réutilisées partout. Un approvisionnement éthique n'est pas une taxe sur l'IA des langues peu dotées : c'est la seule façon de constituer des jeux de données qui résistent à un audit. C'est pourquoi nous défendons un modèle où l'humain est au centre, où les locuteurs natifs ne sont pas une validation de dernière minute, mais les personnes qui décident de ce que « correct » veut dire pour leur variété.

11 · Critères de décision

7 questions à poser avant d'entraîner ou d'acheter une IA pour une langue peu dotée

Que vous affiniez un modèle souverain, commandiez un jeu de données ou achetiez de la traduction automatique pour un service public, ces questions distinguent la couverture nominale de la capacité réelle.

1. Quelle variété, quel registre, quel domaine ?

« Le créole », « l'occitan » ou « le quechua » ne sont pas des spécifications. Nommez la variété, le public et le domaine, et exigez des données pour chacun.

2. Que signifie « pris en charge » ?

Demandez le benchmark, le jeu de test, la métrique et la date. Une langue dans une liste est une affirmation ; un score sur un jeu de test validé par des humains est une preuve.

3. D'où viennent les données ?

Exigez une provenance, une licence et un consentement documentés pour chaque source, en particulier pour la parole et les textes fournis par des communautés.

4. Quelle part provient du web, et qui l'a auditée ?

Les corpus collectés sur le web pour les petites langues contiennent des textes mal étiquetés et inutilisables. Les audits par des locuteurs natifs repèrent ce que les filtres automatiques laissent passer.

5. Existe-t-il un jeu d'évaluation réservé, construit par des humains ?

Sans lui, impossible de comparer les fournisseurs ou de détecter les régressions entre deux versions d'un modèle.

6. Les données synthétiques sont-elles étiquetées et séparées ?

Les données rétrotraduites et générées doivent être identifiées afin d’éviter toute contamination des jeux d’évaluation.

7. Qui valide les résultats en production ?

Définissez la boucle de révision par des locuteurs natifs, les seuils de qualité et la manière dont les retours sont intégrés à l'entraînement.

Quand les références n'existent pas

L'estimation de la qualité de la traduction automatique (MTQE) sans référence prédit la qualité sans traduction humaine de référence, ce qui la rend particulièrement utile là où les traductions de référence sont rares.

12 · Notre travail

Comment Pangeanic aborde les langues peu dotées

Pangeanic a commencé par construire et traiter des données bilingues pour des systèmes de traduction automatique, bien avant que les « données d'entraînement » ne deviennent une catégorie de marché. Cette histoire nous a appris que la difficulté d'une langue peu dotée ne tient jamais à l'architecture du modèle : elle tient à la recherche, à l'acquisition sous licence, au nettoyage, à l'alignement et à la validation des données, puis à la preuve, par l'évaluation, que le résultat fonctionne pour ceux qui parlent la langue. Aujourd'hui, ce travail passe par nos services de données pour l'IA (recherche, collecte, annotation, RLHF et données d'évaluation), nos corpus parallèles et notre pratique d'évaluation de l'IA, avec une validation par des locuteurs natifs à chaque étape. Lorsque les besoins en données continuent d'évoluer après le déploiement, nous les prenons en charge dans une boucle continue d'opérations de données pour l'IA (AI Data Operations). La même discipline des données sous-tend notre Deep Adaptive AI Translation, qui adapte les résultats à la terminologie et au style de chaque client : un besoin plus aigu, et non moins, dans les langues où les moteurs génériques ont vu peu de texte.

Pour une vue plus large des langues où la traduction automatique peine encore, j'ai écrit sur les langues qui résistent à la traduction automatique (en anglais), à partir de notre expérience en production.

Documenté et déduit

Les chiffres de cet article (taille des classes, résultats d'audit, taille des corpus, heures de parole, dates des projets, nombre de langues de France) proviennent des sources publiées listées ci-dessous. L'évaluation ELE du catalan date de 2022 et précède le lancement d'ALIA en 2025 ; la position actuelle du catalan est donc probablement plus solide que cette photographie, mais aucune réévaluation comparable n'a encore été publiée. L'écart entre la prise en charge affichée et la prise en charge effective pour le valencien et les créoles, la dérive des modèles galiciens vers le portugais et la prévision de la collecte de données en Asie sont mes propres évaluations issues du travail en production, et non des résultats mesurés. La taxonomie de Joshi reflète les catalogues disponibles en 2020 et doit se lire comme une photographie, non comme un classement.

FAQ

Questions fréquentes sur les langues peu dotées

Qu'est-ce qu'une langue peu dotée ?

Une langue peu dotée est une langue qui dispose de trop peu de textes, d'enregistrements vocaux, de données parallèles, de données annotées, d'outils ou de jeux d'évaluation lisibles par une machine pour construire des technologies de la langue aussi performantes que pour l'anglais. Le terme décrit une situation des données qui dépend de la tâche, du domaine et du moment, et non de la richesse de la langue.

Une langue peu dotée est-elle une langue régionale ou minoritaire ?

Non. Une langue régionale se définit par un statut juridique et patrimonial, une langue minoritaire par sa position sociopolitique, une langue en danger par l'affaiblissement de la transmission intergénérationnelle, et une langue peu dotée par la rareté des données et des outils numériques. Ces catégories se recoupent souvent, mais une langue minoritaire peut être bien dotée et une langue parlée par des dizaines de millions de personnes peut être peu dotée.

Combien de langues sont peu dotées ?

La grande majorité. Dans la taxonomie de Joshi et al. (ACL 2020), 2 191 langues se situaient dans la classe la plus basse, pratiquement sans données étiquetées ni non étiquetées, tandis que seules 7 langues, dont l'anglais, l'espagnol, l'allemand, le japonais et le français, formaient la classe supérieure. Plus de 7 000 langues sont parlées dans le monde.

Les langues régionales de France sont-elles des langues peu dotées ?

Oui, pour la plupart des tâches d'IA. Le rapport Cerquiglini de 1999 recensait 75 langues de France, dont le breton, le basque, le catalan, le corse, l'occitan, l'alsacien et les créoles, et leurs ressources numériques demeurent très inférieures à celles du français. Des initiatives comme le défi Inria COLaF, qui développe des corpus et des outils libres pour les langues de France, et la collecte participative de Mozilla Common Voice pour le breton cherchent à combler cet écart.

Les langues africaines parlées en pays francophones sont-elles peu dotées ?

La plupart le sont encore. Le bambara, le wolof, le fon, l'éwé, le mooré et le ghomálá' figurent dans le jeu de données MasakhaNER 2.0 publié en 2022, mais les données annotées, la parole enregistrée en conditions réelles et la terminologie technique restent rares. Pour le medumba, au Cameroun, les chercheurs ont documenté des obstacles liés à l'écriture, à l'encodage et au financement.

Pourquoi la traduction automatique est-elle moins bonne dans les langues peu dotées ?

La traduction automatique neuronale et les grands modèles de langage apprennent à partir de données parallèles et monolingues, et les langues peu dotées en possèdent peu, souvent concentrées dans des domaines étroits et mélangées à des textes mal étiquetés ou de faible qualité. Sans jeux de test construits par des humains, les erreurs passent aussi inaperçues, si bien qu'une langue peut apparaître comme prise en charge tout en obtenant des résultats très inférieurs à ceux des langues mieux dotées.

Comment construire une IA pour une langue peu dotée ?

Les principales techniques sont l'apprentissage par transfert à partir de modèles multilingues, l'entraînement conjoint avec des langues apparentées, l'augmentation de données comme la rétrotraduction, l'apprentissage semi-supervisé, les ressources lexicales et à base de règles, et la collecte participative de données avec les communautés de locuteurs. Toutes dépendent de données de qualité, bien documentées, et de jeux d'évaluation validés par des humains.

Quelles données Pangeanic fournit-elle pour les langues peu dotées ?

Pangeanic recherche, collecte, annote et valide des données textuelles, vocales et parallèles pour l'entraînement et l'évaluation de l'IA, y compris des données RLHF et de préférence, avec une validation par des locuteurs natifs. Ses travaux comprennent des jeux de données pour le Barcelona Supercomputing Center avec une attention particulière au catalan, la transcription par IA au Congrès des députés espagnol couvrant le catalan, le galicien et le basque, et la collecte de données pour des langues africaines et d'Asie du Sud-Est.

Données pour l'IA

Vous construisez une IA pour une langue que le web a oubliée ?

Indiquez-nous la langue, la variété et le domaine. Nous vous dirons quelles données existent, lesquelles il faut collecter et comment prouver que le modèle fonctionne.

Références

Sources

  1. Adelani, D. I., et al. (2022). MasakhaNER 2.0: Africa-centric Transfer Learning for Named Entity Recognition. Proceedings of EMNLP 2022. doi:10.18653/v1/2022.emnlp-main.298
  2. Alabi, J. O., Hedderich, M. A., Adelani, D. I., and Klakow, D. (2025). Charting the Landscape of African NLP: Mapping Progress and Shaping the Road Ahead. Proceedings of EMNLP 2025, 27807-27841. doi:10.18653/v1/2025.emnlp-main.1414
  3. Bird, S. (2024). Must NLP be Extractive? Proceedings of ACL 2024, 14915-14929. doi:10.18653/v1/2024.acl-long.797
  4. Blasi, D., Anastasopoulos, A., and Neubig, G. (2022). Systematic Inequalities in Language Technology Performance across the World's Languages. Proceedings of ACL 2022, 5486-5505. doi:10.18653/v1/2022.acl-long.376
  5. Callison-Burch, C., Koehn, P., Monz, C., and Zaidan, O. (2011). Findings of the 2011 Workshop on Statistical Machine Translation. Proceedings of the Sixth Workshop on Statistical Machine Translation (WMT 2011).
  6. Cerquiglini, B. (1999). Les langues de la France. Rapport au ministre de l'Éducation nationale, de la Recherche et de la Technologie et à la ministre de la Culture et de la Communication, avril 1999.
  7. Coleman, J., Coleman, T., and Krishnamachari, B. (2026). RAN: Resource Abundance Notation for Languages in NLP. Proceedings of AmericasNLP 2026, 168-172.
  8. Etxaniz, J., Sainz, O., Perez, N., et al. (2024). Latxa: An Open Language Model and Evaluation Suite for Basque. Proceedings of ACL 2024.
  9. Gaspari, F., et al. (2023). Digital Language Equality: Definition, Metric, Dashboard. In Rehm and Way (eds.), European Language Equality, Springer, 39-73.
  10. Haddow, B., Bawden, R., Miceli Barone, A. V., Helcl, J., and Birch, A. (2022). Survey of Low-Resource Machine Translation. Computational Linguistics 48(3), 673-732. doi:10.1162/coli_a_00446
  11. Hedderich, M. A., Lange, L., Adel, H., Strötgen, J., and Klakow, D. (2021). A Survey on Recent Approaches for Natural Language Processing in Low-Resource Scenarios. Proceedings of NAACL 2021, 2545-2568. doi:10.18653/v1/2021.naacl-main.201
  12. Huaman, E., Gamarra Lafuente, A., Cordova, J., and Korhonen, A. (2026). Building Community-Centred NLP Resources for Puno Quechua. Proceedings of AmericasNLP 2026.
  13. Joanis, E., Knowles, R., Kuhn, R., Larkin, S., Littell, P., Lo, C., Stewart, D., and Micher, J. (2020). The Nunavut Hansard Inuktitut–English Parallel Corpus 3.0 with Preliminary Machine Translation Results. Proceedings of LREC 2020.
  14. Joshi, P., Santy, S., Budhiraja, A., Bali, K., and Choudhury, M. (2020). The State and Fate of Linguistic Diversity and Inclusion in the NLP World. Proceedings of ACL 2020, 6282-6293. doi:10.18653/v1/2020.acl-main.560
  15. Kreutzer, J., Caswell, I., et al. (2022). Quality at a Glance: An Audit of Web-Crawled Multilingual Datasets. Transactions of the ACL 10, 50-72. doi:10.1162/tacl_a_00447
  16. Loi n° 2021-641 du 21 mai 2021 relative à la protection patrimoniale des langues régionales et à leur promotion, et décision n° 2021-818 DC du Conseil constitutionnel du 21 mai 2021.
  17. Mager, M., Gutierrez-Vasques, X., Sierra, G., and Meza-Ruiz, I. (2018). Challenges of Language Technologies for the Indigenous Languages of the Americas. Proceedings of COLING 2018, 55-69.
  18. Mager, M., et al. (2021). Findings of the AmericasNLP 2021 Shared Task on Open Machine Translation for Indigenous Languages of the Americas. Proceedings of AmericasNLP 2021, 202-217.
  19. Mager, M., Mager, E., Kann, K., and Vu, N. T. (2023). Ethical Considerations for Machine Translation of Indigenous Languages: Giving a Voice to the Speakers. Proceedings of ACL 2023, 4871-4897.
  20. Melero, M., C. Figueras, B., Rodríguez, M., and Villegas, M. (2022). Report on the Catalan Language. European Language Equality, Deliverable D1.6.
  21. Moteu Ngoli, T., Christabel, M., and Yopa, N. (2025). Challenges and Limitations in Gathering Resources for Low-Resource Languages: The Case of Medumba. Proceedings of AfricaNLP 2025, 136-142.
  22. Nekoto, W., et al. (2020). Participatory Research for Low-resourced Machine Translation: A Case Study in African Languages. Findings of EMNLP 2020, 2144-2160.
  23. NLLB Team (2024). Scaling neural machine translation to 200 languages. Nature 630, 841-846. doi:10.1038/s41586-024-07335-x
  24. Ranathunga, S., et al. (2023). Neural Machine Translation for Low-resource Languages: A Survey. ACM Computing Surveys 55(11). doi:10.1145/3567592
  25. Rehm, G., and Way, A. (eds.) (2023). European Language Equality: A Strategic Agenda for Digital Language Equality. Springer, Cognitive Technologies. doi:10.1007/978-3-031-28819-7
  26. Tatariya, K., et al. (2024). How Good is Your Wikipedia? Auditing Data Quality for Low-resource and Multilingual NLP. arXiv:2411.05527