IA MULTILINGÜE · DATOS PARA LA IA
Pangeanic

¿Qué es una lengua de escasos recursos?

Una lengua no es pobre porque le falten palabras. Es «de escasos recursos» porque le faltan datos legibles por máquina, herramientas y bancos de pruebas. Esta guía explica la definición, cómo se mide esa condición, dónde se nota más (del valenciano al quechua, del medumba al lao) y qué debe preguntar cualquiera que entrene o compre IA para estas lenguas antes de confiar en un modelo que dice «soportarlas».

Por Manuel Herranz, fundador y CEO de Pangeanic · Publicado el 27 de septiembre de 2026 · 20 min de lectura

7000+
lenguas habladas hoy en el mundo
2191
lenguas en la clase de menores recursos («The Left-Behinds»), Joshi et al., ACL 2020
7
lenguas en la clase superior («The Winners»), mismo estudio
21 de 30
lenguas europeas en riesgo de «extinción digital», META-NET, 2012

Definición

Lengua de escasos recursos (de bajos recursos)

Una lengua de escasos recursos (también llamada lengua de bajos recursos o lengua con pocos recursos) es una lengua para la que no existe suficiente texto digital, habla, datos paralelos, datos anotados, herramientas informáticas ni bancos de pruebas de evaluación para construir y medir tecnología del lenguaje (traducción automática, reconocimiento de voz, grandes modelos de lenguaje) con un rendimiento comparable al que se obtiene en inglés. La etiqueta describe una condición de datos, no la lengua en sí, y cambia según la tarea, el dominio, la modalidad y el momento de la evaluación.

Término opuesto: lengua de altos recursos (inglés, español, alemán, japonés y francés ocupan la cúspide de la taxonomía más citada). Relacionados pero distintos: lengua minoritaria, lengua minorizada y lengua en peligro de extinción.

01 · El concepto

Una condición de datos, no un veredicto lingüístico

El término nació dentro del procesamiento del lenguaje natural (PLN) y la lingüística computacional, y arrastra el sesgo de su cuna: mide una lengua por lo que una máquina puede aprender de ella. Una lengua con una tradición literaria milenaria, una morfología rica y millones de hablantes puede seguir siendo «de escasos recursos» si muy poco de ella existe como texto limpio, licenciado y legible por máquina, o como habla transcrita. Al contrario, una lengua con menos hablantes pero décadas de inversión pública en corpus, correctores ortográficos, treebanks y memorias de traducción puede no ser de escasos recursos en absoluto. El número de hablantes y los recursos digitales son dos ejes distintos, y la IA solo ve el segundo.

El planteamiento académico más útil viene de Hedderich y sus colegas (NAACL 2021), que describen un escenario de escasos recursos en lugar de una lengua de escasos recursos. El escenario se define en 3 dimensiones: la disponibilidad de datos etiquetados para la tarea concreta, la disponibilidad de texto sin etiquetar en la lengua o el dominio y la disponibilidad de datos auxiliares (diccionarios, lenguas emparentadas, bases de conocimiento). Por eso la misma lengua puede estar bien servida para la corrección ortográfica y mal servida para el reconocimiento de voz, o ser fuerte en texto periodístico y débil en notas clínicas. De hecho, incluso el inglés se convierte en un escenario de escasos recursos en un dominio técnico estrecho sin datos anotados. Haddow y sus colegas (Computational Linguistics, 2022) añaden una dimensión temporal para la traducción automática: algunos pares de lenguas considerados escasos hace una década disponen hoy de muchos más datos gracias al rastreo web y al uso de texto monolingüe.

Por supuesto, la etiqueta tiene un coste. Algunos investigadores señalan que «de escasos recursos» define una lengua por lo que le falta y puede invisibilizar el conocimiento, las prácticas y las prioridades de sus hablantes. Vuelvo sobre esa crítica más adelante, porque tiene consecuencias prácticas sobre cómo deben recopilarse los datos. Por ahora, la definición de trabajo importa porque la contratación pública, la financiación de investigación y las notas de lanzamiento de modelos la usan sin decir casi nunca a cuál de las 3 dimensiones se refieren.

Terminología

¿Es lo mismo una lengua de escasos recursos que una lengua minoritaria o en peligro?

No. Las categorías se solapan a menudo, pero cada una se define por un criterio distinto. Confundirlas conduce a políticas equivocadas y a conjuntos de datos peores.

Término Se define por Relación con los recursos de IA
Lengua de escasos recursos Escasez de datos legibles por máquina, herramientas y bancos de pruebas para una tarea dada El criterio computacional en sí; varía según tarea, dominio, modalidad y año
Lengua de altos recursos Abundancia de datos etiquetados y sin etiquetar, herramientas y evaluación maduras Inglés, español, alemán, japonés y francés forman la clase superior en Joshi et al. (2020)
Lengua minoritaria Posición sociopolítica dentro de un territorio o un Estado Suele coincidir con la escasez de datos, pero una lengua minoritaria puede estar bien dotada
Lengua minorizada Un proceso histórico de desplazamiento social por una lengua dominante El desplazamiento suele reducir el texto producido en ámbitos públicos, que después se convierte en datos de entrenamiento
Lengua en peligro de extinción Interrupción o debilitamiento de la transmisión intergeneracional La mayoría de las lenguas en peligro son de escasos recursos; la mayoría de las lenguas de escasos recursos no están en peligro

02 · Inventario

¿Qué cuenta como «recurso»?

No existe un umbral universal de tokens u horas por encima del cual una lengua deja de ser de escasos recursos. Los recursos necesarios dependen de la aplicación, y también las carencias. Este es el inventario que usamos al acotar un proyecto de datos.

Capa de recurso Recursos habituales Carencias frecuentes en lenguas de escasos recursos Qué falla en la IA
Texto Corpus monolingües, libros y archivos digitalizados, prensa, enciclopedias, texto de administración pública Volumen pequeño, dominios estrechos, duplicados, codificación defectuosa, texto etiquetado con la lengua equivocada Preentrenamiento de LLM, fluidez y conocimiento del contexto local
Traducción Corpus paralelos, memorias de traducción, glosarios bilingües y terminología Pocos pares de frases, concentración en textos religiosos o administrativos, traducciones de baja calidad Calidad de la traducción automática, transferencia entre lenguas, coherencia terminológica
Habla Grabaciones, transcripciones, léxicos de pronunciación, metadatos de hablantes Pocas horas transcritas, variedades y acentos infrarrepresentados, metadatos ausentes ASR, TTS, asistentes de voz, transcripción de sesiones públicas
Anotación Etiquetas morfosintácticas, entidades nombradas, dependencias, sentimiento, intenciones, datos de preferencia Muestras muy pequeñas, criterios incompatibles, muy pocos anotadores cualificados Ajuste fino, alineamiento RLHF y DPO, detección de seguridad y discurso de odio
Infraestructura y evaluación Teclados, tipografías, tokenizadores, analizadores morfológicos, correctores, bancos de pruebas, métricas Ortografías inestables, cobertura incompleta de grafías, licencias restrictivas, ausencia de conjuntos de prueba No se puede saber si un sistema funciona, ni para qué variedad

La existencia de un archivo no lo convierte en un recurso. La calidad, la representatividad, la documentación, el formato y la licencia deciden si unos datos pueden reutilizarse. La advertencia más clara viene de Kreutzer y sus colegas (TACL, 2022), que auditaron manualmente 205 corpus específicos de lengua publicados junto con 5 grandes conjuntos de datos rastreados en la web (CCAligned, ParaCrawl, WikiMatrix, OSCAR y mC4). Los corpus de menores recursos mostraron problemas sistemáticos: al menos 15 corpus no contenían ningún texto utilizable, y una fracción significativa contenía menos del 50 % de frases de calidad aceptable, muchos de ellos mal etiquetados o marcados con códigos de lengua ambiguos. Un recuento bruto de tokens puede así ofrecer una imagen imaginaria de la cobertura real.

Wikipedia, el proxy por defecto de «texto sin etiquetar», tiene sus propias patologías. Tatariya y sus colegas (2024) encontraron contaminación de escrituras y lenguas, artículos de relleno y una fuerte presencia de contenido generado por bots en las ediciones de escasos recursos, y mostraron que los modelos entrenados con datos filtrados igualan o superan a los entrenados con el volcado en bruto. El cebuano es el caso de manual: una de las Wikipedias más grandes por número de artículos, gran parte generada de forma automática. Y existe un bucle de retroalimentación que merece nombrarse. La traducción automática de baja calidad publicada en la web acaba rastreada de nuevo hacia los corpus de entrenamiento, de modo que la lengua que más necesita datos buenos es la más expuesta a errores reciclados. Para nosotros en Pangeanic, este es el argumento a favor de la validación humana por hablantes nativos en el punto donde los datos entran en un pipeline (un tema del que ya he escrito en por qué es tan difícil lograr calidad en los datos multilingües de IA).

03 · Medición

¿Cómo se mide el nivel de recursos?

El intento más citado de clasificar las lenguas del mundo por sus recursos es «The State and Fate of Linguistic Diversity and Inclusion in the NLP World», de Joshi, Santy, Budhiraja, Bali y Choudhury (ACL 2020). Los autores construyeron una taxonomía de 6 clases sobre 2 ejes: el número de recursos etiquetados (tomados del catálogo del LDC y del mapa de la ELRA) y el volumen de texto sin etiquetar (aproximado a través de Wikipedia). El resultado es una pirámide muy pronunciada.

Clase Nombre en el estudio Perfil de recursos Lenguas de ejemplo Lenguas en la clase
0 The Left-Behinds Prácticamente sin datos etiquetados ni sin etiquetar Dahalo, warlpiri, popoloca, wallisiano, bora 2191
1 The Scraping-Bys Algo de texto sin etiquetar, casi sin datos etiquetados Cheroqui, fiyiano, groenlandés, bhoypurí, navajo 222
2 The Hopefuls Cantidades reducidas de ambos, comunidades activas Zulú, konkaní, lao, maltés, irlandés 19
3 The Rising Stars Fuerte presencia web, pocos recursos etiquetados Indonesio, ucraniano, cebuano, afrikáans, hebreo 28
4 The Underdogs Mucho dato sin etiquetar, menos recursos etiquetados que la clase 5 Ruso, húngaro, vietnamita, neerlandés, coreano 18
5 The Winners Abundancia de datos etiquetados y sin etiquetar Inglés, español, alemán, japonés, francés 7

Fuente: Joshi et al. (2020), ACL. Instantánea del panorama de recursos en el momento de la publicación; la pertenencia a cada clase depende de los catálogos e indicadores usados y no es una clasificación permanente.

Compárense la clase 1 y la clase 2. El bhoypurí, hablado por decenas de millones de personas en la India y Nepal, aparece en «The Scraping-Bys»; el maltés, con una población de hablantes muy por debajo del millón, aparece una clase por encima. El maltés es lengua oficial de la Unión Europea, y las instituciones comunitarias llevan dos décadas produciendo texto traducido en esa lengua. El estatus institucional crea datos; los datos crean capacidad de IA.

Europa desarrolló un segundo instrumento, más contextual. El proyecto European Language Equality (ELE) definió la métrica de igualdad lingüística digital (Digital Language Equality, DLE), que combina factores tecnológicos (recursos y herramientas disponibles) con factores situacionales de carácter social y económico. Gaspari y sus colegas la aplicaron a 89 lenguas europeas. La diferencia importa: Joshi cuenta lo que existe, mientras que la DLE pregunta además si el ecosistema circundante puede sostenerlo.

El debate continúa en 2026. En AmericasNLP 2026, Coleman, Coleman y Krishnamachari propusieron una Resource Abundance Notation (RAN) que informa por separado de la abundancia de hablantes, el texto monolingüe y los corpus paralelos, en lugar de comprimir una lengua en una sola etiqueta. Para quien compra datos de IA, esa separación es exactamente lo que debería contener un pliego de condiciones.

04 · Consecuencias

¿Por qué fallan los sistemas de IA en lenguas de escasos recursos?

Los grandes modelos de lenguaje aprenden de lo que contiene la web, y la web está lingüísticamente desequilibrada. Blasi, Anastasopoulos y Neubig (ACL 2022) documentaron desigualdades sistemáticas de rendimiento entre las lenguas del mundo en traducción automática, respuesta a preguntas, comprensión lectora, síntesis de voz, análisis sintáctico y flexión morfológica, y mostraron que esas brechas siguen factores económicos, demográficos y académicos, no la dificultad lingüística. Los modelos multilingües amplían la cobertura, pero compartir un mismo conjunto de parámetros entre cientos de lenguas no garantiza resultados equivalentes para cada una. El proyecto No Language Left Behind de Meta (NLLB-200, publicado en Nature en 2024) escaló la traducción automática neuronal a 200 lenguas y unas 40 000 direcciones de traducción precisamente combinando aprendizaje por transferencia con minería de datos a gran escala, y su propia evaluación muestra lo desigual que sigue siendo la calidad dentro de ese rango.

El fallo más sutil es la brecha entre cobertura nominal y utilidad efectiva. Una lengua puede figurar en la lista de lenguas soportadas de un modelo y aun así rendir muy por debajo de sus vecinas, o haber sido evaluada solo en un registro estrecho como el texto bíblico o Wikipedia. Sin bancos de pruebas fiables construidos por humanos, ni siquiera se puede saber. Por eso los datos de evaluación no son un lujo para las lenguas de escasos recursos: son el único instrumento que separa una afirmación de una capacidad real.

Escena

Escribes al chatbot de un servicio de salud autonómico en valenciano. Responde en un catalán central fluido y seguro, se equivoca en dos topónimos locales y cambia sin avisar al español en cuanto tu pregunta menciona una receta. El modelo «soporta el catalán». Nadie ha medido si te soporta a ti.

05 · Europa

La agenda europea de igualdad lingüística digital

La Unión Europea tiene 24 lenguas oficiales y más de 60 lenguas regionales y minoritarias, y lleva más de una década tratando la desigualdad tecnológica entre ellas como un problema de política pública. Merece la pena conocer la secuencia, porque explica por qué la financiación pública europea fluye hoy hacia los datos lingüísticos.

2012

Libros blancos de META-NET

La serie de libros blancos de META-NET evaluó 30 lenguas europeas. Al menos 21 mostraban un apoyo tecnológico débil o inexistente en al menos una de las 4 áreas estudiadas, y se describieron como en riesgo de «extinción digital».

2018

Resolución del Parlamento Europeo

El 11 de septiembre de 2018 el Parlamento aprobó su resolución sobre la igualdad lingüística en la era digital (2018/2028(INI)), que reclamaba política coordinada, financiación e infraestructura.

2021 a 2022

Proyecto European Language Equality

Un consorcio de 52 socios evaluó el apoyo tecnológico de las lenguas europeas, definió la métrica DLE y produjo informes específicos por lengua además de una hoja de ruta hacia la igualdad lingüística digital en 2030.

2023

Se publica la agenda estratégica

Los resultados aparecieron en un volumen de acceso abierto de Springer editado por Georg Rehm y Andy Way. El inglés seguía muy por delante; francés, alemán y español formaban un segundo grupo con apoyo moderado; la mayoría del resto de lenguas mostraba un apoyo fragmentario, débil o inexistente.

Fui coautor del capítulo «Deep Dive: Machine Translation» de European Language Equality: A Strategic Agenda for Digital Language Equality, y la conclusión que subrayaría de aquel trabajo es práctica más que retórica: la traducción automática entre lenguas europeas bien dotadas se había convertido en un producto básico, mientras que la calidad para lenguas más pequeñas, dominios especializados y pares sin inglés seguía dependiendo de quién hubiera invertido en datos. Esa misma lógica impulsó NTEU, el proyecto europeo en el que nuestro consorcio construyó 552 motores de traducción automática neuronal que cubren las 24 lenguas oficiales de la UE, incluidas direcciones para irlandés, maltés y otras lenguas que la taxonomía de Joshi sitúa en las clases inferiores.

06 · España como laboratorio

¿Es el catalán una lengua de escasos recursos? Catalán, valenciano, euskera y gallego

España es uno de los mejores lugares del mundo para ver lo relativa que es esta etiqueta, porque 4 lenguas con historias muy distintas conviven dentro de un mismo Estado y un mismo sistema de investigación. Ninguna encaja en una sola categoría, y cada una se ha convertido en el escaparate de una estrategia diferente.

Catalán: bien organizado, todavía fragmentario

El catalán cuenta con una comunidad digital fuerte (Softcatalà, corpus abiertos, correctores ortográficos, software libre) que los investigadores describen como un caso de resiliencia digital. Aun así, el informe de ELE de 2022 sobre la lengua catalana, firmado por Maite Melero, Blanca C. Figueras, Mar Rodríguez y Marta Villegas, situó su apoyo tecnológico global en la categoría «fragmentario», con grandes diferencias entre áreas como el texto, el habla y la traducción automática. La Generalitat de Catalunya respondió con el Projecte AINA, desarrollado por el Barcelona Supercomputing Center (BSC), que ha publicado corpus y modelos abiertos para el catalán. En abril de 2025 el Gobierno de España presentó la familia ALIA a través del BSC, una infraestructura pública y abierta para el español y las lenguas cooficiales; sus modelos Salamandra se entrenaron con 35 lenguas europeas bajo licencia Apache 2.0.

Para nosotros en Pangeanic esto no es un caso de estudio abstracto. Hemos trabajado con el BSC en conjuntos de datos personalizados de segmentos bilingües clasificados por dominio y estilo (con especial énfasis en el catalán), en anotación de datos con control de calidad en nuestra plataforma PECAT, en aprendizaje por refuerzo con retroalimentación humana con datos de modelos de recompensa y en conjuntos de datos de detección de discurso de odio multilingüe para reducir sesgos en los modelos de lenguaje. El alcance completo se describe en nuestro caso de uso del Barcelona Supercomputing Center.

Valenciano: la variedad dentro de la lengua

La escasez de recursos no es uniforme dentro de una misma lengua. El mismo informe de ELE reconoce que en la Comunitat Valenciana la denominación tradicional de la lengua es valencià, e inventaría recursos específicos valencianos como el Corpus Informatitzat del Valencià y el Corpus Toponímic Valencià, aunque advierte de que varios corpus son pequeños, están restringidos por licencia o carecen de conjuntos de evaluación comparables. El conjunto CATalog de AINA reconoce abiertamente que la mayor parte de su material es catalán central y que se están incorporando de forma activa textos valencianos y baleares para reducir el sesgo de variedad. En habla, el proyecto VIVES publicó un corpus de más de 270 horas de Les Corts Valencianes, concebido en parte para compensar la escasez de datos de voz en valenciano. Un sistema entrenado sobre todo con catalán central puede soportar formalmente el catalán y ofrecer al mismo tiempo una cobertura más débil de las formas valencianas o baleares.

Aquí es también donde los datos de habla se encuentran con el servicio público. Llevamos prestando transcripción con IA a Les Corts Valencianes desde 2021, y en 2024 se nos adjudicó el contrato para introducir transcripción con IA en el Congreso de los Diputados, que cubre intervenciones en catalán, gallego y euskera junto al español. El habla parlamentaria es exactamente el tipo de audio extenso, con varios hablantes y con alternancia de código que expone las brechas de recursos entre variedades.

Euskera: una lengua aislada que construyó su propio modelo

El euskera no tiene parientes lingüísticos cercanos, así que no puede apoyarse en la transferencia entre lenguas como sí hace el gallego con el portugués o el valenciano con el resto del catalán. El HiTZ Center (Universidad del País Vasco) respondió con Latxa, una familia de modelos abiertos de 7000 a 70 000 millones de parámetros preentrenados con un nuevo corpus de euskera de 4,3 millones de documentos y 4200 millones de tokens, publicado junto con 4 nuevos bancos de pruebas de evaluación construidos a partir de exámenes de acreditación, comprensión lectora, cultura general y oposiciones públicas. El artículo recibió el premio Best Resource Paper en ACL 2024. La lección para todos los demás: el banco de pruebas de evaluación fue una aportación tan importante como el modelo.

Gallego: transferencia desde un vecino grande

El gallego ilustra la estrategia contraria. Proxecto Nós, liderado por CiTIUS en la Universidade de Santiago de Compostela junto con la Xunta de Galicia, ha producido corpus gallegos y modelos generativos abiertos (entre ellos Carballo), incluido un modelo bilingüe gallego-portugués que explota la proximidad entre ambas lenguas. La proximidad ayuda, pero tiene un efecto secundario conocido: los modelos derivan hacia la ortografía y el vocabulario del vecino más grande a menos que los datos y la evaluación de hablantes nativos los frenen.

Tabla de referencia

Lenguas de escasos recursos de un vistazo: ejemplos, carencias e iniciativas

Una comparación de lenguas representativas de Europa, América, África y Asia. La columna de estado resume evaluaciones publicadas; es cualitativa por diseño, porque el nivel de recursos depende de la tarea y cambia con el tiempo.

Lengua Dónde Estado de recursos (evaluación publicada) Principales carencias para la IA Iniciativas de referencia
Catalán Catalunya, Comunitat Valenciana, Illes Balears, Andorra Apoyo global «fragmentario» (ELE, 2022); comunidad fuerte e inversión pública desde entonces Cobertura de variedades, datos por dominio, conjuntos de evaluación, licenciamiento Projecte AINA, CATalog, ALIA, Softcatalà, Apertium
Valenciano Comunitat Valenciana Cubierto formalmente bajo el catalán; menos corpus específicos de variedad (ELE, 2022) Datos de habla, evaluación sensible a la variedad, terminología local Corpus VIVES de Les Corts Valencianes (270+ horas), Corpus Informatitzat del Valencià
Euskera Euskadi, Navarra, País Vasco francés Lengua aislada; LLM y bancos de pruebas propios desde 2024 Transferencia limitada desde lenguas emparentadas; volumen de preentrenamiento Latxa y su banco de pruebas de evaluación (HiTZ), ALIA
Gallego Galicia Recursos abiertos en crecimiento; se beneficia de la proximidad al portugués Deriva hacia normas del portugués o del español; evaluación nativa Proxecto Nós, Carballo, ALIA
Irlandés, maltés Irlanda; Malta Clase 2 «Hopefuls» (Joshi et al., 2020); lenguas oficiales de la UE Volumen de datos paralelos fuera de los dominios institucionales Datos institucionales de traducción de la UE, motores de NTEU
Quechua Países andinos De escasos recursos pese a millones de hablantes; muchas variedades Habla transcrita, corpus paralelos, variación ortográfica Tareas compartidas de AmericasNLP; recursos de ASR para el quechua de Puno (2026)
Náhuatl, wixárika, rarámuri, hñähñu México Incluidas en la primera tarea compartida de traducción automática de AmericasNLP (2021) Datos paralelos, ortografía normalizada, herramientas de segmentación AmericasNLP
Zulú, yoruba, hausa África austral y occidental Zulú en clase 2 (Joshi et al.); investigación en PLN africano en rápido crecimiento Datos anotados, alternancia de código, habla en condiciones acústicas reales Masakhane, MasakhaNER, African Languages Lab
Medumba Camerún Barreras de recopilación de recursos documentadas (AfricaNLP 2025) Métodos de escritura y codificación, terminología técnica, financiación Proyectos comunitarios y académicos de documentación
Bhoypurí India, Nepal Clase 1 «Scraping-Bys» pese a decenas de millones de hablantes Casi sin datos etiquetados; confusión con el hindi Iniciativas indias de datos lingüísticos
Lao Laos Clase 2 «Hopefuls» (Joshi et al.) Escritura sin espacios entre palabras: tokenización y segmentación Proyectos de recopilación de datos del sudeste asiático
Cebuano Filipinas Clase 3 «Rising Stars»; Wikipedia muy grande pero en buena parte generada por bots Texto natural escrito por humanos, más allá de artículos con plantilla Auditorías de calidad de Wikipedia (Tatariya et al., 2024)

Fuentes: Joshi et al. (ACL 2020); informe de ELE sobre la lengua catalana (2022); Etxaniz et al. (ACL 2024); Mager et al. (AmericasNLP 2021); Moteu Ngoli et al. (AfricaNLP 2025); Huaman et al. (AmericasNLP 2026); Tatariya et al. (2024). Referencias completas al final del artículo.

07 · Más allá de Europa

África, América y Asia

África: donde está la mayor parte de la diversidad

África concentra una parte muy grande de la diversidad lingüística mundial, y sigue estando poco representada en corpus y modelos. Una revisión de 884 artículos de PLN africano publicados entre 2020 y 2025 (Alabi, Hedderich, Adelani y Klakow, EMNLP 2025) describe un crecimiento sostenido de la investigación, con una cobertura muy desigual entre lenguas, tareas y regiones. Masakhane, fundada en 2019 como una comunidad de investigación distribuida, cambió el método tanto como el resultado: su estudio de traducción automática participativa (Nekoto et al., 2020) produjo datos y sistemas para más de 30 lenguas africanas con investigadores y hablantes locales al mando. Los obstáculos no son solo de volumen. Para el medumba, hablado en Camerún, los investigadores documentaron problemas con los métodos de escritura y codificación, la ausencia de terminología técnica normalizada, la escasez de recursos digitales y la financiación limitada. Cuando recopilamos datasets africanos para entrenamiento de IA, la alternancia de código y las condiciones acústicas reales (mercados, transporte, entornos rurales) resultan importar tanto como el vocabulario.

América: las lenguas indígenas en sus propios términos

En América Latina, la posición tecnológica del español y el portugués contrasta con fuerza con la de las lenguas indígenas. La dificultad rara vez procede de un número reducido de hablantes: procede de la falta de corpus digitales, de ortografías no siempre estables y de la escasez de herramientas de segmentación, datos paralelos, habla grabada y conjuntos de evaluación (Mager et al., COLING 2018). El taller AmericasNLP, iniciado en 2021 dentro de la Association for Computational Linguistics, organizó la primera tarea compartida de traducción automática abierta para 10 lenguas indígenas emparejadas con el español: aimara, bribri, asháninka, guaraní, wixárika, náhuatl, hñähñu, quechua, shipibo-konibo y rarámuri. Ediciones posteriores se ampliaron a más lenguas, a materiales educativos y a métricas de traducción. En 2026 un proyecto de diseño comunitario construyó recursos de reconocimiento de voz para el quechua de Puno a partir de decenas de horas de grabaciones y transcripciones, con la comunidad implicada en el diseño y la recopilación. Ese modelo de trabajo (comunidades que fijan objetivos y validan resultados) se está convirtiendo en la norma, no en la excepción.

Asia: escrituras, segmentación y escala

Asia demuestra que ser de escasos recursos no significa ser pequeño. El bhoypurí aparece en la clase 1 de Joshi pese a una base de decenas de millones de hablantes; el konkaní y el lao se sitúan en la clase 2; el cebuano y el indonesio en la clase 3. Aquí las carencias suelen ser técnicas antes que estadísticas: las escrituras sin espacios entre palabras (lao, tailandés, jemer) rompen los tokenizadores ingenuos, y las lenguas emparentadas se etiquetan a menudo mal como si fueran la dominante, lo que infla la cobertura aparente de la lengua mayor y borra a la menor. Mi lectura, y es una inferencia y no una medición publicada, es que la próxima ola de IA útil para lenguas asiáticas vendrá de habla y texto bien segmentados y correctamente etiquetados recopilados en el propio país, no de rastreos más grandes. Ese es el principio detrás de nuestros datasets del sudeste asiático para entrenamiento de IA.

08 · Técnicas

¿Cómo se construye IA para una lengua de escasos recursos?

La literatura (Hedderich et al., 2021; Haddow et al., 2022; Ranathunga et al., 2023) converge en 6 familias de técnicas. Ninguna es universal, y cada una conlleva un riesgo concreto.

01

Aprendizaje por transferencia

Ajustar un modelo multilingüe preentrenado (mBERT, XLM-R, mT5, BLOOM u otros LLM abiertos) sobre la lengua objetivo.

Riesgo: débil cuando la lengua objetivo está lejos de las que dominan el preentrenamiento.

02

Traducción automática multilingüe y lenguas emparentadas

Entrenar de forma conjunta con lenguas emparentadas y mejor dotadas para que la más pequeña se beneficie de la estructura compartida.

Riesgo: deriva hacia las normas del vecino más grande.

03

Aumento de datos

Los datos sintéticos y la retrotraducción crean pares de entrenamiento adicionales a partir de texto monolingüe.

Riesgo: los datos sintéticos amplifican los errores del sistema que los produjo.

04

Aprendizaje semisupervisado y supervisión distante

Explotar texto sin etiquetar, reglas y diccionarios para generar etiquetas débiles a gran escala.

Riesgo: las etiquetas ruidosas requieren conjuntos de prueba validados por humanos para detectarse.

05

Conocimiento lingüístico y reglas

Léxicos, gramáticas y analizadores morfológicos cuando los datos no permiten un enfoque puramente estadístico. Apertium, la plataforma de traducción automática de código abierto basada en reglas iniciada en 2005 en la Universitat d'Alacant, sigue siendo una referencia para pares de lenguas emparentadas.

Riesgo: tiempo experto costoso; cobertura limitada de dominios abiertos.

06

Recopilación participativa de datos

Los hablantes contribuyen, validan y gobiernan los datos de texto y voz, como en Mozilla Common Voice, Masakhane o los proyectos de AmericasNLP.

Riesgo: exige tiempo, coordinación, compensación justa y mecanismos reales de consentimiento.

09 · La crítica

¿Es «de escasos recursos» la etiqueta correcta?

La comunidad de PLN sigue usando el término como estándar, pero sus críticos han afinado lo que esconde. Steven Bird sostiene que la etiqueta agrupa situaciones muy distintas (lenguas estandarizadas sin apoyo tecnológico, lenguas locales de tradición mayoritariamente oral, lenguas de contacto) cuyas funciones sociales y expectativas tecnológicas no son comparables, y se pregunta si el PLN debe ser necesariamente extractivo (ACL 2024). Tratar los datos lingüísticos como materia prima que se extrae puede reproducir relaciones coloniales y desplazar a las autoridades comunitarias. Mager, Mager, Kann y Vu (ACL 2023) entrevistaron a líderes comunitarios, docentes y activistas y concluyeron que incluir a los hablantes es esencial para una traducción automática útil y ética de las lenguas indígenas, lo que apunta hacia la soberanía de datos lingüísticos: las comunidades conservan el control sobre cómo se usan los materiales que aportan para entrenar IA.

Estoy de acuerdo con la crítica, y creo que tiene una traducción comercial que la industria ha tardado en aceptar. Unos datos cuya procedencia, consentimiento y licencia no puedan documentarse son un pasivo, y en las lenguas de escasos recursos ese pasivo se concentra, porque las mismas pocas fuentes se reutilizan en todas partes. El origen ético de los datos no es un impuesto sobre la IA de escasos recursos: es la única forma de construir conjuntos de datos que sobrevivan a una auditoría. Por eso insistimos en un modelo con la persona en el centro, en el que los hablantes nativos no son un trámite de validación sino quienes deciden qué significa «correcto» para su variedad.

10 · Criterios de decisión

7 preguntas antes de entrenar o comprar IA para una lengua de escasos recursos

Ya sea que ajustes un modelo soberano, encargues un conjunto de datos o contrates traducción automática para un servicio público, estas preguntas separan la cobertura nominal de la capacidad real.

1. ¿Qué variedad, registro y dominio?

«Catalán» o «quechua» no es una especificación. Nombra la variedad, el público y el dominio, y exige datos de cada uno.

2. ¿Qué significa «soportado»?

Pide el banco de pruebas, el conjunto de evaluación, la métrica y la fecha. Una lengua en una lista es una afirmación; una puntuación en un conjunto de evaluación validado por humanos es evidencia.

3. ¿De dónde vienen los datos?

Exige procedencia, licencia y consentimiento documentados para cada fuente, en especial el habla y el texto aportados por comunidades.

4. ¿Cuánto procede de rastreo web, y quién lo auditó?

Los corpus rastreados para lenguas más pequeñas contienen texto mal etiquetado e inutilizable. Las auditorías de hablantes nativos detectan lo que los filtros automáticos pasan por alto.

5. ¿Existe un conjunto de evaluación reservado construido por humanos?

Sin él no puedes comparar proveedores ni detectar retrocesos entre versiones de un modelo.

6. ¿Los datos sintéticos están etiquetados y separados?

Los datos retrotraducidos y generados deben marcarse para que nunca contaminen los conjuntos de evaluación.

7. ¿Quién valida los resultados en producción?

Define el ciclo de revisión con hablantes nativos, los umbrales de calidad y cómo vuelve la retroalimentación al entrenamiento.

Cuando no existen referencias

La estimación de calidad de traducción automática (MTQE) sin referencia predice la calidad sin necesidad de una traducción de referencia humana, lo que la hace especialmente útil donde escasean las traducciones de referencia.

11 · Nuestro trabajo

Cómo abordamos las lenguas de escasos recursos en Pangeanic

Pangeanic empezó construyendo y procesando datos bilingües para sistemas de traducción automática, mucho antes de que «datos de entrenamiento» se convirtiera en una categoría de mercado. Esa historia nos enseñó que lo difícil de una lengua de escasos recursos nunca es la arquitectura del modelo: es encontrar, licenciar, limpiar, alinear y validar los datos, y demostrar después con evaluación que el resultado funciona para quienes la hablan. Hoy ese trabajo pasa por nuestros servicios de Data for AI (sourcing, recopilación, anotación, RLHF y datos de evaluación), nuestros corpus paralelos y nuestra práctica de evaluación de IA, con validación de hablantes nativos en cada paso. La misma disciplina de datos sostiene nuestra Deep Adaptive AI Translation, que adapta el resultado a la terminología y el estilo del cliente, una necesidad que se agudiza, no se suaviza, en lenguas donde los motores genéricos apenas han visto texto.

Si quieres una mirada más larga sobre dónde sigue fallando la traducción automática, escribí sobre las lenguas que desafían la traducción automática desde nuestra experiencia en producción.

Documentado e inferido

Las cifras de este artículo (tamaños de clase, resultados de auditorías, tamaños de corpus, horas de habla, fechas de proyectos) proceden de las fuentes publicadas que se citan más abajo. La evaluación de ELE sobre el catalán es de 2022 y es anterior a la publicación de ALIA en 2025, por lo que la posición actual del catalán es probablemente más sólida que esa instantánea; todavía no se ha publicado una reevaluación comparable. La brecha entre el apoyo formal y el apoyo efectivo del valenciano, la deriva de los modelos de gallego hacia el portugués y la predicción sobre la recopilación de datos en Asia son valoraciones propias a partir de nuestro trabajo en producción, no resultados medidos. La taxonomía de Joshi refleja los catálogos disponibles en 2020 y debe leerse como una instantánea, no como una clasificación permanente.

Preguntas frecuentes

Preguntas frecuentes sobre las lenguas de escasos recursos

¿Qué es una lengua de escasos recursos?

Una lengua de escasos recursos es una lengua con demasiado poco texto legible por máquina, habla, datos paralelos, datos anotados, herramientas o bancos de pruebas de evaluación para construir tecnología del lenguaje con un rendimiento comparable al del inglés. La etiqueta describe una condición de datos que depende de la tarea, el dominio y el momento, no de la riqueza de la lengua.

¿Es lo mismo una lengua de escasos recursos que una lengua minoritaria o en peligro?

No. Una lengua minoritaria se define por su posición sociopolítica, una lengua en peligro por el debilitamiento de la transmisión intergeneracional y una lengua de escasos recursos por la escasez de datos y herramientas digitales. Las categorías se solapan a menudo, pero una lengua minoritaria puede estar bien dotada, y una lengua con decenas de millones de hablantes puede ser de escasos recursos.

¿Cuántas lenguas son de escasos recursos?

La mayoría. En la taxonomía de Joshi et al. (ACL 2020), 2191 lenguas caían en la clase más baja, prácticamente sin datos etiquetados ni sin etiquetar, mientras que solo 7 lenguas (entre ellas inglés, español, alemán, japonés y francés) formaban la clase superior. En el mundo se hablan más de 7000 lenguas.

¿Es el catalán una lengua de escasos recursos?

Depende de la tarea. El informe de European Language Equality de 2022 calificó el apoyo tecnológico global del catalán como «fragmentario», con grandes diferencias entre texto, habla y traducción automática. Programas públicos como el Projecte AINA y ALIA han añadido desde entonces corpus y modelos abiertos, pero la cobertura de variedades (valenciano, balear) y los datos de evaluación siguen siendo carencias.

¿Son el euskera y el gallego lenguas de escasos recursos?

Ambas han sido históricamente de escasos recursos para la IA y han seguido estrategias distintas. El euskera, una lengua aislada, cuenta ya con Latxa, una familia de modelos abiertos con un banco de pruebas de evaluación propio del HiTZ Center. El gallego se beneficia de la transferencia desde el portugués a través de Proxecto Nós y sus modelos Carballo, aunque los modelos pueden derivar hacia las normas del portugués sin evaluación de hablantes nativos.

¿Por qué rinde peor la traducción automática en lenguas de escasos recursos?

La traducción automática neuronal y los grandes modelos de lenguaje aprenden de datos paralelos y monolingües, y las lenguas de escasos recursos tienen muy poco de eso, a menudo concentrado en dominios estrechos y mezclado con texto mal etiquetado o de baja calidad. Sin conjuntos de prueba construidos por humanos, además, los errores pasan desapercibidos, así que una lengua puede parecer soportada mientras rinde muy por debajo de las lenguas mejor dotadas.

¿Cómo se construye IA para una lengua de escasos recursos?

Las principales técnicas son el aprendizaje por transferencia desde modelos multilingües, el entrenamiento conjunto con lenguas emparentadas, el aumento de datos como la retrotraducción, el aprendizaje semisupervisado, los recursos léxicos y basados en reglas y la recopilación participativa de datos con las comunidades de hablantes. Todas dependen de datos de alta calidad y bien documentados, y de conjuntos de evaluación validados por humanos.

¿Qué datos ofrece Pangeanic para lenguas de escasos recursos?

Pangeanic recopila, anota y valida texto, habla y datos paralelos para entrenamiento y evaluación de IA, incluidos datos de RLHF y de preferencia, con validación de hablantes nativos. Su trabajo incluye conjuntos de datos para el Barcelona Supercomputing Center con énfasis en el catalán, transcripción con IA que cubre catalán, gallego y euskera en el Congreso de los Diputados, y recopilación de datos para lenguas africanas y del sudeste asiático.

Data for AI

¿Construyes IA para una lengua que la web olvidó?

Cuéntanos la lengua, la variedad y el dominio. Te diremos qué datos existen, qué hay que recopilar y cómo demostrar que el modelo funciona.

Referencias

Fuentes

  1. Alabi, J. O., Hedderich, M. A., Adelani, D. I., y Klakow, D. (2025). Charting the Landscape of African NLP: Mapping Progress and Shaping the Road Ahead. Proceedings of EMNLP 2025, 27807-27841. doi:10.18653/v1/2025.emnlp-main.1414
  2. Bird, S. (2024). Must NLP be Extractive? Proceedings of ACL 2024, 14915-14929. doi:10.18653/v1/2024.acl-long.797
  3. Blasi, D., Anastasopoulos, A., y Neubig, G. (2022). Systematic Inequalities in Language Technology Performance across the World's Languages. Proceedings of ACL 2022, 5486-5505. doi:10.18653/v1/2022.acl-long.376
  4. Coleman, J., Coleman, T., y Krishnamachari, B. (2026). RAN: Resource Abundance Notation for Languages in NLP. Proceedings of AmericasNLP 2026, 168-172.
  5. Etxaniz, J., Sainz, O., Perez, N., et al. (2024). Latxa: An Open Language Model and Evaluation Suite for Basque. Proceedings of ACL 2024.
  6. Gaspari, F., et al. (2023). Digital Language Equality: Definition, Metric, Dashboard. En Rehm y Way (eds.), European Language Equality, Springer, 39-73.
  7. Haddow, B., Bawden, R., Miceli Barone, A. V., Helcl, J., y Birch, A. (2022). Survey of Low-Resource Machine Translation. Computational Linguistics 48(3), 673-732. doi:10.1162/coli_a_00446
  8. Hedderich, M. A., Lange, L., Adel, H., Strötgen, J., y Klakow, D. (2021). A Survey on Recent Approaches for Natural Language Processing in Low-Resource Scenarios. Proceedings of NAACL 2021, 2545-2568. doi:10.18653/v1/2021.naacl-main.201
  9. Huaman, E., Gamarra Lafuente, A., Cordova, J., y Korhonen, A. (2026). Building Community-Centred NLP Resources for Puno Quechua. Proceedings of AmericasNLP 2026.
  10. Joshi, P., Santy, S., Budhiraja, A., Bali, K., y Choudhury, M. (2020). The State and Fate of Linguistic Diversity and Inclusion in the NLP World. Proceedings of ACL 2020, 6282-6293. doi:10.18653/v1/2020.acl-main.560
  11. Kreutzer, J., Caswell, I., et al. (2022). Quality at a Glance: An Audit of Web-Crawled Multilingual Datasets. Transactions of the ACL 10, 50-72. doi:10.1162/tacl_a_00447
  12. Mager, M., Gutierrez-Vasques, X., Sierra, G., y Meza-Ruiz, I. (2018). Challenges of Language Technologies for the Indigenous Languages of the Americas. Proceedings of COLING 2018, 55-69.
  13. Mager, M., et al. (2021). Findings of the AmericasNLP 2021 Shared Task on Open Machine Translation for Indigenous Languages of the Americas. Proceedings of AmericasNLP 2021, 202-217.
  14. Mager, M., Mager, E., Kann, K., y Vu, N. T. (2023). Ethical Considerations for Machine Translation of Indigenous Languages: Giving a Voice to the Speakers. Proceedings of ACL 2023, 4871-4897.
  15. Melero, M., C. Figueras, B., Rodríguez, M., y Villegas, M. (2022). Report on the Catalan Language. European Language Equality, Deliverable D1.6.
  16. Moteu Ngoli, T., Christabel, M., y Yopa, N. (2025). Challenges and Limitations in Gathering Resources for Low-Resource Languages: The Case of Medumba. Proceedings of AfricaNLP 2025, 136-142.
  17. Nekoto, W., et al. (2020). Participatory Research for Low-resourced Machine Translation: A Case Study in African Languages. Findings of EMNLP 2020, 2144-2160.
  18. NLLB Team (2024). Scaling neural machine translation to 200 languages. Nature 630, 841-846. doi:10.1038/s41586-024-07335-x
  19. Ranathunga, S., et al. (2023). Neural Machine Translation for Low-resource Languages: A Survey. ACM Computing Surveys 55(11). doi:10.1145/3567592
  20. Rehm, G., y Way, A. (eds.) (2023). European Language Equality: A Strategic Agenda for Digital Language Equality. Springer, Cognitive Technologies. doi:10.1007/978-3-031-28819-7
  21. Tatariya, K., et al. (2024). How Good is Your Wikipedia? Auditing Data Quality for Low-resource and Multilingual NLP. arXiv:2411.05527