Metodología · AI Data Operations

Cómo evaluar servicios de datos de IA multilingüe

6 criterios de evaluación, 5 etapas del pipeline de datos. Actualizado en octubre de 2026.

Los servicios de datos de IA multilingüe preparan los conjuntos de datos que se usan para entrenar, ajustar, evaluar y alinear modelos de IA en varios idiomas y modalidades. El alcance cubre recopilación de voz, anotación de texto, creación de corpus paralelos, enriquecimiento de datos, anonimización, flujos de retroalimentación humana y entrega con trazabilidad. Evaluar estos servicios exige valorar la calidad de anotación por par de lenguas, la gobernanza y la procedencia de los datos, la arquitectura de privacidad, la madurez del pipeline, la capacidad real verificada en cada lengua y la trayectoria operativa.

Un modelo multilingüe no se degrada de golpe, se degrada en silencio. La anotación inconsistente, el desajuste dialectal, los huecos de procedencia y los puntos ciegos de gobernanza se combinan para producir sistemas que puntúan bien en los benchmarks en inglés y luego fallan sin avisar en el resto de las lenguas. Cuando ese modelo se despliega en un sector regulado, el fallo silencioso deja de ser un problema de calidad y pasa a ser un problema operativo y de cumplimiento.

Esta guía recoge los criterios que importan al seleccionar servicios de datos de IA multilingüe para proyectos empresariales: calidad del dato, gobernanza de la anotación, controles de privacidad y encaje del despliegue. Para nosotros en Pangeanic el marco no es teórico: sale de dos décadas entregando datos multilingües en entornos donde un fallo de gobernanza no es una línea de un presupuesto sino una exposición legal, y está escrito desde las preguntas que hacen los compradores y no desde el folleto del proveedor.

Ideas clave

Qué determina que un dato multilingüe funcione en producción

  • La precisión en producción depende de la calidad de la anotación, no del volumen del conjunto de datos ni del número de lenguas del catálogo.
  • La gobernanza y los controles de privacidad se evalúan antes de empezar a preparar datos, no se añaden al final cuando el modelo ya está desplegado.
  • Los flujos con revisión humana en el centro del proceso son lo que separa un servicio de datos listo para producción de una operación genérica de etiquetado.
  • Los filtros heurísticos de calidad que funcionan en inglés se degradan de forma medible en el resto de las lenguas, así que la validación por lengua es un requisito técnico y no una preferencia.
  • Los criterios de evaluación tienen que cubrir procedencia del dato, cualificación de los revisores, estándares de cumplimiento y derechos de salida.

¿Qué son los servicios de datos de IA multilingüe?

Los servicios de datos de IA multilingüe preparan los conjuntos de datos con los que se entrenan, ajustan, evalúan y alinean modelos de IA en varios idiomas y modalidades, y su alcance va bastante más allá de la anotación o la traducción. Un servicio de nivel productivo cubre recopilación de datos de voz, anotación de texto (incluyendo reconocimiento de entidades nombradas, etiquetado de intención y análisis de sentimiento), creación de corpus paralelos, enriquecimiento de metadatos, anonimización y flujos de retroalimentación humana como el aprendizaje por refuerzo con retroalimentación humana (RLHF).

La realidad operativa es que cada lengua introduce su propia distribución de datos, sus convenciones de anotación y sus condiciones regulatorias. Un servicio que trata la anotación en mandarín y en finés como tareas equivalentes que solo cambian de alfabeto produce conjuntos de datos que sobre el papel parecen completos y en despliegue rinden por debajo. Ese hueco, el que separa un catálogo de anotación de un dato multilingüe de nivel productivo, es donde la mayoría de los proyectos de IA empresarial se encuentran su primer problema serio de datos.

¿Por qué la calidad del dato determina la precisión del modelo?

La arquitectura por sí sola no determina cómo rinde un modelo una vez desplegado. En producción, buena parte de la diferencia viene de la calidad, la estructura y la consistencia de los datos de entrenamiento y de evaluación que hay detrás del sistema.

La evidencia sobre este punto es específica del trabajo multilingüe y dice bastante más que el tópico de que la calidad gana al volumen. En Judging Quality Across Languages, un equipo investigador evaluó el filtrado de datos de preentrenamiento en 35 lenguas y encontró que los métodos heurísticos que emplean los conjuntos de datos multilingües de uso más extendido rinden sustancialmente por debajo de la evaluación de calidad basada en modelos, y que la brecha se ensancha precisamente en las lenguas y los sistemas de escritura que estaban infrarrepresentados cuando se construyó el filtro. Dicho sin rodeos: los controles de calidad que funcionan de forma aceptable en inglés se degradan de forma medible cuando se aplican al resto de la cobertura lingüística.

Desde España ese hallazgo se lee con una consecuencia añadida. Un modelo que atienda a ciudadanos o a clientes en catalán, euskera, gallego o valenciano está operando justo en la franja donde el filtro tenía menos datos de los que aprender. Y la consecuencia para una compra es concreta: la pregunta que hay que hacerle a un proveedor no es cuántas lenguas cubre, sino cómo mide y mantiene la precisión de anotación, la consistencia terminológica y la pertinencia de dominio par por par. Un proveedor que aplica un único pipeline de calidad a 200 lenguas está aplicando un pipeline calibrado para unas cuantas de ellas.

Evidencia

Los hallazgos publicados que sostienen estos criterios

Hallazgo Dato Fuente Año
Los filtros heurísticos de calidad de los conjuntos de datos multilingües más usados rinden por debajo de la evaluación basada en modelos, y la brecha se ensancha en lenguas y escrituras infrarrepresentadas Evaluado en 35 lenguas Judging Quality Across Languages (arXiv) 2025
La calidad y la arquitectura del dato figuran entre los bloqueadores constantes que impiden escalar la IA más allá del piloto, y el grupo reducido de organizaciones con mejor rendimiento invierte bastante más en preparación del dato Encuesta organizativa, no benchmarks de modelo McKinsey, The State of AI 2025
Bandas de concordancia entre anotadores que siguen siendo la referencia para el control de calidad de la anotación, donde el rango de 0,61 a 0,80 se clasifica como concordancia sustancial Kappa de 0,61 a 0,80 Landis y Koch, Biometrics 33(1), 159 a 174 1977
Los sistemas de IA de alto riesgo acarrean obligaciones sobre gobernanza de los datos de entrenamiento, documentación técnica, conservación de registros y supervisión humana Reglamento (UE) 2024/1689 Reglamento de IA, EUR-Lex 2024

¿Qué cambia cuando el modelo tiene que funcionar en lenguas cooficiales?

Una administración española que despliegue un asistente ciudadano no opera en una lengua, opera en varias, y con obligaciones distintas en cada territorio. Eso convierte un problema que en otros mercados es comercial en un problema de servicio público: si el sistema responde peor en valenciano que en castellano, la diferencia no es una métrica de producto, es una desigualdad en el acceso.

El trabajo técnico que exige esa paridad es el que menos se contrata y el que más decide el resultado. No basta con traducir los datos de entrenamiento, porque lo que hay que replicar en cada lengua es el criterio: qué terminología es la correcta en ese registro administrativo, qué formulación resulta natural para un hablante de esa variedad, qué respuesta es pertinente en ese contexto institucional. Ese criterio no se importa del castellano ni del inglés, se construye con revisores cualificados nativos en cada lengua.

Pangeanic ha hecho ese trabajo en los modelos de lengua más avanzados que se han entrenado en España. Nuestra colaboración con el Barcelona Supercomputing Center en los modelos Salamandra y ALIA cubrió anotación de datos, RLHF y soporte de entrenamiento bajo protocolos de revisión humana estructurada en castellano y en catalán. Y el proyecto NTEU, que coordinamos, produjo 552 motores de traducción neuronal cubriendo las 24 lenguas oficiales de la Unión Europea, donde el trabajo duro nunca fue el modelado sino que cada dirección necesitaba su propio criterio de qué era una buena salida.

Cómo cambian los criterios en sectores regulados

Los proyectos de IA en sanidad, servicios financieros, administración pública y defensa operan bajo marcos de cumplimiento concretos (RGPD, ISO/IEC 27001, ISO 13485) que restringen cómo se recopilan, almacenan, procesan y comparten los datos. Un servicio de datos multilingüe que opere en esos entornos tiene que demostrar tratamiento controlado en cada etapa del pipeline, lo que significa registros de procedencia auditables, flujos de recopilación con gestión del consentimiento, capacidad de anonimización o pseudonimización y la opción de desplegar on-premise o en entornos aislados. Las plataformas genéricas de anotación en nube con frecuencia no pueden cumplir esos requisitos, y cuando se opera en sanidad o en defensa conservar la titularidad de los conjuntos de datos y controlar el entorno de despliegue es una obligación regulatoria, no una preferencia.

El Reglamento europeo de IA refuerza esa dirección. Las organizaciones que desplieguen sistemas de alto riesgo tienen que demostrar gobernanza del dato, trazabilidad y supervisión humana como capacidades operativas documentadas, con obligaciones específicas sobre calidad de los datos de entrenamiento y conservación de registros. La selección del proveedor debería reflejar esos requisitos desde el principio, porque reconstruir registros de procedencia sobre un conjunto de datos que se montó sin ellos suele ser imposible.

Cómo evaluar la calidad de anotación entre lenguas

Por qué la revisión nativa pesa más que el número de anotadores

Los atajos de anotación basados en traducción producen conjuntos de datos poco fiables. La expresión idiomática, el sentimiento, los sistemas de tratamiento y el contexto cultural no sobreviven limpios a una traducción automática, y las etiquetas importadas del inglés degradan el rendimiento del modelo en la lengua de destino. Conviene verificar que el servicio asigna revisores nativos o de nivel equivalente para cada lengua de destino, con cualificación y experiencia de dominio documentadas, porque un proveedor con 500 anotadores repartidos en 30 lenguas puede tener menos de 5 revisores cualificados para un par concreto.

Cómo medir la concordancia entre anotadores

La concordancia entre anotadores es uno de los indicadores más fiables de consistencia de un conjunto de datos. Conviene pedir al proveedor que la reporte por par de lenguas y por tipo de tarea (entidades nombradas, sentimiento, clasificación). Las bandas de referencia que siguen usándose vienen de Landis y Koch, que clasificaron el kappa entre 0,61 y 0,80 como concordancia sustancial y por encima de 0,81 como casi perfecta, y es la razón por la que la mayoría de los programas de anotación tratan el entorno de 0,60 como suelo y no como objetivo.

Hay dos cautelas que importan más que el umbral. Una cifra única de concordancia para todo el proyecto dice muy poco, porque promedia justamente la varianza por lengua que se está intentando detectar. Y una concordancia alta en una tarea fácil no es prueba de calidad: puede indicar que las directrices de anotación están infraespecificadas y que todos los revisores están recurriendo a la misma etiqueta segura. La capa de AI Data Operations de Pangeanic incluye flujos gestionados de calidad con protocolos de concordancia documentados, adjudicación por expertos y análisis de errores integrados en la entrega.

¿Qué papel juega la experiencia de dominio en la anotación?

Un anotador generalista puede etiquetar categorías amplias. Pero cuando hace falta reconocimiento de entidades en compuestos farmacéuticos, terminología jurídica en resoluciones judiciales o jerga especializada en variedades dialectales del árabe, la experiencia de dominio es la variable operativa que determina si el conjunto de datos sirve para algo. Conviene evaluar si el proveedor asigna revisores con conocimiento de materia documentado o si rota generalistas entre dominios, porque la diferencia aparece después en el rendimiento del modelo, sobre todo en tareas especializadas como el análisis documental jurídico o el PLN clínico.

¿Qué controles de privacidad y gobernanza hay que verificar?

Cómo protege el enmascaramiento los datos sensibles de entrenamiento

Los conjuntos de datos de entrenamiento para IA en entornos regulados contienen con frecuencia información personal, historias clínicas, datos financieros o contenido clasificado, así que un servicio de datos tiene que ser capaz de enmascarar o pseudonimizar campos sensibles preservando la estructura lingüística y la utilidad semántica que el modelo necesita. MASKER, la herramienta de anonimización de Pangeanic, aplica pseudonimización y anonimización de nivel empresarial a conjuntos de datos multilingües, sustituyendo datos personales y sensibles sin romper la coherencia contextual. La tecnología nace del proyecto MAPA, un conjunto de herramientas de anonimización desarrollado con financiación de la Comisión Europea, y los flujos resultantes los emplean el Ministerio de Justicia de España y la DG Translation de la Comisión Europea para anonimización multilingüe de documentos sensibles.

Qué opciones de despliegue importan para la soberanía del dato

La IA soberana es control operativo sobre los datos, los modelos, la evaluación, los límites de política y las condiciones de despliegue. Si sus datos tienen que permanecer en una jurisdicción concreta, o no pueden atravesar infraestructura en nube controlada por un proveedor extranjero, el modelo de despliegue pasa a ser un criterio crítico. Conviene preguntar si el proveedor admite despliegue on-premise, en nube privada o en entornos aislados, verificar quién conserva la titularidad de los conjuntos de datos procesados y confirmar qué pasa con sus datos cuando termina el proyecto. No son casos límite: son requisitos habituales en proyectos de administración pública y de defensa, tanto en la Unión Europea como en Estados Unidos.

Vale la pena bajarlo a la práctica. Su proyecto de PLN clínico maneja 40 000 historias en una comunidad con dos lenguas oficiales. Antes de que un solo anotador abra una de ellas, el contenido tiene que estar desidentificado en las dos lenguas, la desidentificación tiene que validarla alguien que lea esa lengua y toda la operación tiene que ocurrir en un entorno donde las historias no lleguen nunca a un servidor que usted no controle. Si falla una sola de esas 3 condiciones, lo que tiene no es un conjunto de datos de entrenamiento sino una brecha notificable. La arquitectura contenedorizada de confianza cero de Pangeanic se validó mediante un despliegue dentro del entorno certificado Iron Bank del Departamento de Defensa de EE. UU., donde esas condiciones son el punto de partida y no la excepción.

Secuencia de evaluación

Cómo evaluar el pipeline de datos completo

Las 5 etapas van en orden, porque cada una condiciona la siguiente. Saltarse la primera produce el fallo más común: mucho dato que no se corresponde con la tarea operativa.

Etapa 01

Definir la tarea del modelo y los requisitos de datos

Documente qué tiene que hacer su modelo, en qué lenguas, con qué umbral de precisión y bajo qué restricciones de cumplimiento. Incluya criterios de éxito que se correspondan con su entorno de despliegue: precisión en primera respuesta por lengua para un modelo de atención multilingüe, tasa de error en clasificación de entidades por jurisdicción para un sistema de reconocimiento de entidades jurídicas.

Etapa 02

Auditar el origen y la licencia de los datos

Verifique de dónde obtiene el proveedor los datos en bruto y si están licenciados, extraídos de la web o recopilados en proyectos a medida. El material de terceros suministrado bajo licencia no exclusiva sigue siendo material licenciado, y ningún proveedor debería describirlo como titularidad transferible. La distinción se vuelve determinante en el momento en que un regulador, un comprador en una operación corporativa o su propio departamento jurídico pregunta qué derechos tiene usted realmente.

Etapa 03

Evaluar preparación, limpieza y enriquecimiento

El dato en bruto necesita normalización, deduplicación, segmentación y enriquecimiento de metadatos antes de ser entrenable. Revise si el proveedor aplica validación automática (comprobaciones por reglas de desajuste de lengua, errores de codificación, duplicados) junto con revisión humana, porque un modelo que aprende de datos mal etiquetados arrastra esos errores a producción, donde corregirlos cuesta bastante más.

Etapa 04

Verificar los flujos de retroalimentación humana y alineación

En modelos que requieren RLHF, ajuste fino supervisado o alineación de seguridad, la calidad de la retroalimentación pesa tanto como el corpus de entrenamiento. Los pares de preferencia son una señal entre varias: los datos de rúbricas y recompensas hacen explícitos y auditables los criterios, los datos de razonamiento experto enseñan razonamiento de varios pasos y el red teaming nativo saca a la luz riesgos que solo aparecen cuando el ataque se redacta en la lengua de destino y no se traduce.

Etapa 05

Confirmar la capacidad de evaluación y benchmarking

Un servicio listo para producción soporta conjuntos de referencia, conjuntos gold, baterías de regresión y evaluación de calidad multilingüe. El MTQE de Pangeanic puntúa salidas sin necesidad de traducción de referencia humana, lo que lo hace utilizable en flujos en vivo, y esa misma capa filtra pares de segmentos bilingües e identifica los pares de lenguas débiles antes de que esos datos entren en la adaptación del modelo. Para el contexto técnico independiente, véase la tarea compartida de estimación de calidad de WMT.

Relacionado

Aplicar el marco a proveedores concretos

Esta página define los criterios. Aplicarlos a un mercado concreto es otro ejercicio, y nuestra comparativa de plataformas de RLHF para empresa recorre varios proveedores contra 6 de estos criterios.

¿Qué hay que preguntar sobre gobernanza y derechos de salida?

Las preguntas de gobernanza suelen aparecer demasiado tarde, normalmente cuando se quiere cambiar de proveedor o auditar los datos de entrenamiento por motivos regulatorios. Conviene aclarar estos 5 puntos antes de firmar:

  • ¿Quién es titular del conjunto de datos procesado: usted, el proveedor o un régimen mixto?
  • ¿Puede exportar los datos en formatos estándar y documentados?
  • ¿Qué derechos se transfieren y qué queda bajo licencia?
  • ¿Cómo se mantiene el histórico de versiones y el registro de cambios?
  • ¿Qué rastro auditable existe sobre la cualificación de los revisores y las decisiones de calidad?

Un proveedor que no pueda responder a eso con claridad no está operando a nivel de gobernanza empresarial. Pangeanic documenta la posición aplicable (titularidad, licencia perpetua, licencia limitada o acceso contractual) componente a componente antes de contratar, para que usted sepa exactamente qué conserva.

Por qué la revisión humana en el centro distingue un dato productivo de un etiquetado

La anotación es un flujo dentro de un sistema más amplio. AI Data Operations cubre además descubrimiento de datos, gestión de derechos, recopilación, preparación, retroalimentación humana, conjuntos de evaluación, controles de privacidad, seguimiento de procedencia, versionado y bucles de retroalimentación desde producción. Al evaluar un proveedor conviene determinar si ofrece un modelo operativo controlado y repetible o un proyecto de anotación de una sola vez, porque los sistemas de IA en producción generan problemas de datos nuevos después del despliegue: deriva del modelo, patrones de error nuevos, lenguas adicionales, cambios de política. Un socio preparado para producción mantiene un bucle que devuelve la evidencia del despliegue a la preparación de datos y a la alineación.

¿Cómo se evalúa la cobertura multilingüe sin caer en métricas de vanidad?

Un proveedor que anuncia más de 500 lenguas le está hablando de amplitud de catálogo, no de capacidad productiva. La pregunta operativa es cuántas de esas lenguas tienen anotadores nativos, protocolos de calidad documentados, revisores de dominio y pipelines preparados para cumplimiento a la escala que su proyecto necesita. Pida desgloses de capacidad y competencia por par de lenguas, solicite informes de calidad de muestra y verifique si el proveedor ha entregado conjuntos de datos productivos en las lenguas y los dominios que usted necesita y no en los contiguos. Un proveedor con mucha capacidad en español de América y una plantilla fina en catalán le presentará las dos cosas como cobertura de español salvo que pregunte con esa granularidad.

En lenguas con pocos recursos, la recopilación a medida puede ser el único camino hacia un dato de entrenamiento utilizable. Pangeanic diseña proyectos de recopilación específicos para lenguas y dominios donde los conjuntos de datos de catálogo no alcanzan los umbrales exigidos de calidad, consentimiento o anotación, y el catálogo de datos listos para licenciar supera los 600 conjuntos entre texto, voz, imagen y corpus multimodales, con especial profundidad en lenguas europeas, cooficiales y con pocos recursos.

¿Qué papel juegan los estándares y las certificaciones?

Las certificaciones funcionan como verificación independiente de disciplina operativa. No garantizan por sí solas la calidad del dato, pero sí confirman que existen controles auditados de gobernanza, gestión de calidad y seguridad. Al evaluar servicios de datos de IA multilingüe conviene buscar:

  • ISO 9001: sistemas de gestión de la calidad
  • ISO 17100 o ISO 18587: calidad en servicios de traducción y posedición de traducción automática, relevantes para corpus paralelos y datos de localización
  • ISO/IEC 27001: gestión de la seguridad de la información
  • ISO 13485: gestión de la calidad en productos sanitarios, relevante para conjuntos de datos clínicos
  • ISO/IEC 42001: sistemas de gestión de IA, el más reciente de los estándares pertinentes y cada vez más solicitado en compras empresariales

Pangeanic cuenta con las certificaciones ISO 9001, ISO/IEC 27001 e ISO 18587, además del Sello de PYME Innovadora del Ministerio de Ciencia, Innovación y Universidades, y ha sido reconocida por Gartner en varios informes: el Hype Cycle for Language Technologies en 2023 y de nuevo en 2024 como Sample Vendor, el Market Guide for Data Masking and Synthetic Data en 2024 como Representative Vendor y el informe Emerging Tech sobre innovación en IA conversacional, también como Representative Vendor. Son indicadores verificables de entrega gobernada a escala empresarial, no afirmaciones de apertura.

Marco de decisión

Una tabla de evaluación para servicios de datos de IA multilingüe

Una tabla estructurada mantiene la evaluación objetiva y comparable entre proveedores. Las 6 categorías llevan pesos de ejemplo; ajústelos a su entorno regulatorio, su combinación de lenguas y sus restricciones de despliegue.

Categoría de evaluación Preguntas clave Qué indica una buena respuesta Peso (ejemplo)
Calidad de anotación Concordancia entre anotadores, cobertura nativa, experiencia de dominio Concordancia reportada por par de lenguas y tipo de tarea, no como media del proyecto 25 %
Gobernanza del dato Procedencia, licencias, rastro auditable, derechos de salida Posición de derechos documentada componente a componente antes de contratar 20 %
Privacidad y seguridad Enmascaramiento, modelo de despliegue, certificaciones Anonimización dentro del pipeline, no como paso previo separado 20 %
Madurez del pipeline Origen, limpieza, RLHF, evaluación, bucles de retroalimentación Un modelo operativo repetible, no un proyecto de anotación puntual 15 %
Cobertura lingüística Capacidad verificada por par, trabajo en lenguas con pocos recursos Desgloses de capacidad por par, con ejemplos de entregas en producción 10 %
Trayectoria operativa Despliegues nombrados, reconocimiento de analistas, certificaciones Instituciones nombradas que usted pueda verificar por su cuenta 10 %

Un proyecto de defensa pondrá privacidad y seguridad por encima del 20 %. Un producto de consumo que se lanza en 3 mercados probablemente suba cobertura lingüística y baje gobernanza. Los pesos son la parte que usted decide; las categorías son la parte que se mantiene.

Seleccionar servicios de datos que funcionen en producción

Los proveedores y los pares de lenguas seguirán cambiando. Lo que se mantiene es la disciplina de evaluación: calidad de anotación medida por lengua, controles de gobernanza verificados antes de contratar, arquitectura de privacidad confirmada contra su marco regulatorio y un modelo operativo que se adapte a medida que el modelo evoluciona.

Una prueba práctica para terminar. Después de su próxima entrega de datos, ¿puede trazar qué decisiones de anotación tomó qué revisor cualificado, bajo qué versión de las directrices y medidas contra qué conjunto de evaluación? Si la respuesta es no, ha recibido etiquetas y no un conjunto de datos gobernado, y la diferencia aparecerá en producción y no en el informe de entrega.

Preguntas frecuentes

Preguntas que hacen los compradores al evaluar servicios de datos de IA multilingüe

¿En qué se diferencian los servicios de datos de IA multilingüe de la anotación estándar?

Los servicios de datos de IA multilingüe cubren el pipeline completo: origen, licencias, anotación, retroalimentación humana, evaluación, anonimización y gobernanza entre lenguas. La anotación estándar se ocupa solo del etiquetado. AI Data Operations de Pangeanic conecta esas etapas en un único flujo gobernado diseñado para sistemas de IA en producción.

¿Cómo se verifica la calidad de anotación en una lengua con pocos recursos?

Pida la concordancia entre anotadores por par de lenguas, la cualificación de los revisores y muestras de salida en la lengua de destino. La calidad productiva exige validación por hablantes nativos, no traducción desde el inglés. Esto pesa especialmente en lenguas con pocos recursos, donde los corpus de catálogo arrastran una proporción alta de ruido y donde la investigación muestra que los filtros heurísticos de calidad rinden peor.

¿Se puede preparar dato de entrenamiento multilingüe on-premise?

Sí, si el proveedor admite despliegue soberano. Pangeanic ofrece entrega on-premise, en nube privada y en entornos aislados para organizaciones donde los pipelines en nube pública no están permitidos, algo crítico en proyectos de defensa, sanidad y administración pública con requisitos estrictos de residencia del dato.

¿Qué cambia si el modelo tiene que funcionar en catalán, euskera o gallego?

Cambia que no basta con traducir los datos de entrenamiento: hay que replicar el criterio de qué es una buena salida en cada lengua, con terminología administrativa y registro propios, y eso exige revisores cualificados nativos. Las lenguas cooficiales caen además en la franja donde los filtros de calidad calibrados en inglés rinden peor, así que la validación por lengua pasa de recomendable a necesaria. Pangeanic ha hecho ese trabajo en los modelos Salamandra y ALIA del Barcelona Supercomputing Center, con protocolos de revisión humana estructurada en castellano y en catalán.

¿Qué estándares de gobernanza debería tener un proveedor de datos?

Como mínimo ISO 9001, ISO/IEC 27001 y, para datos lingüísticos, ISO 18587 para posedición de traducción automática. La ISO/IEC 42001 de sistemas de gestión de IA se pide cada vez más. Estas certificaciones confirman que existen controles auditados de gestión de calidad y de seguridad de la información. Pangeanic cuenta con ISO 9001, ISO/IEC 27001 e ISO 18587, y ha recibido reconocimiento de Gartner en varios informes.

¿Cómo gestiona Pangeanic la privacidad en conjuntos de datos multilingües?

Pangeanic aplica MASKER, su herramienta de anonimización y pseudonimización, para eliminar o sustituir datos sensibles preservando la estructura lingüística que los modelos necesitan para entrenar. La tecnología procede del proyecto MAPA, desarrollado con financiación de la Comisión Europea, y los flujos los emplean el Ministerio de Justicia de España y la DG Translation de la Comisión Europea.

¿Qué hay que incluir en un pliego para servicios de datos de IA multilingüe?

Especifique lenguas y dominios objetivo con requisitos de capacidad por par, umbrales de precisión expresados como criterios medibles (objetivos de concordancia entre anotadores, tasas de error por tarea), requisitos de cumplimiento y marcos aplicables, modelo de despliegue, condiciones de titularidad y licencia componente a componente, benchmarks de evaluación y requisitos de conjuntos gold, así como las condiciones de salida que cubran formatos de exportación y destino final de los datos. Un pliego bien delimitado evita el fallo de compra más común: recibir mucho dato que no se corresponde con la tarea de producción.

¿Cómo afecta el Reglamento europeo de IA a los requisitos del dato de entrenamiento?

Para sistemas de alto riesgo, el Reglamento impone obligaciones sobre gobernanza de los datos de entrenamiento, documentación técnica, conservación de registros y supervisión humana. En la práctica necesita procedencia documentada de sus datos de entrenamiento, evidencia de las medidas de calidad aplicadas y un rastro auditable que conecte las decisiones sobre el dato con el comportamiento del modelo. Esos registros no se pueden reconstruir después, lo que convierte la selección de proveedor en una decisión de cumplimiento y no solo de compras.

Siguiente paso

Datos multilingües que pueda auditar y controlar

Si su proyecto de IA opera en un sector regulado, podemos recorrer estos criterios contra su combinación real de lenguas, dominios y restricciones de despliegue antes de mover un solo dato.