Alineación de modelos y feedback humano

Datos de rúbricas y recompensas para el postentrenamiento y la evaluación de LLM

Los datos de rúbricas y recompensas son el material producido por expertos humanos que indica a un modelo, criterio por criterio, qué debe contener una buena respuesta, qué debe evitar y cuánto debe pesar cada elemento en la señal de recompensa. Pangeanic diseña rúbricas específicas para cada instancia, datos de preferencia, conjuntos de tareas verificables y datos de calibración para jueces LLM en los idiomas y variantes en los que el modelo será realmente utilizado.

Rúbricas específicas por instancia Criterios definidos para cada prompt y tarea
Criterios ponderados y penalizaciones Qué debe premiarse, qué debe penalizarse y con qué peso
Calibración de jueces LLM Puntuaciones de expertos humanos para validar evaluadores automáticos
Diseño en idioma y variante objetivo Rúbricas creadas o adaptadas sustancialmente por especialistas locales
Entrega controlada Flujos de trabajo para modelos no publicados, prompts confidenciales y políticas propietarias

El problema de la recompensa

Su modelo aprenderá exactamente lo que premie su señal de recompensa

El aprendizaje por refuerzo es implacable con los incentivos. Todo comportamiento que premie la señal de recompensa acabará siendo explorado por la política y, si existe un atajo rentable, el modelo intentará encontrarlo. En tareas como matemáticas o código, una verificación determinista puede ofrecer una señal relativamente limpia: una respuesta coincide con la referencia, una restricción se cumple o una prueba se supera.

Los trabajos de Tülu 3 formalizaron este enfoque como Reinforcement Learning with Verifiable Rewards (RLVR), sustituyendo un modelo de recompensa aprendido por funciones de verificación cuando la tarea lo permite. DeepSeek R1 tomó una decisión relacionada para tareas de razonamiento: sus autores evitaron expresamente determinados modelos neuronales de recompensa después de observar su vulnerabilidad al reward hacking durante aprendizaje por refuerzo a gran escala.

La mayoría de las tareas empresariales no disponen de una respuesta correcta tan fácil de comprobar. Una explicación clínica, un análisis jurídico, una respuesta comercial en español de México o una negativa condicionada por políticas internas pueden ser adecuadas o deficientes en varias dimensiones independientes. Exactitud, exhaustividad, relevancia, seguridad, terminología, registro y concisión pueden determinar conjuntamente si la respuesta es útil.

Los datos de preferencia por pares ofrecen una solución, pero una simple etiqueta de respuesta preferida frente a respuesta rechazada puede ocultar por qué una opción era mejor. Las rúbricas hacen explícita una parte mayor de ese juicio al descomponer la calidad en criterios que pueden inspeccionarse y puntuarse por separado.

Una rúbrica hace que la señal de recompensa sea más interpretable y auditable, pero desplaza una parte esencial del problema hacia la calidad de la especificación, el juicio de los expertos y la calibración del juez.

Por supuesto, una rúbrica sigue siendo un proxy del comportamiento deseado. Un criterio mal diseñado puede ser explotado con la misma eficacia que un mal modelo de recompensa. Ese es precisamente el problema de datos que Pangeanic aborda.

Evidencia publicada

Por qué el postentrenamiento de LLM avanza hacia criterios expertos explícitos

La investigación pública ya muestra cómo las rúbricas diseñadas por expertos, las recompensas verificables y los datos de preferencia multilingües están cambiando el entrenamiento y la evaluación de modelos.

OPENAI · HEALTHBENCH · 2025

48 562 criterios escritos por expertos

HealthBench evalúa 5 000 conversaciones sobre salud mediante 48 562 criterios únicos. El benchmark fue creado con 262 médicos que han ejercido en 60 países y dominan colectivamente 49 idiomas.

SCALE AI · RUBRICS AS REWARDS · ICLR 2026

Hasta un 31 % de mejora relativa en HealthBench

Utilizando rúbricas estructuradas como señales de recompensa on policy, la variante más eficaz de Rubrics as Rewards obtuvo mejoras relativas de hasta el 31 % en HealthBench y del 7 % en GPQA Diamond frente a baselines de LLM as a judge basadas en puntuaciones Likert directas.

COHERE · MULTILINGUAL PREFERENCE · 2024

Los datos multilingües mejoran la transferencia entre idiomas

La optimización de preferencias entrenada únicamente con datos en inglés obtuvo una tasa de preferencia del 46,3 % en idiomas no vistos durante el entrenamiento. Incorporar 5 idiomas de entrenamiento elevó el resultado al 54,9 %, aportando evidencia directa de que los datos de alineación multilingües pueden mejorar el comportamiento más allá del inglés.

Marco de decisión

¿Qué señal de recompensa necesita su modelo?

La mayoría de los programas de postentrenamiento combinan varios tipos de señal. La elección depende de si la corrección puede verificarse mecánicamente, de cuántas dimensiones intervienen en la calidad y del nivel de interpretación experta que exige la tarea.

Señal de recompensa Indicada para Datos necesarios Riesgo principal Qué entrega Pangeanic
Recompensa verificable (RLVR) Matemáticas, código, extracción, salidas estructuradas y cumplimiento de restricciones formales Prompts con respuestas de referencia verificables y especificaciones del verificador El verificador puede cubrir únicamente una definición demasiado estrecha del éxito Tareas creadas por expertos, respuestas de referencia, tolerancias y reglas de verificación
Datos de preferencia (RLHF, DPO) Tono, utilidad, estilo y calidad global cuando comparar resulta más fiable que asignar una puntuación absoluta Prompts, varias respuestas, rankings o etiquetas preferida/rechazada, idealmente acompañados de justificaciones La longitud, el formato o los sesgos de los anotadores pueden convertirse en proxies involuntarios de calidad Rankings justificados, adjudicación y controles para sesgos conocidos en los datos de preferencia
Recompensa basada en rúbricas Tareas abiertas que requieren conocimiento experto en medicina, derecho, finanzas, tecnología o sector público Criterios específicos por instancia, ponderaciones, penalizaciones y respuestas o instrucciones de referencia Criterios insuficientemente especificados, requisitos solapados y errores del juez Rúbricas diseñadas por expertos con criterios positivos, negativos y penalizaciones, junto con calibración del juez
Supervisión del proceso Razonamientos largos donde la respuesta final no revela en qué paso se deterioró la lógica Juicios paso a paso sobre el razonamiento del modelo o sus salidas intermedias Coste elevado de anotación y segmentación inconsistente de los pasos de razonamiento Anotación experta paso a paso conectada con nuestro flujo de datos de razonamiento experto

Lo que entregamos

Datos de rúbricas y recompensas para entrenamiento y evaluación

Cada entregable puede suministrarse de forma independiente o integrarse en un programa completo de datos de postentrenamiento gestionado mediante PECAT, nuestra plataforma con gobernanza humana para anotación, validación, revisión y operaciones de datos.

01

Rúbricas específicas por instancia

Criterios definidos para cada prompt por expertos del dominio, con requisitos esenciales, contenido deseable, comportamientos prohibidos, penalizaciones, ponderaciones e instrucciones de referencia.

02

Conjuntos de calibración para jueces LLM

Respuestas del modelo puntuadas criterio por criterio por expertos humanos cualificados para medir los puntos de acuerdo y divergencia entre un juez LLM y el juicio experto.

03

Datos de preferencia con justificaciones

Rankings por pares o listas acompañados de razones explícitas, gestión de empates y adjudicación para conservar no solo la decisión final, sino también por qué una respuesta fue preferida.

04

Conjuntos de tareas verificables

Problemas con respuestas de referencia inequívocas, tolerancias y especificaciones del verificador para RLVR, conectados con nuestro flujo de Datos de Razonamiento Experto.

05

Auditorías de reward hacking y jueces LLM

Respuestas adversariales diseñadas para revelar criterios que pueden satisfacerse literalmente mientras generan resultados incorrectos, irrelevantes, inseguros o artificialmente verbosos para maximizar la puntuación. Los fallos confirmados se convierten en criterios revisados y casos de regresión reutilizables.

06

Rúbricas de paridad multilingüe

Rúbricas creadas o adaptadas sustancialmente por especialistas en cada lengua y variante objetivo, con calibración del juez por idioma y controles para comprobar que un comportamiento equivalente recibe una recompensa equivalente entre mercados.

Diseño de rúbricas

5 verificaciones que aplicamos a los criterios de una rúbrica

En cuanto una rúbrica entra en un bucle de entrenamiento pasa a formar parte del mecanismo de recompensa. Sus criterios deben resistir tanto la interpretación humana como la presión de optimización del modelo.

1. Atómico. Un criterio debe representar un único juicio. Un requisito como «indica la dosis y explica el riesgo de interacción» contiene en realidad dos criterios. Separarlos permite detectar una satisfacción parcial.

2. Autónomo. La información necesaria para evaluar el criterio debe estar disponible en la tarea, la respuesta y el material de referencia autorizado, sin obligar al evaluador a adivinar la intención del diseñador.

3. Ponderado. Cuando el diseño del entrenamiento o la evaluación lo exige, la importancia de cada criterio se expresa explícitamente, incluidas las penalizaciones por errores críticos o comportamientos prohibidos.

4. Anclado al idioma y a la variante. Los criterios se crean o adaptan con especialistas en la lengua, la variante y el mercado objetivo. Las expectativas pueden diferir entre español de España, México, Colombia, Argentina u otras variedades latinoamericanas y también entre lenguas que conviven dentro de un mismo entorno institucional, como castellano y catalán.

5. Validado mediante acuerdo entre evaluadores. Medimos el acuerdo entre revisores humanos y, cuando corresponde, entre expertos humanos y juez LLM. Los criterios que generan un nivel de desacuerdo inaceptable se aclaran, reescriben o eliminan antes de la entrega.

Estas verificaciones complementan los principios CURVD utilizados en nuestros flujos de razonamiento verificable. CURVD facilita la verificación de las respuestas; estas 5 comprobaciones hacen que el juicio sea más transparente y reproducible.

La brecha multilingüe en las señales de recompensa

Una rúbrica traducida puede premiar una respuesta impecable en la forma y equivocada en el fondo

La mayoría de los recursos públicos de preferencias y rúbricas siguen estando muy centrados en el inglés. Cuando se necesita otro idioma, la traducción automática puede producir datos aparentemente multilingües mientras mantiene el juicio subyacente anclado en instituciones, terminología, convenciones profesionales y expectativas propias del contexto anglófono.

Un concepto jurídico puede tener un alcance diferente. Una advertencia clínica puede estar técnicamente presente y resultar, sin embargo, inadecuada para el mercado. Un trámite administrativo puede existir únicamente dentro de una jurisdicción concreta. Una respuesta comercial puede satisfacer todos los criterios traducidos y seguir sonando extraña para las personas que deberían confiar en ella.

El sistema de recompensa puede acabar premiando con enorme eficacia una respuesta correcta en un contexto institucional y equivocada en otro.

Imagine que su equipo prepara un asistente en español para una administración pública. La rúbrica fue diseñada en inglés, el juez LLM la valida y la curva de recompensa progresa de forma tranquilizadora. Entonces el primer ciudadano pregunta por un procedimiento regulado por normativa regional. El modelo aplica perfectamente la lógica institucional equivocada porque eso es exactamente lo que la especificación de recompensa le enseñó a hacer.

La investigación sobre optimización multilingüe de preferencias ya muestra que el comportamiento de alineación cambia cuando cambia la composición lingüística de los datos de entrenamiento. Por eso Pangeanic considera la traducción una posible entrada para desarrollar una rúbrica, nunca una prueba de que la especificación de recompensa sea válida en el idioma objetivo.

Nuestros flujos multilingües combinan conocimiento de la lengua y la variante, experiencia del dominio, terminología local y calibración de jueces para que las diferencias lingüísticas formen parte del diseño de la recompensa desde el principio, no como una corrección añadida al final.

Formato de entrega

Archivos listos para integrarse directamente en su pipeline de entrenamiento

Los datos de rúbricas y recompensas pueden entregarse en JSONL, JSON, CSV o según el esquema definido por el cliente. Cada registro puede incluir prompts, respuestas o documentos de referencia, criterios, ponderaciones, penalizaciones, decisiones de revisores, justificaciones, metadatos lingüísticos y estado de adjudicación.

EJEMPLO DE REGISTRO · JSONL

{
  "id": "rr-es-0142",
  "language": "es-ES",
  "domain": "public-services",
  "prompt": "...",
  "reference_answer": "...",
  "criteria": [
    {
      "id": "c1",
      "text": "Identifica la administración autonómica competente",
      "weight": 5,
      "type": "essential"
    },
    {
      "id": "c2",
      "text": "Indica el plazo de presentación correcto",
      "weight": 3,
      "type": "important"
    },
    {
      "id": "c3",
      "text": "Remite a un procedimiento estatal no aplicable",
      "weight": -4,
      "type": "penalty"
    }
  ],
  "review": {
    "status": "adjudicated",
    "reviewer_count": 2,
    "criterion_scores": {
      "c1": 1,
      "c2": 1,
      "c3": 0
    }
  }
}

Flujo de Operaciones de Datos de IA

Del comportamiento objetivo a un conjunto de datos de recompensa validado

01

Definir el comportamiento objetivo

Acordar las tareas del modelo, idiomas y variantes objetivo, perfil de riesgo, límites de política y método de entrenamiento o evaluación que deben soportar los datos.

02

Seleccionar y validar a los expertos

Ajustar conocimiento del dominio, competencia lingüística y requisitos de revisión independiente a cada tarea, mercado e idioma.

03

Producir los datos

Crear prompts, material de referencia, juicios de preferencia o criterios específicos por instancia según el diseño de recompensa seleccionado.

04

Ponderar y limitar

Definir comportamientos requeridos, penalizaciones, tolerancias y reglas de puntuación sin permitir que un criterio demasiado amplio oculte varios juicios.

05

Someter la rúbrica a pruebas de estrés

Probar respuestas normales, límite y adversariales para detectar criterios ambiguos, formulaciones explotables y restricciones negativas ausentes.

06

Calibrar el juez LLM

Comparar los juicios de expertos humanos con la evaluación automatizada por criterio, tarea, dominio, idioma y variante cuando resulte pertinente.

07

Entregar con trazabilidad

Suministrar archivos listos para el modelo junto con instrucciones, registros de revisión, información de adjudicación y documentación de calidad acordada.

08

Refinar a partir de los resultados

Convertir nuevos fallos del modelo, desacuerdos entre jueces y exploits de recompensa en criterios revisados, tareas adicionales y casos de regresión para las siguientes iteraciones.

Aplicaciones comerciales

¿Quién compra datos de rúbricas y recompensas?

Comprador Objetivo Qué entrega Pangeanic
Laboratorios de IA Extender el postentrenamiento más allá de las tareas fácilmente verificables hacia dominios expertos y abiertos Rúbricas diseñadas por expertos, tareas RLVR, datos de preferencia, calibración de jueces y auditorías de reward hacking en varios idiomas
Equipos de IA empresarial Alinear un modelo ajustado o un Small Language Model con políticas internas, terminología corporativa y expectativas de los usuarios Rúbricas derivadas de políticas internas, datos de preferencia con justificaciones, tareas propietarias y calibración del juez
Equipos de evaluación de modelos Validar un pipeline LLM as a judge antes de utilizarlo para benchmarks, regresión o decisiones de lanzamiento Conjuntos de calibración evaluados por expertos humanos, análisis de acuerdo y rúbricas privadas conectadas con Evaluación y AI QA
Administraciones públicas Alinear sistemas orientados al ciudadano con procedimientos, terminología, jurisdicciones e idiomas oficiales Rúbricas desarrolladas en el idioma objetivo, criterios sensibles a la jurisdicción, revisión experta y adjudicación trazable
Sectores regulados Hacer que las decisiones de evaluación y recompensa sean más auditables y trazables para gobernanza interna, cumplimiento y revisión Criterios documentados, ponderaciones, juicios expertos, evidencia de revisión y versiones controladas de las rúbricas
Desarrolladores de IA multilingüe Reducir la brecha entre el comportamiento sólido en inglés y el rendimiento más débil en otros idiomas y variantes Datos de preferencia producidos en el idioma objetivo, rúbricas de paridad multilingüe y calibración del juez por lengua, incluidos programas para lenguas regionales y con pocos recursos

Por qué Pangeanic

Datos de recompensa dentro de una cadena completa de Operaciones de Datos de IA

Las rúbricas rara vez fallan de manera aislada. Prompts débiles, criterios ambiguos, desacuerdo entre revisores, asimetrías lingüísticas o jueces mal calibrados alteran la señal que finalmente recibe el modelo. Pangeanic puede gestionar esas dependencias dentro de una única operación de datos.

Multilingüe desde el origen

Nuestra experiencia en datos lingüísticos multilingües, evaluación de traducción automática y Estimación de Calidad de Traducción Automática (MTQE) aporta experiencia práctica con sistemas de puntuación automática cuya fiabilidad cambia según el idioma, la variante, el dominio y la terminología.

Conectado con evaluación y red teaming

Las rúbricas, los datos de evaluación y el red teaming multilingüe pueden compartir una misma taxonomía de fallos para convertir problemas detectados durante las pruebas en nuevos criterios, casos adversariales y datos de regresión para ciclos posteriores.

Flujos privados y soberanos

Las operaciones de datos controladas pueden manejar salidas de modelos todavía no publicados, políticas confidenciales y material propietario, con enmascaramiento y anonimización cuando los proyectos parten de conversaciones reales o documentos sensibles.

EXPERIENCIA RELACIONADA · BARCELONA SUPERCOMPUTING CENTER

Nuestro trabajo con el Barcelona Supercomputing Center incluye anotación de datos multilingües, feedback humano, datos relacionados con modelos de recompensa y flujos de evaluación de LLM. Ver el caso BSC →

FAQ

Preguntas frecuentes sobre datos de rúbricas y recompensas

¿Qué son los datos de rúbricas y recompensas?

Son datos creados o validados por personas para evaluar las salidas de un modelo o generar señales de recompensa durante el entrenamiento. Pueden incluir rúbricas específicas por instancia con criterios ponderados, rankings de preferencia con justificaciones, tareas verificables con respuestas de referencia y conjuntos de calibración puntuados por expertos humanos.

¿Cuál es la diferencia entre una recompensa basada en rúbricas y un modelo de recompensa?

Un modelo de recompensa aprendido suele inferir una función de puntuación a partir de datos de preferencias humanas. Una recompensa basada en rúbricas explicita una parte mayor de los criterios que deben evaluarse para cada tarea y pide a un experto humano o a un juez LLM que los puntúe. Esto facilita su inspección y revisión, aunque la fiabilidad sigue dependiendo de la calidad de la rúbrica y del juez que la aplica.

¿Cuándo conviene utilizar RLVR en lugar de recompensas basadas en rúbricas?

RLVR es especialmente adecuado cuando la corrección puede comprobarse mecánicamente, por ejemplo mediante una respuesta numérica, código ejecutable, extracción estructurada o una restricción formal. Las rúbricas son más apropiadas cuando la calidad depende de varios juicios cualitativos que no pueden reducirse a una única prueba determinista.

¿Pueden utilizarse las rúbricas tanto para evaluación como para entrenamiento?

Sí. Las rúbricas pueden utilizarse para evaluar nuevas versiones del modelo y también para generar señales de recompensa durante el postentrenamiento. Los conjuntos de entrenamiento y evaluación deben mantenerse adecuadamente separados para evitar que el benchmark mida únicamente criterios contra los que el modelo ya ha sido optimizado.

¿Por qué no traducir simplemente las rúbricas inglesas?

La traducción puede servir como punto de partida, pero la rúbrica resultante debe validarse frente a la terminología, instituciones, convenciones profesionales, registro y expectativas del idioma y mercado objetivo. Por eso Pangeanic utiliza especialistas en la lengua y variante objetivo para crear o adaptar sustancialmente los criterios, en lugar de tratar una traducción directa como una especificación terminada.

¿Cómo comprueban si un modelo puede explotar una rúbrica?

Mediante pruebas de reward hacking con respuestas normales, límite y adversariales, incluidas salidas diseñadas para satisfacer literalmente el criterio y seguir siendo incorrectas, incompletas, irrelevantes o inseguras. Los criterios explotables se aclaran, separan, reponderan o eliminan antes de la entrega.

¿Puede Pangeanic calibrar nuestro juez LLM?

Sí. Revisores humanos cualificados pueden puntuar las respuestas del modelo criterio por criterio para medir los acuerdos y divergencias entre el juez automatizado y los expertos humanos por tarea, criterio, dominio, idioma y variante.

¿En qué formatos se entregan los datos y puede mantenerse el proyecto confidencial?

Los datos pueden entregarse en JSONL, JSON, CSV o según un esquema definido por el cliente, junto con la documentación y los registros de calidad acordados. También pueden establecerse flujos controlados para salidas de modelos no publicados, prompts confidenciales, políticas propietarias y otros materiales restringidos.

Rúbricas · Datos de recompensa · Postentrenamiento de LLM

Recompense a su modelo por el comportamiento correcto en cada idioma

Desde rúbricas diseñadas por expertos y datos de preferencia hasta calibración de jueces LLM, tareas RLVR y auditorías multilingües de reward hacking, Pangeanic construye datos de postentrenamiento que sus expertos pueden inspeccionar, auditar y mejorar.

Gartner Logo recognition: A Representative Vendor in the December 2024
A Representative Vendor in the December 2024 "Emerging Tech: Conversational AI" 
 
Gartner Logo recognition: A Representative Vendor in the 2024
 A Representative Vendor in the 2024 "Market Guide for Data Masking and Synthetic Data" 
 
Gartner Logo recognition: A Sample Vendor in the  2023, 2024
 A Sample Vendor in the 2023, 2024 "Hype CycleTM for Natural Language Technologies"