Alignement des modèles & feedback humain
Rubriques d’évaluation et données de récompense pour le post-entraînement et l’évaluation des LLM
Les rubriques d’évaluation et données de récompense sont les éléments produits par des experts humains qui indiquent à un modèle, critère par critère, ce qu’une bonne réponse doit contenir, ce qu’elle doit éviter et dans quelle mesure chaque élément doit peser dans le signal de récompense. Pangeanic conçoit des rubriques spécifiques à chaque instance, des données de préférences, des ensembles de tâches vérifiables et des données de calibration des juges dans les langues dans lesquelles votre modèle sera réellement utilisé, afin que le signal optimisé pendant le post-entraînement reste intelligible pour les experts responsables de la tâche.
Le problème du signal de récompense
Votre modèle apprendra exactement ce que votre signal de récompense valorise
L’apprentissage par renforcement est impitoyable avec les incitations. Tout comportement valorisé par le signal de récompense finit par être exploré par le modèle. Pour certaines tâches, notamment les mathématiques et le code, une vérification déterministe peut fournir un signal relativement net : une réponse correspond à la référence, une contrainte est respectée ou un test réussit.
Les travaux Tülu 3 ont formalisé cette approche sous le nom de Reinforcement Learning with Verifiable Rewards (RLVR), en remplaçant le modèle de récompense appris par des fonctions de vérification lorsque la tâche s’y prête. DeepSeek R1 a pris une décision comparable pour le raisonnement : ses auteurs ont explicitement évité les modèles neuronaux de récompense pour certaines tâches de raisonnement après avoir constaté leur vulnérabilité au reward hacking lors d’entraînements par renforcement à grande échelle.
La plupart des tâches d’entreprise n’offrent aucun corrigé aussi commode. Une explication clinique, une analyse juridique, une réponse client en portugais brésilien ou une réponse de refus soumise à des règles de sécurité ou de conformité peuvent être satisfaisantes ou défaillantes sur plusieurs dimensions indépendantes. Exactitude, exhaustivité, pertinence, sécurité, terminologie, registre et concision peuvent toutes déterminer la qualité réelle de la réponse.
Les données de préférences par paires apportent une première solution, mais un simple choix entre une réponse « préférée » et une réponse « rejetée » peut masquer les raisons du jugement. Les rubriques rendent une plus grande partie de cette décision explicite en décomposant la qualité en critères pouvant être inspectés et évalués séparément.
Une rubrique rend le signal de récompense plus interprétable et plus auditable, tout en déplaçant une part essentielle du problème vers la qualité de la spécification, le jugement des experts et la calibration du juge.
Bien entendu, une rubrique reste un proxy du comportement recherché. Un critère mal conçu peut être exploité avec autant d’efficacité qu’un mauvais modèle de récompense. C’est précisément le problème de données auquel Pangeanic apporte une réponse.
Résultats publiés
Pourquoi le post-entraînement des LLM évolue vers des critères experts explicites
Les recherches publiques montrent déjà comment les rubriques conçues par des experts, les récompenses vérifiables et les données de préférences multilingues transforment l’entraînement et l’évaluation des modèles.
OPENAI · HEALTHBENCH · 2025
48 562 critères rédigés par des experts
HealthBench évalue 5 000 conversations de santé à l’aide de 48 562 critères uniques. Le benchmark a été créé avec 262 médecins ayant exercé dans 60 pays et maîtrisant collectivement 49 langues.
SCALE AI · RUBRICS AS REWARDS · ICLR 2026
Jusqu’à 31 % de gain relatif sur HealthBench
En utilisant des rubriques structurées comme signaux de récompense on-policy, la variante la plus performante de Rubrics as Rewards a enregistré jusqu’à 31 % d’amélioration relative sur HealthBench et 7 % sur GPQA Diamond par rapport à des baselines LLM-as-a-judge utilisant des scores Likert directs.
COHERE · MULTILINGUAL PREFERENCE · 2024
Les données multilingues améliorent le transfert entre langues
Une optimisation des préférences entraînée uniquement sur des données anglaises a obtenu un taux de victoire de 46,3 % sur des langues non vues. L’ajout de 5 langues d’entraînement a porté ce résultat à 54,9 %, montrant directement que des données d’alignement multilingues peuvent améliorer le comportement au-delà de l’anglais.
Cadre de décision
Quel signal de récompense convient à votre modèle ?
La plupart des programmes de post-entraînement combinent plusieurs types de signaux. Le choix dépend de trois questions : la justesse peut-elle être vérifiée mécaniquement, la qualité repose-t-elle sur plusieurs dimensions et quel niveau d’interprétation experte la tâche exige-t-elle ?
| Signal de récompense | Idéal pour | Données requises | Risque principal | Ce que Pangeanic fournit |
|---|---|---|---|---|
| Récompense vérifiable (RLVR) | Mathématiques, code, extraction, sorties structurées et respect de contraintes formelles | Prompts avec réponses de référence vérifiables et spécifications du vérificateur | Le vérificateur peut ne couvrir qu’une définition trop étroite de la réussite | Tâches conçues par des experts, réponses de référence, tolérances et règles de vérification |
| Données de préférences (RLHF, DPO) | Ton, utilité, style et qualité globale lorsqu’une comparaison est plus fiable qu’un score absolu | Prompts, plusieurs réponses, classements ou labels préféré/rejeté, idéalement accompagnés de justifications | La longueur, le formatage ou les biais des annotateurs peuvent devenir des proxys involontaires de la qualité | Classements justifiés, arbitrage et contrôles ciblant les biais connus des données de préférences |
| Récompense basée sur une rubrique | Tâches expertes ouvertes dans les domaines médical, juridique, financier, technique et du secteur public | Critères spécifiques à chaque instance, pondérations, pénalités et réponses ou consignes de référence | Critères sous-spécifiés, exigences qui se chevauchent et erreurs du juge | Rubriques conçues par des experts avec critères positifs, négatifs et pénalisants, complétées par la calibration du juge |
| Supervision du processus | Raisonnements longs où la réponse finale ne révèle pas l’étape à laquelle la logique s’est dégradée | Jugements étape par étape sur le raisonnement du modèle ou ses sorties intermédiaires | Coût d’annotation élevé et segmentation incohérente des étapes de raisonnement | Annotation experte étape par étape reliée à notre workflow de données de raisonnement expert |
Ce que nous livrons
Jeux de données de rubriques et de récompense pour l’entraînement et l’évaluation
Chaque livrable peut être fourni séparément ou intégré à un programme complet de données de post-entraînement géré via PECAT, notre plateforme de gouvernance humaine pour l’annotation, la validation, la révision et les opérations de données.
01
Rubriques spécifiques à chaque instance
Critères définis au niveau du prompt par des experts du domaine, avec exigences essentielles, éléments souhaitables, comportements interdits, critères de pénalité, pondérations et consignes de référence.
02
Jeux de calibration des juges
Réponses de modèles évaluées critère par critère par des experts humains qualifiés afin de mesurer les points d’accord et de divergence entre un juge LLM et le jugement expert.
03
Données de préférences avec justifications
Classements par paires ou par listes accompagnés de raisons explicites, gestion des égalités et arbitrage, afin de conserver non seulement le choix final mais aussi les raisons pour lesquelles une réponse a été préférée.
04
Jeux de tâches vérifiables
Problèmes assortis de réponses de référence non ambiguës, de tolérances et de spécifications de vérification pour le RLVR, reliés à notre workflow de données de raisonnement expert.
05
Audits de reward hacking et des juges LLM
Réponses adversariales conçues pour révéler des critères pouvant être satisfaits littéralement tout en produisant des résultats incorrects, non pertinents, dangereux ou artificiellement verbeux afin de maximiser le score. Les défaillances confirmées deviennent des critères révisés et des cas de régression réutilisables.
06
Rubriques de parité multilingue
Rubriques rédigées ou substantiellement adaptées par des experts de chaque langue cible, avec calibration du juge par langue et contrôles de parité visant à vérifier qu’un comportement équivalent reçoit une récompense équivalente entre langues et variantes régionales.
Conception des rubriques
5 contrôles appliqués à chaque critère de rubrique
Dès qu’une rubrique entre dans une boucle d’entraînement, elle devient une composante du mécanisme de récompense. Ses critères doivent donc résister à la fois à l’interprétation humaine et à la pression d’optimisation du modèle.
1. Atomique. Un critère doit correspondre à un jugement. Une exigence comme « indique la posologie et explique le risque d’interaction » contient en réalité deux critères. Les séparer permet de rendre visible une satisfaction partielle.
2. Autonome. Les éléments nécessaires au jugement doivent être disponibles dans la tâche, la réponse et les documents de référence autorisés, sans obliger l’évaluateur à deviner l’intention du concepteur.
3. Pondéré. Lorsque la conception de l’entraînement ou de l’évaluation l’exige, l’importance de chaque critère est déclarée explicitement, y compris les pénalités associées aux erreurs critiques ou aux comportements interdits.
4. Ancré dans la langue. Les critères sont rédigés ou substantiellement adaptés par des spécialistes de la langue et de la variante cible, en tenant compte de la terminologie, du registre professionnel, des institutions et du contexte local.
5. Éprouvé par les évaluateurs. Nous mesurons l’accord entre évaluateurs humains et, lorsque cela s’applique, entre experts humains et juge LLM. Les critères produisant un niveau de désaccord inacceptable sont clarifiés, réécrits ou supprimés avant livraison.
Ces contrôles complètent les principes CURVD utilisés dans nos workflows de raisonnement vérifiable. CURVD facilite la vérification des réponses ; ces 5 contrôles rendent le jugement plus transparent et plus reproductible.
L’écart multilingue dans les signaux de récompense
Une rubrique traduite peut récompenser une réponse parfaitement formulée, mais parfaitement erronée
La plupart des ressources publiques de préférences et de rubriques restent largement centrées sur l’anglais. Lorsqu’une autre langue devient nécessaire, la traduction automatique peut produire des données apparemment multilingues tout en conservant un jugement profondément ancré dans les institutions, la terminologie, les conventions professionnelles et les attentes du contexte anglophone.
Un concept juridique peut changer de portée. Un avertissement clinique peut être techniquement présent mais pragmatiquement inadapté. Une procédure administrative peut n’exister que dans une juridiction particulière. Une réponse client peut satisfaire chaque critère traduit et pourtant paraître étrangère aux personnes auxquelles elle est destinée.
Le système de récompense peut alors devenir extrêmement efficace pour valoriser une réponse correcte dans une culture institutionnelle et erronée dans une autre.
Imaginez votre équipe préparant un assistant en espagnol pour une administration publique. La rubrique a été conçue en anglais, le juge LLM la valide et la courbe de récompense progresse de façon rassurante. Puis le premier citoyen pose une question sur une procédure régie par le droit régional. Le modèle applique parfaitement la mauvaise logique institutionnelle, car c’est exactement ce que la spécification de récompense lui a appris à faire.
Les recherches sur l’optimisation multilingue des préférences montrent déjà que le comportement d’alignement change lorsque la composition linguistique des données d’entraînement évolue. Pangeanic considère donc la traduction comme une entrée possible dans la conception d’une rubrique, jamais comme la preuve que la spécification de récompense est valide dans la langue cible.
Nos workflows multilingues combinent expertise dans la langue cible, connaissance du domaine, terminologie locale et calibration des juges afin que les différences linguistiques soient intégrées à la conception du signal de récompense dès le départ.
Format de livraison
Des fichiers directement exploitables par votre pipeline d’entraînement
Les données de rubriques et de récompense peuvent être livrées en JSONL, JSON, CSV ou selon votre propre schéma. Chaque enregistrement peut inclure des prompts, des réponses ou documents de référence, des critères, des pondérations, des pénalités, des décisions d’évaluateurs, des justifications, des métadonnées linguistiques et le statut d’arbitrage.
EXEMPLE D’ENREGISTREMENT · JSONL
{
"id": "rr-es-0142",
"language": "es-ES",
"domain": "public-services",
"prompt": "...",
"reference_answer": "...",
"criteria": [
{
"id": "c1",
"text": "Identifie l’administration régionale compétente",
"weight": 5,
"type": "essential"
},
{
"id": "c2",
"text": "Indique le délai de dépôt correct",
"weight": 3,
"type": "important"
},
{
"id": "c3",
"text": "Renvoie vers une procédure nationale non applicable",
"weight": -4,
"type": "penalty"
}
],
"review": {
"status": "adjudicated",
"reviewer_count": 2,
"criterion_scores": {
"c1": 1,
"c2": 1,
"c3": 0
}
}
}
Workflow AI Data Operations
Du comportement cible à un jeu de données de récompense validé
Définir le comportement cible
Définir les tâches du modèle, les langues cibles, le profil de risque, les contraintes de politique et la méthode d’entraînement ou d’évaluation que les données devront servir.
Qualifier les experts
Faire correspondre expertise métier, compétence linguistique et exigences de révision indépendante à chaque tâche et à chaque langue.
Produire les données
Créer les prompts, documents de référence, jugements de préférence ou critères spécifiques à chaque instance selon la conception du signal de récompense retenue.
Pondérer et contraindre
Définir les comportements requis, pénalités, tolérances et autres règles de scoring sans laisser un critère trop général dissimuler plusieurs jugements.
Mettre la rubrique à l’épreuve
Tester des réponses normales, limites et adversariales afin d’identifier les critères ambigus, les formulations exploitables et les contraintes négatives manquantes.
Calibrer le juge
Comparer les jugements d’experts humains avec l’évaluation automatisée au niveau du critère, de la tâche, du domaine et de la langue lorsque cela s’applique.
Livrer avec les éléments de preuve
Fournir les fichiers prêts pour le modèle accompagnés des consignes, historiques de révision, données d’arbitrage et rapports qualité convenus.
Itérer à partir des résultats d’entraînement
Transformer les nouvelles défaillances du modèle, les divergences des juges et les exploits du signal de récompense en critères révisés, nouvelles tâches et cas de régression pour les cycles suivants.
Applications commerciales
Qui achète des données de rubriques et de récompense ?
| Acheteur | Objectif | Ce que Pangeanic fournit |
|---|---|---|
| Laboratoires d’IA | Étendre le post-entraînement au-delà des tâches facilement vérifiables vers des domaines experts et ouverts | Rubriques expertes, jeux de tâches RLVR, données de préférences, calibration des juges et audits de reward hacking dans plusieurs langues |
| Équipes IA en entreprise | Aligner un modèle fine-tuné ou un Small Language Model sur les politiques internes, la terminologie métier et les attentes des utilisateurs | Rubriques dérivées des politiques internes, données de préférences avec justifications, tâches propriétaires et calibration des juges |
| Équipes d’évaluation des modèles | Valider un pipeline LLM-as-a-judge avant de l’utiliser pour des benchmarks ou des décisions de mise en production | Jeux de calibration évalués par des humains, analyse de l’accord et rubriques privées d’évaluation reliées à Evaluation & AI QA |
| Administrations publiques | Aligner les systèmes destinés aux citoyens sur les procédures propres à chaque juridiction, la terminologie et les langues officielles | Rubriques conçues dans chaque langue, critères tenant compte de la juridiction, révision experte et arbitrage traçable |
| Secteurs réglementés | Rendre les décisions d’évaluation et de récompense plus inspectables pour la gouvernance interne et l’audit | Critères documentés, pondérations, jugements experts, preuves de révision et versions successives des rubriques |
| Développeurs d’IA multilingue | Réduire l’écart entre les performances solides en anglais et les comportements plus fragiles dans d’autres langues | Données de préférences natives, rubriques de parité multilingue et calibration des juges par langue, y compris pour les langues régionales et à faibles ressources |
Pourquoi Pangeanic
Des données de récompense intégrées à une chaîne complète d’AI Data Operations
Une rubrique échoue rarement seule. Des prompts faibles, des critères ambigus, des désaccords entre évaluateurs, des asymétries linguistiques ou un juge mal calibré altèrent tous le signal qui finit par atteindre le modèle. Pangeanic peut gérer ces dépendances au sein d’une même opération de données.
Le multilingue depuis l’origine
Notre expérience des données linguistiques multilingues, de l’évaluation de traduction automatique et de Machine Translation Quality Estimation nous donne une expérience pratique des systèmes de scoring automatique dont la fiabilité varie avec la langue, le domaine et la terminologie.
Relié à l’évaluation et au red teaming
Les rubriques, données d’évaluation et tests adversariaux multilingues peuvent partager une même taxonomie de défaillances afin que les problèmes détectés pendant l’évaluation deviennent de nouveaux critères, cas adversariaux et données de régression pour les cycles d’entraînement suivants.
Workflows privés et souverains
Des opérations de données contrôlées peuvent prendre en charge des sorties de modèles non publiées, des politiques confidentielles et du matériel propriétaire, avec masquage et anonymisation des données lorsque les projets utilisent des conversations réelles ou des documents sensibles.
EXPÉRIENCE ASSOCIÉE · BARCELONA SUPERCOMPUTING CENTER
Nos travaux avec le Barcelona Supercomputing Center comprennent l’annotation de données multilingues, le feedback humain, des données liées aux modèles de récompense et des workflows d’évaluation de LLM. Découvrir le cas BSC →
FAQ
Les questions des acheteurs sur les rubriques et données de récompense
Que sont les rubriques et données de récompense ?
Les rubriques et données de récompense sont des données produites ou validées par des humains afin d’évaluer les sorties d’un modèle ou de générer des signaux de récompense pour le post-entraînement. Elles peuvent inclure des rubriques spécifiques à chaque instance avec critères pondérés, des classements de préférences avec justifications, des tâches vérifiables avec réponses de référence et des jeux de calibration évalués par des experts humains.
Quelle est la différence entre une récompense basée sur une rubrique et un reward model ?
Un reward model appris infère généralement une fonction de scoring à partir de données de préférences humaines. Une récompense basée sur une rubrique rend explicite une plus grande partie des critères utilisés pour chaque tâche, puis demande à un humain ou à un juge LLM de les évaluer. Les critères deviennent ainsi plus faciles à inspecter et à réviser, même si la fiabilité continue de dépendre de la qualité de la rubrique et du juge qui l’applique.
Quand utiliser le RLVR plutôt que des récompenses basées sur des rubriques ?
Le RLVR convient particulièrement aux tâches dont la justesse peut être vérifiée mécaniquement, comme une réponse numérique, du code exécutable, une extraction structurée ou une contrainte formelle. Les rubriques sont plus adaptées lorsque la qualité dépend de plusieurs jugements qualitatifs qu’un seul test déterministe ne peut pas représenter.
Les rubriques peuvent-elles servir à l’évaluation comme à l’entraînement ?
Oui. Les rubriques peuvent servir aussi bien à évaluer de nouvelles versions du modèle qu’à générer des signaux de récompense pendant le post-entraînement. Les jeux d’entraînement et d’évaluation doivent toutefois rester suffisamment séparés afin que l’évaluation ne mesure pas simplement des critères contre lesquels le modèle a déjà été optimisé.
Pourquoi ne pas simplement traduire des rubriques anglaises ?
La traduction peut constituer un point de départ, mais la rubrique obtenue doit encore être validée par rapport à la terminologie, aux institutions, aux conventions professionnelles, au registre et aux attentes propres à la langue cible. Pangeanic utilise donc des experts de la langue cible pour rédiger ou substantiellement adapter les critères plutôt que de considérer une traduction brute comme une spécification de récompense terminée.
Comment testez-vous si une rubrique peut être exploitée ?
Les critères sont testés sur des réponses normales, limites et adversariales, y compris des sorties conçues pour satisfaire littéralement le texte du critère tout en restant incorrectes, incomplètes, non pertinentes ou dangereuses. Les critères exploitables sont clarifiés, séparés, repondérés ou supprimés avant livraison.
Pangeanic peut-il calibrer notre juge LLM ?
Oui. Des évaluateurs qualifiés peuvent noter les réponses critère par critère afin de mesurer les accords et divergences entre le juge automatisé et les experts humains, par tâche, critère, domaine et langue.
Quels formats livrez-vous et le projet peut-il rester confidentiel ?
Les données peuvent être livrées en JSONL, JSON, CSV ou selon un schéma défini par le client, avec la documentation et les éléments de qualité convenus. Des workflows contrôlés peuvent également être mis en place pour les sorties de modèles non publiées, les prompts confidentiels, les politiques propriétaires et d’autres contenus restreints.
Pour aller plus loin
La place des rubriques et données de récompense dans la chaîne d’alignement
Model Alignment & RLHF
Classement de préférences, révision multilingue, feedback humain et boucles d’évaluation pour mieux maîtriser le comportement des modèles.
Découvrir l’alignement des modèles → Données vérifiablesExpert Reasoning Data
Tâches expertes, traces de raisonnement vérifiées et réponses contrôlées pour le supervised fine tuning et le RLVR.
Découvrir les données de raisonnement → Découverte des défaillancesMultilingual AI Red Teaming
Tests adversariaux, défaillances confirmées et données de régression à travers les langues, cultures et contextes de déploiement.
Découvrir le red teaming → ÉvaluationEvaluation & AI QA
Conception de benchmarks, assurance qualité multilingue et tests de régression pour mesurer les performances des modèles.
Découvrir l’évaluation → Couche opérationnelleAI Data Operations
Données gouvernées, feedback humain, évaluation, alignement et contrôle qualité reliés tout au long du cycle de vie de l’IA.
Découvrir AI Data Operations → PlateformePECAT
Annotation, validation, révision et opérations de données traçables sous gouvernance humaine pour l’IA multilingue et multimodale.
Découvrir PECAT →Sources
- Gunjal, A. et al. Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains . ICLR 2026.
- Arora, R. K. et al. HealthBench: Evaluating Large Language Models Towards Improved Human Health . OpenAI, 2025.
- Lambert, N. et al. Tülu 3: Pushing Frontiers in Open Language Model Post-Training . Allen Institute for AI, 2024.
- Dang, J. et al. RLHF Can Speak Many Languages: Unlocking Multilingual Preference Optimization for LLMs . EMNLP 2024.
- DeepSeek AI. DeepSeek R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning . Nature, 2025.
Rubriques · Données de récompense · Post-entraînement LLM
Récompenser le bon comportement, dans chaque langue
Des rubriques expertes et données de préférences à la calibration des juges, aux tâches RLVR et aux audits multilingues des signaux de récompense, Pangeanic construit des données de post-entraînement qui restent inspectables par les personnes qui comprennent réellement la tâche.
A Representative Vendor in the 2024 "Market Guide for Data Masking and Synthetic Data"

