Alignement des modèles & feedback humain

Rubriques d’évaluation et données de récompense pour le post-entraînement et l’évaluation des LLM

Les rubriques d’évaluation et données de récompense sont les éléments produits par des experts humains qui indiquent à un modèle, critère par critère, ce qu’une bonne réponse doit contenir, ce qu’elle doit éviter et dans quelle mesure chaque élément doit peser dans le signal de récompense. Pangeanic conçoit des rubriques spécifiques à chaque instance, des données de préférences, des ensembles de tâches vérifiables et des données de calibration des juges dans les langues dans lesquelles votre modèle sera réellement utilisé, afin que le signal optimisé pendant le post-entraînement reste intelligible pour les experts responsables de la tâche.

Rubriques spécifiques à chaque instance Des critères définis pour chaque prompt et chaque tâche
Critères pondérés & pénalités Ce qui doit être récompensé, ce qui doit être pénalisé et avec quel poids
Jeux de calibration des juges Des scores d’experts humains pour valider vos juges LLM
Conception dans la langue cible Rubriques rédigées ou substantiellement adaptées par des experts de la langue
Livraison en environnement contrôlé Workflows adaptés aux modèles non publiés, prompts confidentiels et politiques propriétaires

Le problème du signal de récompense

Votre modèle apprendra exactement ce que votre signal de récompense valorise

L’apprentissage par renforcement est impitoyable avec les incitations. Tout comportement valorisé par le signal de récompense finit par être exploré par le modèle. Pour certaines tâches, notamment les mathématiques et le code, une vérification déterministe peut fournir un signal relativement net : une réponse correspond à la référence, une contrainte est respectée ou un test réussit.

Les travaux Tülu 3 ont formalisé cette approche sous le nom de Reinforcement Learning with Verifiable Rewards (RLVR), en remplaçant le modèle de récompense appris par des fonctions de vérification lorsque la tâche s’y prête. DeepSeek R1 a pris une décision comparable pour le raisonnement : ses auteurs ont explicitement évité les modèles neuronaux de récompense pour certaines tâches de raisonnement après avoir constaté leur vulnérabilité au reward hacking lors d’entraînements par renforcement à grande échelle.

La plupart des tâches d’entreprise n’offrent aucun corrigé aussi commode. Une explication clinique, une analyse juridique, une réponse client en portugais brésilien ou une réponse de refus soumise à des règles de sécurité ou de conformité peuvent être satisfaisantes ou défaillantes sur plusieurs dimensions indépendantes. Exactitude, exhaustivité, pertinence, sécurité, terminologie, registre et concision peuvent toutes déterminer la qualité réelle de la réponse.

Les données de préférences par paires apportent une première solution, mais un simple choix entre une réponse « préférée » et une réponse « rejetée » peut masquer les raisons du jugement. Les rubriques rendent une plus grande partie de cette décision explicite en décomposant la qualité en critères pouvant être inspectés et évalués séparément.

Une rubrique rend le signal de récompense plus interprétable et plus auditable, tout en déplaçant une part essentielle du problème vers la qualité de la spécification, le jugement des experts et la calibration du juge.

Bien entendu, une rubrique reste un proxy du comportement recherché. Un critère mal conçu peut être exploité avec autant d’efficacité qu’un mauvais modèle de récompense. C’est précisément le problème de données auquel Pangeanic apporte une réponse.

Résultats publiés

Pourquoi le post-entraînement des LLM évolue vers des critères experts explicites

Les recherches publiques montrent déjà comment les rubriques conçues par des experts, les récompenses vérifiables et les données de préférences multilingues transforment l’entraînement et l’évaluation des modèles.

OPENAI · HEALTHBENCH · 2025

48 562 critères rédigés par des experts

HealthBench évalue 5 000 conversations de santé à l’aide de 48 562 critères uniques. Le benchmark a été créé avec 262 médecins ayant exercé dans 60 pays et maîtrisant collectivement 49 langues.

SCALE AI · RUBRICS AS REWARDS · ICLR 2026

Jusqu’à 31 % de gain relatif sur HealthBench

En utilisant des rubriques structurées comme signaux de récompense on-policy, la variante la plus performante de Rubrics as Rewards a enregistré jusqu’à 31 % d’amélioration relative sur HealthBench et 7 % sur GPQA Diamond par rapport à des baselines LLM-as-a-judge utilisant des scores Likert directs.

COHERE · MULTILINGUAL PREFERENCE · 2024

Les données multilingues améliorent le transfert entre langues

Une optimisation des préférences entraînée uniquement sur des données anglaises a obtenu un taux de victoire de 46,3 % sur des langues non vues. L’ajout de 5 langues d’entraînement a porté ce résultat à 54,9 %, montrant directement que des données d’alignement multilingues peuvent améliorer le comportement au-delà de l’anglais.

Cadre de décision

Quel signal de récompense convient à votre modèle ?

La plupart des programmes de post-entraînement combinent plusieurs types de signaux. Le choix dépend de trois questions : la justesse peut-elle être vérifiée mécaniquement, la qualité repose-t-elle sur plusieurs dimensions et quel niveau d’interprétation experte la tâche exige-t-elle ?

Signal de récompense Idéal pour Données requises Risque principal Ce que Pangeanic fournit
Récompense vérifiable (RLVR) Mathématiques, code, extraction, sorties structurées et respect de contraintes formelles Prompts avec réponses de référence vérifiables et spécifications du vérificateur Le vérificateur peut ne couvrir qu’une définition trop étroite de la réussite Tâches conçues par des experts, réponses de référence, tolérances et règles de vérification
Données de préférences (RLHF, DPO) Ton, utilité, style et qualité globale lorsqu’une comparaison est plus fiable qu’un score absolu Prompts, plusieurs réponses, classements ou labels préféré/rejeté, idéalement accompagnés de justifications La longueur, le formatage ou les biais des annotateurs peuvent devenir des proxys involontaires de la qualité Classements justifiés, arbitrage et contrôles ciblant les biais connus des données de préférences
Récompense basée sur une rubrique Tâches expertes ouvertes dans les domaines médical, juridique, financier, technique et du secteur public Critères spécifiques à chaque instance, pondérations, pénalités et réponses ou consignes de référence Critères sous-spécifiés, exigences qui se chevauchent et erreurs du juge Rubriques conçues par des experts avec critères positifs, négatifs et pénalisants, complétées par la calibration du juge
Supervision du processus Raisonnements longs où la réponse finale ne révèle pas l’étape à laquelle la logique s’est dégradée Jugements étape par étape sur le raisonnement du modèle ou ses sorties intermédiaires Coût d’annotation élevé et segmentation incohérente des étapes de raisonnement Annotation experte étape par étape reliée à notre workflow de données de raisonnement expert

Ce que nous livrons

Jeux de données de rubriques et de récompense pour l’entraînement et l’évaluation

Chaque livrable peut être fourni séparément ou intégré à un programme complet de données de post-entraînement géré via PECAT, notre plateforme de gouvernance humaine pour l’annotation, la validation, la révision et les opérations de données.

01

Rubriques spécifiques à chaque instance

Critères définis au niveau du prompt par des experts du domaine, avec exigences essentielles, éléments souhaitables, comportements interdits, critères de pénalité, pondérations et consignes de référence.

02

Jeux de calibration des juges

Réponses de modèles évaluées critère par critère par des experts humains qualifiés afin de mesurer les points d’accord et de divergence entre un juge LLM et le jugement expert.

03

Données de préférences avec justifications

Classements par paires ou par listes accompagnés de raisons explicites, gestion des égalités et arbitrage, afin de conserver non seulement le choix final mais aussi les raisons pour lesquelles une réponse a été préférée.

04

Jeux de tâches vérifiables

Problèmes assortis de réponses de référence non ambiguës, de tolérances et de spécifications de vérification pour le RLVR, reliés à notre workflow de données de raisonnement expert.

05

Audits de reward hacking et des juges LLM

Réponses adversariales conçues pour révéler des critères pouvant être satisfaits littéralement tout en produisant des résultats incorrects, non pertinents, dangereux ou artificiellement verbeux afin de maximiser le score. Les défaillances confirmées deviennent des critères révisés et des cas de régression réutilisables.

06

Rubriques de parité multilingue

Rubriques rédigées ou substantiellement adaptées par des experts de chaque langue cible, avec calibration du juge par langue et contrôles de parité visant à vérifier qu’un comportement équivalent reçoit une récompense équivalente entre langues et variantes régionales.

Conception des rubriques

5 contrôles appliqués à chaque critère de rubrique

Dès qu’une rubrique entre dans une boucle d’entraînement, elle devient une composante du mécanisme de récompense. Ses critères doivent donc résister à la fois à l’interprétation humaine et à la pression d’optimisation du modèle.

1. Atomique. Un critère doit correspondre à un jugement. Une exigence comme « indique la posologie et explique le risque d’interaction » contient en réalité deux critères. Les séparer permet de rendre visible une satisfaction partielle.

2. Autonome. Les éléments nécessaires au jugement doivent être disponibles dans la tâche, la réponse et les documents de référence autorisés, sans obliger l’évaluateur à deviner l’intention du concepteur.

3. Pondéré. Lorsque la conception de l’entraînement ou de l’évaluation l’exige, l’importance de chaque critère est déclarée explicitement, y compris les pénalités associées aux erreurs critiques ou aux comportements interdits.

4. Ancré dans la langue. Les critères sont rédigés ou substantiellement adaptés par des spécialistes de la langue et de la variante cible, en tenant compte de la terminologie, du registre professionnel, des institutions et du contexte local.

5. Éprouvé par les évaluateurs. Nous mesurons l’accord entre évaluateurs humains et, lorsque cela s’applique, entre experts humains et juge LLM. Les critères produisant un niveau de désaccord inacceptable sont clarifiés, réécrits ou supprimés avant livraison.

Ces contrôles complètent les principes CURVD utilisés dans nos workflows de raisonnement vérifiable. CURVD facilite la vérification des réponses ; ces 5 contrôles rendent le jugement plus transparent et plus reproductible.

L’écart multilingue dans les signaux de récompense

Une rubrique traduite peut récompenser une réponse parfaitement formulée, mais parfaitement erronée

La plupart des ressources publiques de préférences et de rubriques restent largement centrées sur l’anglais. Lorsqu’une autre langue devient nécessaire, la traduction automatique peut produire des données apparemment multilingues tout en conservant un jugement profondément ancré dans les institutions, la terminologie, les conventions professionnelles et les attentes du contexte anglophone.

Un concept juridique peut changer de portée. Un avertissement clinique peut être techniquement présent mais pragmatiquement inadapté. Une procédure administrative peut n’exister que dans une juridiction particulière. Une réponse client peut satisfaire chaque critère traduit et pourtant paraître étrangère aux personnes auxquelles elle est destinée.

Le système de récompense peut alors devenir extrêmement efficace pour valoriser une réponse correcte dans une culture institutionnelle et erronée dans une autre.

Imaginez votre équipe préparant un assistant en espagnol pour une administration publique. La rubrique a été conçue en anglais, le juge LLM la valide et la courbe de récompense progresse de façon rassurante. Puis le premier citoyen pose une question sur une procédure régie par le droit régional. Le modèle applique parfaitement la mauvaise logique institutionnelle, car c’est exactement ce que la spécification de récompense lui a appris à faire.

Les recherches sur l’optimisation multilingue des préférences montrent déjà que le comportement d’alignement change lorsque la composition linguistique des données d’entraînement évolue. Pangeanic considère donc la traduction comme une entrée possible dans la conception d’une rubrique, jamais comme la preuve que la spécification de récompense est valide dans la langue cible.

Nos workflows multilingues combinent expertise dans la langue cible, connaissance du domaine, terminologie locale et calibration des juges afin que les différences linguistiques soient intégrées à la conception du signal de récompense dès le départ.

Format de livraison

Des fichiers directement exploitables par votre pipeline d’entraînement

Les données de rubriques et de récompense peuvent être livrées en JSONL, JSON, CSV ou selon votre propre schéma. Chaque enregistrement peut inclure des prompts, des réponses ou documents de référence, des critères, des pondérations, des pénalités, des décisions d’évaluateurs, des justifications, des métadonnées linguistiques et le statut d’arbitrage.

EXEMPLE D’ENREGISTREMENT · JSONL

{
  "id": "rr-es-0142",
  "language": "es-ES",
  "domain": "public-services",
  "prompt": "...",
  "reference_answer": "...",
  "criteria": [
    {
      "id": "c1",
      "text": "Identifie l’administration régionale compétente",
      "weight": 5,
      "type": "essential"
    },
    {
      "id": "c2",
      "text": "Indique le délai de dépôt correct",
      "weight": 3,
      "type": "important"
    },
    {
      "id": "c3",
      "text": "Renvoie vers une procédure nationale non applicable",
      "weight": -4,
      "type": "penalty"
    }
  ],
  "review": {
    "status": "adjudicated",
    "reviewer_count": 2,
    "criterion_scores": {
      "c1": 1,
      "c2": 1,
      "c3": 0
    }
  }
}

Workflow AI Data Operations

Du comportement cible à un jeu de données de récompense validé

01

Définir le comportement cible

Définir les tâches du modèle, les langues cibles, le profil de risque, les contraintes de politique et la méthode d’entraînement ou d’évaluation que les données devront servir.

02

Qualifier les experts

Faire correspondre expertise métier, compétence linguistique et exigences de révision indépendante à chaque tâche et à chaque langue.

03

Produire les données

Créer les prompts, documents de référence, jugements de préférence ou critères spécifiques à chaque instance selon la conception du signal de récompense retenue.

04

Pondérer et contraindre

Définir les comportements requis, pénalités, tolérances et autres règles de scoring sans laisser un critère trop général dissimuler plusieurs jugements.

05

Mettre la rubrique à l’épreuve

Tester des réponses normales, limites et adversariales afin d’identifier les critères ambigus, les formulations exploitables et les contraintes négatives manquantes.

06

Calibrer le juge

Comparer les jugements d’experts humains avec l’évaluation automatisée au niveau du critère, de la tâche, du domaine et de la langue lorsque cela s’applique.

07

Livrer avec les éléments de preuve

Fournir les fichiers prêts pour le modèle accompagnés des consignes, historiques de révision, données d’arbitrage et rapports qualité convenus.

08

Itérer à partir des résultats d’entraînement

Transformer les nouvelles défaillances du modèle, les divergences des juges et les exploits du signal de récompense en critères révisés, nouvelles tâches et cas de régression pour les cycles suivants.

Applications commerciales

Qui achète des données de rubriques et de récompense ?

Acheteur Objectif Ce que Pangeanic fournit
Laboratoires d’IA Étendre le post-entraînement au-delà des tâches facilement vérifiables vers des domaines experts et ouverts Rubriques expertes, jeux de tâches RLVR, données de préférences, calibration des juges et audits de reward hacking dans plusieurs langues
Équipes IA en entreprise Aligner un modèle fine-tuné ou un Small Language Model sur les politiques internes, la terminologie métier et les attentes des utilisateurs Rubriques dérivées des politiques internes, données de préférences avec justifications, tâches propriétaires et calibration des juges
Équipes d’évaluation des modèles Valider un pipeline LLM-as-a-judge avant de l’utiliser pour des benchmarks ou des décisions de mise en production Jeux de calibration évalués par des humains, analyse de l’accord et rubriques privées d’évaluation reliées à Evaluation & AI QA
Administrations publiques Aligner les systèmes destinés aux citoyens sur les procédures propres à chaque juridiction, la terminologie et les langues officielles Rubriques conçues dans chaque langue, critères tenant compte de la juridiction, révision experte et arbitrage traçable
Secteurs réglementés Rendre les décisions d’évaluation et de récompense plus inspectables pour la gouvernance interne et l’audit Critères documentés, pondérations, jugements experts, preuves de révision et versions successives des rubriques
Développeurs d’IA multilingue Réduire l’écart entre les performances solides en anglais et les comportements plus fragiles dans d’autres langues Données de préférences natives, rubriques de parité multilingue et calibration des juges par langue, y compris pour les langues régionales et à faibles ressources

Pourquoi Pangeanic

Des données de récompense intégrées à une chaîne complète d’AI Data Operations

Une rubrique échoue rarement seule. Des prompts faibles, des critères ambigus, des désaccords entre évaluateurs, des asymétries linguistiques ou un juge mal calibré altèrent tous le signal qui finit par atteindre le modèle. Pangeanic peut gérer ces dépendances au sein d’une même opération de données.

Le multilingue depuis l’origine

Notre expérience des données linguistiques multilingues, de l’évaluation de traduction automatique et de Machine Translation Quality Estimation nous donne une expérience pratique des systèmes de scoring automatique dont la fiabilité varie avec la langue, le domaine et la terminologie.

Relié à l’évaluation et au red teaming

Les rubriques, données d’évaluation et tests adversariaux multilingues peuvent partager une même taxonomie de défaillances afin que les problèmes détectés pendant l’évaluation deviennent de nouveaux critères, cas adversariaux et données de régression pour les cycles d’entraînement suivants.

Workflows privés et souverains

Des opérations de données contrôlées peuvent prendre en charge des sorties de modèles non publiées, des politiques confidentielles et du matériel propriétaire, avec masquage et anonymisation des données lorsque les projets utilisent des conversations réelles ou des documents sensibles.

EXPÉRIENCE ASSOCIÉE · BARCELONA SUPERCOMPUTING CENTER

Nos travaux avec le Barcelona Supercomputing Center comprennent l’annotation de données multilingues, le feedback humain, des données liées aux modèles de récompense et des workflows d’évaluation de LLM. Découvrir le cas BSC →

FAQ

Les questions des acheteurs sur les rubriques et données de récompense

Que sont les rubriques et données de récompense ?

Les rubriques et données de récompense sont des données produites ou validées par des humains afin d’évaluer les sorties d’un modèle ou de générer des signaux de récompense pour le post-entraînement. Elles peuvent inclure des rubriques spécifiques à chaque instance avec critères pondérés, des classements de préférences avec justifications, des tâches vérifiables avec réponses de référence et des jeux de calibration évalués par des experts humains.

Quelle est la différence entre une récompense basée sur une rubrique et un reward model ?

Un reward model appris infère généralement une fonction de scoring à partir de données de préférences humaines. Une récompense basée sur une rubrique rend explicite une plus grande partie des critères utilisés pour chaque tâche, puis demande à un humain ou à un juge LLM de les évaluer. Les critères deviennent ainsi plus faciles à inspecter et à réviser, même si la fiabilité continue de dépendre de la qualité de la rubrique et du juge qui l’applique.

Quand utiliser le RLVR plutôt que des récompenses basées sur des rubriques ?

Le RLVR convient particulièrement aux tâches dont la justesse peut être vérifiée mécaniquement, comme une réponse numérique, du code exécutable, une extraction structurée ou une contrainte formelle. Les rubriques sont plus adaptées lorsque la qualité dépend de plusieurs jugements qualitatifs qu’un seul test déterministe ne peut pas représenter.

Les rubriques peuvent-elles servir à l’évaluation comme à l’entraînement ?

Oui. Les rubriques peuvent servir aussi bien à évaluer de nouvelles versions du modèle qu’à générer des signaux de récompense pendant le post-entraînement. Les jeux d’entraînement et d’évaluation doivent toutefois rester suffisamment séparés afin que l’évaluation ne mesure pas simplement des critères contre lesquels le modèle a déjà été optimisé.

Pourquoi ne pas simplement traduire des rubriques anglaises ?

La traduction peut constituer un point de départ, mais la rubrique obtenue doit encore être validée par rapport à la terminologie, aux institutions, aux conventions professionnelles, au registre et aux attentes propres à la langue cible. Pangeanic utilise donc des experts de la langue cible pour rédiger ou substantiellement adapter les critères plutôt que de considérer une traduction brute comme une spécification de récompense terminée.

Comment testez-vous si une rubrique peut être exploitée ?

Les critères sont testés sur des réponses normales, limites et adversariales, y compris des sorties conçues pour satisfaire littéralement le texte du critère tout en restant incorrectes, incomplètes, non pertinentes ou dangereuses. Les critères exploitables sont clarifiés, séparés, repondérés ou supprimés avant livraison.

Pangeanic peut-il calibrer notre juge LLM ?

Oui. Des évaluateurs qualifiés peuvent noter les réponses critère par critère afin de mesurer les accords et divergences entre le juge automatisé et les experts humains, par tâche, critère, domaine et langue.

Quels formats livrez-vous et le projet peut-il rester confidentiel ?

Les données peuvent être livrées en JSONL, JSON, CSV ou selon un schéma défini par le client, avec la documentation et les éléments de qualité convenus. Des workflows contrôlés peuvent également être mis en place pour les sorties de modèles non publiées, les prompts confidentiels, les politiques propriétaires et d’autres contenus restreints.

Rubriques · Données de récompense · Post-entraînement LLM

Récompenser le bon comportement, dans chaque langue

Des rubriques expertes et données de préférences à la calibration des juges, aux tâches RLVR et aux audits multilingues des signaux de récompense, Pangeanic construit des données de post-entraînement qui restent inspectables par les personnes qui comprennent réellement la tâche.

Gartner Logo recognition: A Representative Vendor in the December 2024
A Representative Vendor in the December 2024 "Emerging Tech: Conversational AI" 
 
Gartner Logo recognition: A Representative Vendor in the 2024
 A Representative Vendor in the 2024 "Market Guide for Data Masking and Synthetic Data" 
 
Gartner Logo recognition: A Sample Vendor in the  2023, 2024
 A Sample Vendor in the 2023, 2024 "Hype CycleTM for Natural Language Technologies"