Skip to main content
L’évaluation en face-à-face est le meilleur point de départ pour les tâches ouvertes, pour lesquelles exiger une correspondance textuelle exacte serait trop strict.
Avant de commencer, créez un jeu de données comportant des lignes de validation et ajoutez chaque modèle affiné ou modèle de fournisseur que vous souhaitez comparer.
1

Ouvrir l’onglet Evaluate du jeu de données

Sélectionnez New evaluation, choisissez Head to Head, puis donnez à l’évaluation un nom explicite.
2

Choisir la référence

Sélectionnez la sortie originale ou réétiquetée du jeu de données comme participant principal. Les candidats seront évalués par rapport à ce comportement cible.
3

Ajouter des modèles candidats

Ajoutez d’abord les modèles affinés issus du jeu de données, puis les modèles de base ou de fournisseur que vous souhaitez comparer. Dans le sélecteur, les modèles affinés sont regroupés par modèle de base.
4

Configurer le juge

Sélectionnez un modèle juge performant et rédigez des instructions qui définissent ce qu’est une meilleure réponse pour cette tâche. Si vous disposez de suffisamment de lignes de validation, commencez avec 200.
5

Exécuter et inspecter

Lancez l’évaluation. Les scores se mettent à jour au fur et à mesure du traitement des lignes. Ouvrez une ligne pour lire l’explication du juge, et utilisez l’indicateur d’échec pour examiner les erreurs de fournisseur ou d’analyse.
6

Décider du déploiement

Un score de 50 % signifie la parité avec la référence : une victoire compte pour 1, une égalité pour 0,5 et une défaite pour 0. Ne promouvez le modèle que lorsque le score final et le comportement ligne par ligne atteignent votre seuil.
Les cas en échec sont automatiquement relancés, dans la limite de trois tentatives. Une fois le run stabilisé, Retry failed cases remet en file d’attente uniquement les échecs et conserve les résultats déjà obtenus.
Le premier participant est le participant principal. Remplacez la référence du modèle candidat par l’artifact ou le modèle de fournisseur que vous souhaitez évaluer :
La réponse contient l’ID de l’évaluation. Interrogez GET /evals/{evalId} jusqu’à ce que l’évaluation soit stabilisée ; voir Créer une évaluation.
Dernière modification le 30 septembre 2026