Skip to main content
Les évaluations permettent de déterminer si un candidat préserve le comportement du projet qui compte pour vous. Elles s’appuient sur des lignes de validation stables et enregistrent un résultat persistant par entrée et par participant.

Exécuter votre première évaluation

Comparez un modèle issu du fine-tuning à des sorties de référence à l’aide d’un juge en head-to-head.

Types d’évaluation

Un modèle juge compare chaque réponse candidate à une sortie principale. Utilisez ce type pour la génération libre, lorsqu’une correspondance textuelle exacte serait trop stricte. Score = (wins + 0.5 × ties) / completed rows ; un score de 50 % indique une parité avec la sortie principale.
Compare de manière déterministe les sorties canoniques de l’assistant. Utilisez ce type pour les réponses structurées ou discrètes, lorsque des sorties équivalentes doivent être identiques.
Lit un champ booléen et fournit la précision, le rappel, le score F1 et la matrice de confusion. Une sortie candidate illisible pénalise à la fois la précision et le rappel ; une sortie de référence illisible est ignorée.

Choisir les participants

Les évaluations head-to-head acceptent les sorties d’origine, les runs de réétiquetage, les modèles ajustés et les modèles de fournisseurs utilisés directement. Le premier participant est le participant principal. Les modèles issus du fine-tuning sur le jeu de données s’affichent en tête de liste, regroupés par modèle de base. Les évaluations par correspondance exacte et par catégorisation nécessitent une référence distincte et acceptent comme candidats des modèles ou des fournisseurs.

Lire les résultats en direct

Les résultats restent provisoires tant que toutes les lignes demandées ne sont pas finalisées. L’interface affiche :
  • le nombre de lignes terminées sur le nombre total de lignes ;
  • les victoires, les égalités, les défaites et le score des participants à la comparaison head-to-head ;
  • les lignes en échec et une synthèse immédiate des messages d’erreur ;
  • les verdicts par ligne dans l’atelier du jeu de données.
L’ajout d’un participant ou la modification des paramètres ne relance que le travail concerné. Les cas terminés non modifiés et les sorties de modèle réutilisables sont conservés.

Nouvelles tentatives et échecs

Chaque cas bénéficie d’au plus trois tentatives automatiques. Au-delà de cette limite, l’évaluation cesse les nouvelles tentatives et peut se terminer avec des lignes en échec. Une fois l’évaluation stabilisée, Retry failed cases crée un nouveau lot contenant uniquement les échecs ; les résultats déjà obtenus restent intacts.
Utilisez des paramètres d’acheminement identiques lorsque vous comparez des modèles de fournisseurs et des modèles affinés. Un modèle qui est déjà une cible du projet reçoit automatiquement les redéfinitions de paramètres de la version de projet correspondante la plus élevée.
Attendez que l’évaluation soit stabilisée, puis soumettez un lot de nouvelles tentatives limité aux échecs. Les résultats déjà obtenus sont conservés.
Pour la requête de création, consultez Evaluations Quick Start. Pour cette opération, voir Réessayer les cas d’évaluation en échec.
Dernière modification le 30 septembre 2026