Avant de commencer, créez un jeu de données comportant des lignes de validation et ajoutez chaque modèle affiné ou modèle de fournisseur que vous souhaitez comparer.
1
Ouvrir l’onglet Evaluate du jeu de données
Sélectionnez New evaluation, choisissez Head to Head, puis donnez à l’évaluation un nom explicite.
2
Choisir la référence
Sélectionnez la sortie originale ou réétiquetée du jeu de données comme participant principal. Les candidats seront évalués par rapport à ce comportement cible.
3
Ajouter des modèles candidats
Ajoutez d’abord les modèles affinés issus du jeu de données, puis les modèles de base ou de fournisseur que vous souhaitez comparer. Dans le sélecteur, les modèles affinés sont regroupés par modèle de base.
4
Configurer le juge
Sélectionnez un modèle juge performant et rédigez des instructions qui définissent ce qu’est une meilleure réponse pour cette tâche. Si vous disposez de suffisamment de lignes de validation, commencez avec 200.
5
Exécuter et inspecter
Lancez l’évaluation. Les scores se mettent à jour au fur et à mesure du traitement des lignes. Ouvrez une ligne pour lire l’explication du juge, et utilisez l’indicateur d’échec pour examiner les erreurs de fournisseur ou d’analyse.
6
Décider du déploiement
Un score de 50 % signifie la parité avec la référence : une victoire compte pour 1, une égalité pour 0,5 et une défaite pour 0. Ne promouvez le modèle que lorsque le score final et le comportement ligne par ligne atteignent votre seuil.
API : créer une évaluation (POST /evals)
API : créer une évaluation (POST /evals)
Le premier participant est le participant principal. Remplacez la référence du modèle candidat par l’artifact ou le modèle de fournisseur que vous souhaitez évaluer :La réponse contient l’ID de l’évaluation. Interrogez
GET /evals/{evalId} jusqu’à ce que l’évaluation soit stabilisée ; voir Créer une évaluation.