> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Démarrage rapide des évaluations

> Exécutez une évaluation en face-à-face entre votre sortie de référence et un ou plusieurs modèles candidats.

L’évaluation en face-à-face est le meilleur point de départ pour les tâches ouvertes, pour lesquelles exiger une correspondance textuelle exacte serait trop strict.

<Note>
  Avant de commencer, créez un jeu de données comportant des lignes de validation et ajoutez chaque modèle affiné ou modèle de fournisseur que vous souhaitez comparer.
</Note>

<Steps>
  <Step title="Ouvrir l’onglet Evaluate du jeu de données">
    Sélectionnez **New evaluation**, choisissez **Head to Head**, puis donnez à l’évaluation un nom explicite.
  </Step>

  <Step title="Choisir la référence">
    Sélectionnez la sortie originale ou réétiquetée du jeu de données comme participant principal. Les candidats seront évalués par rapport à ce comportement cible.
  </Step>

  <Step title="Ajouter des modèles candidats">
    Ajoutez d’abord les modèles affinés issus du jeu de données, puis les modèles de base ou de fournisseur que vous souhaitez comparer. Dans le sélecteur, les modèles affinés sont regroupés par modèle de base.
  </Step>

  <Step title="Configurer le juge">
    Sélectionnez un modèle juge performant et rédigez des instructions qui définissent ce qu’est une meilleure réponse pour cette tâche. Si vous disposez de suffisamment de lignes de validation, commencez avec 200.
  </Step>

  <Step title="Exécuter et inspecter">
    Lancez l’évaluation. Les scores se mettent à jour au fur et à mesure du traitement des lignes. Ouvrez une ligne pour lire l’explication du juge, et utilisez l’indicateur d’échec pour examiner les erreurs de fournisseur ou d’analyse.
  </Step>

  <Step title="Décider du déploiement">
    Un score de 50 % signifie la parité avec la référence : une victoire compte pour 1, une égalité pour 0,5 et une défaite pour 0. Ne promouvez le modèle que lorsque le score final et le comportement ligne par ligne atteignent votre seuil.
  </Step>
</Steps>

Les cas en échec sont automatiquement relancés, dans la limite de trois tentatives. Une fois le run stabilisé, **Retry failed cases** remet en file d’attente uniquement les échecs et conserve les résultats déjà obtenus.

<Accordion title="API : créer une évaluation (POST /evals)">
  Le premier participant est le participant principal. Remplacez la référence du modèle candidat par l’artifact ou le modèle de fournisseur que vous souhaitez évaluer :

  ```bash theme={"system"}
  curl --request POST \
    --url "https://distillation.training.wandb.ai/v1/evals" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team" \
    --header "Content-Type: application/json" \
    --data "{
      \"name\": \"ticket-classifier-comparison\",
      \"dataset_id\": \"$DATASET_ID\",
      \"spec\": {
        \"type\": \"h2h_judge\",
        \"judge_model_ref\": \"openai/gpt-5.6-sol\",
        \"judge_prompt\": \"Choose the more correct and helpful answer. Return a tie when they are equally good.\"
      },
      \"participants\": [
        {\"kind\": \"original\"},
        {\"kind\": \"model\", \"model_ref\": \"wandb-inference/your-fine-tuned-model\"}
      ],
      \"sample_size\": 200
    }"
  ```

  La réponse contient l’ID de l’évaluation. Interrogez `GET /evals/{evalId}` jusqu’à ce que l’évaluation soit stabilisée ; voir [Créer une évaluation](/fr/model-distillation/reference/management/evaluations/create-an-evaluation).
</Accordion>
