> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Évaluations

> Comparez les sorties sur des échantillons de validation stables et interprétez les résultats provisoires en temps réel.

Les évaluations permettent de déterminer si un candidat préserve le comportement du projet qui compte pour vous. Elles s’appuient sur des lignes de validation stables et enregistrent un résultat persistant par entrée et par participant.

<Card title="Exécuter votre première évaluation" href="/fr/model-distillation/studio/evaluations-quickstart" arrow="true">
  Comparez un modèle issu du fine-tuning à des sorties de référence à l’aide d’un juge en head-to-head.
</Card>

<h2 id="evaluation-types">
  Types d'évaluation
</h2>

<Accordion title="Head to Head">
  Un modèle juge compare chaque réponse candidate à une sortie principale. Utilisez ce type pour la génération libre, lorsqu'une correspondance textuelle exacte serait trop stricte. Score = `(wins + 0.5 × ties) / completed rows` ; un score de 50 % indique une parité avec la sortie principale.
</Accordion>

<Accordion title="Exact Match">
  Compare de manière déterministe les sorties canoniques de l'assistant. Utilisez ce type pour les réponses structurées ou discrètes, lorsque des sorties équivalentes doivent être identiques.
</Accordion>

<Accordion title="Catégorisation">
  Lit un champ booléen et fournit la précision, le rappel, le score F1 et la matrice de confusion. Une sortie candidate illisible pénalise à la fois la précision et le rappel ; une sortie de référence illisible est ignorée.
</Accordion>

<h2 id="choose-participants">
  Choisir les participants
</h2>

Les évaluations head-to-head acceptent les sorties d’origine, les runs de réétiquetage, les modèles ajustés et les modèles de fournisseurs utilisés directement. Le premier participant est le participant principal. Les modèles issus du fine-tuning sur le jeu de données s’affichent en tête de liste, regroupés par modèle de base.

Les évaluations par correspondance exacte et par catégorisation nécessitent une référence distincte et acceptent comme candidats des modèles ou des fournisseurs.

<h2 id="read-live-results">
  Lire les résultats en direct
</h2>

Les résultats restent provisoires tant que toutes les lignes demandées ne sont pas finalisées. L’interface affiche :

* le nombre de lignes terminées sur le nombre total de lignes ;
* les victoires, les égalités, les défaites et le score des participants à la comparaison head-to-head ;
* les lignes en échec et une synthèse immédiate des messages d’erreur ;
* les verdicts par ligne dans l’atelier du jeu de données.

L’ajout d’un participant ou la modification des paramètres ne relance que le travail concerné. Les cas terminés non modifiés et les sorties de modèle réutilisables sont conservés.

<h2 id="retries-and-failure">
  Nouvelles tentatives et échecs
</h2>

Chaque cas bénéficie d’au plus trois tentatives automatiques. Au-delà de cette limite, l’évaluation cesse les nouvelles tentatives et peut se terminer avec des lignes en échec. Une fois l’évaluation stabilisée, **Retry failed cases** crée un nouveau lot contenant uniquement les échecs ; les résultats déjà obtenus restent intacts.

<Tip>
  Utilisez des paramètres d’acheminement identiques lorsque vous comparez des modèles de fournisseurs et des modèles affinés. Un modèle qui est déjà une cible du projet reçoit automatiquement les redéfinitions de paramètres de la version de projet correspondante la plus élevée.
</Tip>

<Accordion title="API : Retry failed cases (POST /evals/{evalId}/retry)">
  Attendez que l’évaluation soit stabilisée, puis soumettez un lot de nouvelles tentatives limité aux échecs. Les résultats déjà obtenus sont conservés.

  ```bash theme={"system"}
  curl --request POST \
    --url "https://distillation.training.wandb.ai/v1/evals/$EVAL_ID/retry" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team"
  ```

  Pour la requête de création, consultez [Evaluations Quick Start](/fr/model-distillation/studio/evaluations-quickstart). Pour cette opération, voir [Réessayer les cas d’évaluation en échec](/fr/model-distillation/reference/management/evaluations/retry-failed-evaluation-cases).
</Accordion>
