> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Datasets

> Créez des données d’entraînement et de test reproductibles à partir des traces d’un projet ou d’un projet W&B existant.

Un dataset est un instantané durable d’interactions exploitables avec un modèle. Model Distillation stocke les entrées dans Postgres pour que vous puissiez les inspecter et les évaluer, puis exporte des artifacts immuables au lancement de l’entraînement.

<Card title="Créer votre premier dataset" href="/fr/model-distillation/studio/datasets-quickstart" arrow="true">
  Suivez le guide étape par étape, de la sélection de la source à l’inspection des lignes.
</Card>

<h2 id="choose-a-source">
  Choisir une source
</h2>

L’interface utilisateur construit les datasets à partir du trafic du projet lui-même. L’API accepte également comme source un projet W\&B existant ou un fichier JSONL que vous téléversez. Les sections suivantes décrivent ces trois options.

<h3 id="project-traffic">
  Trafic du projet
</h3>

Si le trafic a été enregistré par le proxy, utilisez les traces du projet actuel. Dans l’interface utilisateur, la section **Source data** de la boîte de dialogue **Create Dataset** vous permet de choisir les paramètres suivants :

* **Project version :** fige le prompt et le régime d’acheminement utilisés pour sélectionner les traces.
* **Served by :** ne conserve que les traces servies par un modèle donné. Pour que les données d’entraînement proviennent uniquement du modèle enseignant, sélectionnez ce dernier. **All models** mélange les sorties de tous les modèles ayant servi la version.
* **After (UTC)** et **Before (UTC) :** une fenêtre temporelle fixe. L’interface utilisateur préremplit les 14 derniers jours sous forme d’horodatages fixes.
* **Maximum traces :** la taille de l’échantillon aléatoire après filtrage. La valeur par défaut est de 20 000 et le maximum de 100 000.

Via l’API, `filters` accepte également des métadonnées de trace scalaires. Les lectures depuis une source de projet s’appuient sur les Agent Spans attribués au projet et reconstituent à l’identique la requête et la réponse Chat Completions, au format du fournisseur.

<h3 id="existing-wb-project">
  Projet W\&B existant
</h3>

Pour importer des appels Weave compatibles que vous avez journalisés vous-même et qui ne possèdent pas d’identité de projet Model Distillation, définissez `source` sur un objet contenant `entity` et `project` dans la requête API, au lieu de la chaîne `"task"`. Cette source n’est pas disponible dans la boîte de dialogue de l’interface utilisateur.

<h3 id="uploaded-file">
  Fichier téléversé
</h3>

Pour importer des exemples qui n’ont jamais été consignés dans W\&B, téléversez un fichier JSONL via l’API. Model Distillation valide les lignes et crée le dataset à votre place. Voir [Téléverser un dataset](/fr/model-distillation/studio/datasets-upload).

<h2 id="sampling-and-split">
  Échantillonnage et répartition
</h2>

Quelle que soit la source choisie, les paramètres suivants déterminent le nombre de lignes du dataset et leur répartition entre entraînement et test.

* **Maximum traces** plafonne l’échantillon aléatoire après filtrage.
* **Train / test split** réserve des lignes de test pour les évaluations et les comparaisons de modèles. Les lignes restantes constituent les données d’entraînement. Par défaut, la répartition est de 90 % pour l’entraînement et de 10 % pour le test.

L’attribution à l’un ou l’autre ensemble est déterministe et s’effectue par groupe : scénario, run d’agent, conversation ou trace. Les exemples liés ne se retrouvent donc jamais à la fois dans l’ensemble d’entraînement et dans celui de test, et Model Distillation déduplique automatiquement les entrées.

<Note>
  Utilisez une plage de dates fixe. Avec une fenêtre glissante, une même configuration de dataset produirait par la suite des données d’entraînement différentes.
</Note>

<h2 id="inspect-and-filter-rows">
  Inspecter et filtrer les lignes
</h2>

L’atelier du dataset affiche les messages, la sortie d’origine, la sortie réétiquetée, la sortie du modèle de comparaison, les estimations de jetons, la répartition et les résultats d’évaluation de chaque ligne. Les filtres acceptent les critères suivants :

* Texte présent dans l’entrée ou dans la sortie d’origine
* Répartition d’entraînement ou de test
* Statut du réétiquetage
* Application ou non d’une évaluation

Supprimez les entrées non valides avant l’entraînement. La suppression d’une ligne ne modifie pas la trace source.

<h2 id="append-new-traffic">
  Ajouter du nouveau trafic
</h2>

Pour enrichir un dataset de manière incrémentielle, utilisez **Append** avec une plage fixe ultérieure. Model Distillation dédoublonne les entrées par trace et par tour de conversation. Chaque ajout incrémente la révision du dataset et rend obsolètes les résultats de réétiquetage ou d’évaluation antérieurs dont la couverture ne correspond plus.

<h2 id="what-is-excluded">
  Éléments exclus
</h2>

Les traces en erreur, les flux incomplets, les structures Chat Completions non valides et les traces dont le mappage de fidélité est incomplet ne peuvent pas servir à l’entraînement.

<h2 id="delete-a-dataset">
  Supprimer un dataset
</h2>

Vous pouvez supprimer un dataset dans l’interface utilisateur ou via l’API. Si des modèles fine-tunés ou des évaluations dépendent d’un dataset, vous pouvez le supprimer avec ses dépendances, mais pas seul.

Les fine-tunings en file d'attente ou en cours d’exécution, les modèles dont l’acheminement est actif et les évaluations actives bloquent la suppression jusqu’à ce qu’ils se terminent ou que vous les supprimiez. Une importation ou un run de réétiquetage en cours ne bloque pas la suppression. Il s’arrête au lot suivant, et Model Distillation ignore tous les résultats qui arrivent après le début de la suppression.

<Warning>
  Si vous supprimez un dataset avec ses dépendances, la suppression détruit également les artifacts d’entraînement des modèles fine-tunés dépendants, ainsi que tous les résultats qui utilisent ces modèles.
</Warning>

Pour supprimer un dataset dans l’interface utilisateur, suivez ces étapes :

1. Ouvrez les **Settings** du dataset et sélectionnez **Delete dataset**.
2. Si le dataset a des dépendances, sélectionnez **Also delete the dependent fine-tunes and affected evaluations** et examinez l’impact indiqué.
3. Pour confirmer, saisissez le nom du dataset.
4. Si le dataset a des dépendances, sélectionnez **Delete Dataset and Dependents**. Sinon, sélectionnez **Delete Dataset**.

Une fois la suppression confirmée, elle s’exécute en arrière-plan. Si elle échoue avant le début des opérations destructives, le dataset redevient disponible. Si elle échoue ensuite, le dataset reste verrouillé jusqu’à ce qu’une nouvelle tentative réussisse. Pour réessayer, confirmez à nouveau la suppression. Les nouvelles tentatives restent limitées à la portée enregistrée par la requête d’origine.

<Accordion title="API : Supprimer un jeu de données (DELETE /tasks/{alias}/datasets/{datasetId})">
  La suppression ne nécessite qu’une seule requête : le serveur détermine lui-même les dépendances et les éléments bloquants. Pour supprimer également les modèles fine-tunés dépendants et les évaluations concernées qui existent au moment où le serveur accepte la requête, définissez `cascade=true`. Sans ce paramètre, un dataset ayant des dépendances renvoie `409 Conflict` avec le type `dataset_in_use`. La requête suivante supprime un dataset avec ses dépendances :

  ```bash theme={"system"}
  curl --request DELETE \
    --url "https://distillation.training.wandb.ai/v1/tasks/ticket-classifier/datasets/$DATASET_ID?cascade=true" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team"
  ```

  La requête renvoie `202 Accepted` avec l’opération de suppression et son statut. Si vous répétez la requête, elle renvoie la même opération tant que celle-ci est en file d'attente, en cours d’exécution ou terminée. Une requête répétée relance également le nettoyage ayant échoué, dans la portée enregistrée par la requête d’origine. Si le dataset n’existe plus et qu’aucune opération n’est en cours, la requête renvoie `204 No Content`, et un `GET` sur le dataset renvoie `404 Not Found`.

  Pour prévisualiser les dépendances et les éléments bloquants avant la suppression, appelez `GET /tasks/{alias}/datasets/{datasetId}/deletion-plan`. Cet aperçu est fourni à titre informatif et indique également le statut d’une suppression en cours. Pour plus de détails, consultez les références [Supprimer un dataset](/fr/model-distillation/reference/management/datasets/delete-a-dataset) et [Prévisualiser la suppression d’un dataset](/fr/model-distillation/reference/management/datasets/preview-dataset-deletion).
</Accordion>

<Accordion title="API : Lister les jeux de données d’un projet (GET /tasks/{alias}/datasets)">
  Les agents peuvent récupérer les ID des datasets prêts avant de lancer un réétiquetage, un entraînement ou une évaluation :

  ```bash theme={"system"}
  curl --url "https://distillation.training.wandb.ai/v1/tasks/ticket-classifier/datasets" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team"
  ```

  Pour créer des données ou en ajouter, utilisez la requête prête à copier dans [Démarrage rapide des Datasets](/fr/model-distillation/studio/datasets-quickstart). Pour plus de détails sur cette opération, consultez la référence [Lister les datasets](/fr/model-distillation/reference/management/datasets/list-datasets).
</Accordion>
