> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Démarrage rapide de Datasets

> Créez un dataset reproductible à partir du trafic d’un projet et examinez ses lignes d’entraînement et de test.

Ce guide de démarrage rapide vous montre comment construire un dataset à partir des traces déjà enregistrées par un projet. Vous obtenez ainsi un ensemble de lignes d’entraînement et de test destinées au réétiquetage, au fine-tuning et aux évaluations.

<Note>
  Avant de commencer, faites transiter un trafic représentatif par le projet. L’interface utilisateur construit les datasets à partir des traces du projet lui-même. Pour construire un dataset à partir d’appels W\&B Weave journalisés en dehors du projet, utilisez la source API décrite dans [Datasets](/fr/model-distillation/studio/datasets#choose-a-source). Pour en construire un à partir d’un fichier JSONL dont vous disposez déjà, consultez [Téléverser un dataset](/fr/model-distillation/studio/datasets-upload).
</Note>

<Steps>
  <Step title="Ouvrir le projet">
    Sélectionnez le projet que vous souhaitez améliorer, ouvrez **Datasets**, puis sélectionnez **New Dataset**.
  </Step>

  <Step title="Nommer le dataset">
    Dans **Dataset name**, conservez le nom généré ou saisissez le vôtre. Le dataset est un instantané autonome des traces journalisées dans ce projet sur W\&B Weave.
  </Step>

  <Step title="Choisir les données sources">
    Sous **Source data**, configurez les champs suivants :

    * **Project version :** la version dont le prompt et le mode d’acheminement ont produit les traces souhaitées. Par défaut, l’interface utilisateur sélectionne la dernière version.
    * **Served by :** le modèle dont les réponses servent de cibles d’entraînement. Pour que les données d’entraînement proviennent uniquement du modèle enseignant, sélectionnez celui-ci. **All models** mélange les sorties de tous les modèles ayant servi la version, y compris tout modèle étudiant affiné.
    * **After (UTC)** et **Before (UTC) :** la fenêtre temporelle fixe dans laquelle sélectionner les traces. L’interface utilisateur préremplit les 14 derniers jours sous forme d’horodatages fixes.
    * **Maximum traces :** la taille de l’échantillon aléatoire après filtrage. La valeur par défaut est de 20 000 et le maximum de 100 000. Chaque trace sélectionnée devient une entrée du dataset.
  </Step>

  <Step title="Définir la répartition entraînement/test">
    Pour choisir le nombre de lignes à réserver aux évaluations, utilisez le curseur **Train / test split**. Par défaut, la répartition est de 90 % pour l’entraînement et 10 % pour le test. Chaque trace complète reste dans une seule partition, afin que les évaluations ne contiennent pas de quasi-doublons issus de l’entraînement.
  </Step>

  <Step title="Créer et examiner">
    Sélectionnez **Create Dataset** et attendez que le statut passe à **Ready**. Examinez plusieurs lignes d’entraînement et de test, vérifiez la fidélité des messages et des sorties, et supprimez les entrées inutilisables avant l’entraînement.
  </Step>
</Steps>

Le dataset est maintenant prêt pour le [réétiquetage](/fr/model-distillation/studio/relabeling), le [fine-tuning](/fr/model-distillation/studio/fine-tuning-quickstart) et les [évaluations](/fr/model-distillation/studio/evaluations-quickstart).

<Accordion title="API : créer un dataset (POST /tasks/{alias}/datasets)">
  Utilisez des horodatages fixes afin que chaque réexécution de votre flux de travail porte sur la même fenêtre source. L’objet `filters` correspond aux champs **Source data** de l’interface utilisateur : `task_version` est la version du projet, et `resolved_provider` associé à `resolved_model` désigne le modèle **Served by**. Pour inclure tous les modèles, omettez ces deux clés :

  ```bash theme={"system"}
  curl --request POST \
    --url "https://distillation.training.wandb.ai/v1/tasks/ticket-classifier/datasets" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team" \
    --header "Content-Type: application/json" \
    --data '{
      "name": "recent-production",
      "params": {
        "query": {
          "source": "task",
          "after": "2026-08-01T00:00:00.000Z",
          "before": "2026-09-01T00:00:00.000Z",
          "filters": {
            "task_version": 1,
            "resolved_provider": "openai",
            "resolved_model": "gpt-5.6-sol"
          }
        },
        "sampling": {"strategy": "random", "limit": 20000},
        "split": {"val": 0.1, "by": "trace"}
      }
    }'
  ```

  La réponse contient l’ID du dataset. Interrogez régulièrement la ressource du dataset jusqu’à ce que `status` soit `ready`. Pour plus de détails, consultez [Créer un dataset](/fr/model-distillation/reference/management/datasets/create-a-dataset).
</Accordion>
