Skip to main content
Ce guide de démarrage rapide vous montre comment construire un dataset à partir des traces déjà enregistrées par un projet. Vous obtenez ainsi un ensemble de lignes d’entraînement et de test destinées au réétiquetage, au fine-tuning et aux évaluations.
Avant de commencer, faites transiter un trafic représentatif par le projet. L’interface utilisateur construit les datasets à partir des traces du projet lui-même. Pour construire un dataset à partir d’appels W&B Weave journalisés en dehors du projet, utilisez la source API décrite dans Datasets. Pour en construire un à partir d’un fichier JSONL dont vous disposez déjà, consultez Téléverser un dataset.
1

Ouvrir le projet

Sélectionnez le projet que vous souhaitez améliorer, ouvrez Datasets, puis sélectionnez New Dataset.
2

Nommer le dataset

Dans Dataset name, conservez le nom généré ou saisissez le vôtre. Le dataset est un instantané autonome des traces journalisées dans ce projet sur W&B Weave.
3

Choisir les données sources

Sous Source data, configurez les champs suivants :
  • Project version : la version dont le prompt et le mode d’acheminement ont produit les traces souhaitées. Par défaut, l’interface utilisateur sélectionne la dernière version.
  • Served by : le modèle dont les réponses servent de cibles d’entraînement. Pour que les données d’entraînement proviennent uniquement du modèle enseignant, sélectionnez celui-ci. All models mélange les sorties de tous les modèles ayant servi la version, y compris tout modèle étudiant affiné.
  • After (UTC) et Before (UTC) : la fenêtre temporelle fixe dans laquelle sélectionner les traces. L’interface utilisateur préremplit les 14 derniers jours sous forme d’horodatages fixes.
  • Maximum traces : la taille de l’échantillon aléatoire après filtrage. La valeur par défaut est de 20 000 et le maximum de 100 000. Chaque trace sélectionnée devient une entrée du dataset.
4

Définir la répartition entraînement/test

Pour choisir le nombre de lignes à réserver aux évaluations, utilisez le curseur Train / test split. Par défaut, la répartition est de 90 % pour l’entraînement et 10 % pour le test. Chaque trace complète reste dans une seule partition, afin que les évaluations ne contiennent pas de quasi-doublons issus de l’entraînement.
5

Créer et examiner

Sélectionnez Create Dataset et attendez que le statut passe à Ready. Examinez plusieurs lignes d’entraînement et de test, vérifiez la fidélité des messages et des sorties, et supprimez les entrées inutilisables avant l’entraînement.
Le dataset est maintenant prêt pour le réétiquetage, le fine-tuning et les évaluations.
Utilisez des horodatages fixes afin que chaque réexécution de votre flux de travail porte sur la même fenêtre source. L’objet filters correspond aux champs Source data de l’interface utilisateur : task_version est la version du projet, et resolved_provider associé à resolved_model désigne le modèle Served by. Pour inclure tous les modèles, omettez ces deux clés :
La réponse contient l’ID du dataset. Interrogez régulièrement la ressource du dataset jusqu’à ce que status soit ready. Pour plus de détails, consultez Créer un dataset.
Dernière modification le 30 septembre 2026