Créer votre premier dataset
Suivez le guide étape par étape, de la sélection de la source à l’inspection des lignes.
Choisir une source
L’interface utilisateur construit les datasets à partir du trafic du projet lui-même. L’API accepte également comme source un projet W&B existant ou un fichier JSONL que vous téléversez. Les sections suivantes décrivent ces trois options.Trafic du projet
Si le trafic a été enregistré par le proxy, utilisez les traces du projet actuel. Dans l’interface utilisateur, la section Source data de la boîte de dialogue Create Dataset vous permet de choisir les paramètres suivants :- Project version : fige le prompt et le régime d’acheminement utilisés pour sélectionner les traces.
- Served by : ne conserve que les traces servies par un modèle donné. Pour que les données d’entraînement proviennent uniquement du modèle enseignant, sélectionnez ce dernier. All models mélange les sorties de tous les modèles ayant servi la version.
- After (UTC) et Before (UTC) : une fenêtre temporelle fixe. L’interface utilisateur préremplit les 14 derniers jours sous forme d’horodatages fixes.
- Maximum traces : la taille de l’échantillon aléatoire après filtrage. La valeur par défaut est de 20 000 et le maximum de 100 000.
filters accepte également des métadonnées de trace scalaires. Les lectures depuis une source de projet s’appuient sur les Agent Spans attribués au projet et reconstituent à l’identique la requête et la réponse Chat Completions, au format du fournisseur.
Projet W&B existant
Pour importer des appels Weave compatibles que vous avez journalisés vous-même et qui ne possèdent pas d’identité de projet Model Distillation, définissezsource sur un objet contenant entity et project dans la requête API, au lieu de la chaîne "task". Cette source n’est pas disponible dans la boîte de dialogue de l’interface utilisateur.
Fichier téléversé
Pour importer des exemples qui n’ont jamais été consignés dans W&B, téléversez un fichier JSONL via l’API. Model Distillation valide les lignes et crée le dataset à votre place. Voir Téléverser un dataset.Échantillonnage et répartition
Quelle que soit la source choisie, les paramètres suivants déterminent le nombre de lignes du dataset et leur répartition entre entraînement et test.- Maximum traces plafonne l’échantillon aléatoire après filtrage.
- Train / test split réserve des lignes de test pour les évaluations et les comparaisons de modèles. Les lignes restantes constituent les données d’entraînement. Par défaut, la répartition est de 90 % pour l’entraînement et de 10 % pour le test.
Utilisez une plage de dates fixe. Avec une fenêtre glissante, une même configuration de dataset produirait par la suite des données d’entraînement différentes.
Inspecter et filtrer les lignes
L’atelier du dataset affiche les messages, la sortie d’origine, la sortie réétiquetée, la sortie du modèle de comparaison, les estimations de jetons, la répartition et les résultats d’évaluation de chaque ligne. Les filtres acceptent les critères suivants :- Texte présent dans l’entrée ou dans la sortie d’origine
- Répartition d’entraînement ou de test
- Statut du réétiquetage
- Application ou non d’une évaluation
Ajouter du nouveau trafic
Pour enrichir un dataset de manière incrémentielle, utilisez Append avec une plage fixe ultérieure. Model Distillation dédoublonne les entrées par trace et par tour de conversation. Chaque ajout incrémente la révision du dataset et rend obsolètes les résultats de réétiquetage ou d’évaluation antérieurs dont la couverture ne correspond plus.Éléments exclus
Les traces en erreur, les flux incomplets, les structures Chat Completions non valides et les traces dont le mappage de fidélité est incomplet ne peuvent pas servir à l’entraînement.Supprimer un dataset
Vous pouvez supprimer un dataset dans l’interface utilisateur ou via l’API. Si des modèles fine-tunés ou des évaluations dépendent d’un dataset, vous pouvez le supprimer avec ses dépendances, mais pas seul. Les fine-tunings en file d’attente ou en cours d’exécution, les modèles dont l’acheminement est actif et les évaluations actives bloquent la suppression jusqu’à ce qu’ils se terminent ou que vous les supprimiez. Une importation ou un run de réétiquetage en cours ne bloque pas la suppression. Il s’arrête au lot suivant, et Model Distillation ignore tous les résultats qui arrivent après le début de la suppression. Pour supprimer un dataset dans l’interface utilisateur, suivez ces étapes :- Ouvrez les Settings du dataset et sélectionnez Delete dataset.
- Si le dataset a des dépendances, sélectionnez Also delete the dependent fine-tunes and affected evaluations et examinez l’impact indiqué.
- Pour confirmer, saisissez le nom du dataset.
- Si le dataset a des dépendances, sélectionnez Delete Dataset and Dependents. Sinon, sélectionnez Delete Dataset.
API : Supprimer un jeu de données (DELETE /tasks/{alias}/datasets/{datasetId})
API : Supprimer un jeu de données (DELETE /tasks/{alias}/datasets/{datasetId})
La suppression ne nécessite qu’une seule requête : le serveur détermine lui-même les dépendances et les éléments bloquants. Pour supprimer également les modèles fine-tunés dépendants et les évaluations concernées qui existent au moment où le serveur accepte la requête, définissez La requête renvoie
cascade=true. Sans ce paramètre, un dataset ayant des dépendances renvoie 409 Conflict avec le type dataset_in_use. La requête suivante supprime un dataset avec ses dépendances :202 Accepted avec l’opération de suppression et son statut. Si vous répétez la requête, elle renvoie la même opération tant que celle-ci est en file d’attente, en cours d’exécution ou terminée. Une requête répétée relance également le nettoyage ayant échoué, dans la portée enregistrée par la requête d’origine. Si le dataset n’existe plus et qu’aucune opération n’est en cours, la requête renvoie 204 No Content, et un GET sur le dataset renvoie 404 Not Found.Pour prévisualiser les dépendances et les éléments bloquants avant la suppression, appelez GET /tasks/{alias}/datasets/{datasetId}/deletion-plan. Cet aperçu est fourni à titre informatif et indique également le statut d’une suppression en cours. Pour plus de détails, consultez les références Supprimer un dataset et Prévisualiser la suppression d’un dataset.API : Lister les jeux de données d’un projet (GET /tasks/{alias}/datasets)
API : Lister les jeux de données d’un projet (GET /tasks/{alias}/datasets)
Les agents peuvent récupérer les ID des datasets prêts avant de lancer un réétiquetage, un entraînement ou une évaluation :Pour créer des données ou en ajouter, utilisez la requête prête à copier dans Démarrage rapide des Datasets. Pour plus de détails sur cette opération, consultez la référence Lister les datasets.