Quand le réétiquetage est utile
Réétiquetez lorsque la sortie du modèle en production ne correspond pas au comportement que vous souhaitez faire apprendre au modèle élève, par exemple :- Un modèle plus performant peut corriger des réponses médiocres ou incohérentes.
- Les instructions ou les exigences de sortie structurée ont été modifiées.
- Les données de production contiennent des entrées acceptables, mais des étiquettes bruitées.
- Vous souhaitez comparer deux modèles enseignants avant l’entraînement.
Choisir une stratégie de réétiquetage
Les sections suivantes décrivent les deux stratégies de réétiquetage.Régénérer les sorties
Le modèle reçoit chaque requête exactement telle que le modèle d’origine l’a reçue, mais sans la sortie existante. Il produit ensuite une nouvelle réponse. Utilisez cette stratégie lorsque vous souhaitez obtenir un comportement différent du modèle, par exemple avec un modèle enseignant plus performant ou un modèle qui suit des instructions mises à jour.Créer des sorties révisées
Le modèle reçoit comme contexte la réponse d’origine et vos instructions de réétiquetage, puis produit une version corrigée. Utilisez cette stratégie lorsque les sorties d’origine sont globalement correctes et que vous souhaitez apporter des corrections ciblées qui préservent leur intention, leur style, leur structure et leurs décisions d’utilisation d’outils. Les runs révisés acceptent deux paramètres supplémentaires :- Instructions de réétiquetage : indiquent comment le modèle doit traiter la sortie d’origine. Par défaut, le modèle considère l’original comme correct, sauf s’il contient une erreur manifeste et significative. Dans ce cas, le modèle applique la correction minimale qui préserve l’intention, le style, la structure et la décision d’utilisation d’outils de l’original. Les instructions peuvent contenir jusqu’à 20 000 caractères.
- Conversations de référence : conversations complètes sélectionnées aléatoirement dans le split d’entraînement, qui fournissent des exemples de la tâche. Chaque requête inclut ces conversations. La valeur par défaut est de 10 et le maximum de 50. Pour les omettre, utilisez 0. L’interface affiche une estimation du nombre de jetons d’entrée supplémentaires par requête. Les exemples forment un préfixe stable que les fournisseurs peuvent mettre en cache.
Exécuter un réétiquetage
Pour exécuter un réétiquetage, procédez comme suit :- Sur la page Datasets du projet, sélectionnez un dataset prêt.
- Sélectionnez Relabel. Sous Relabel with…, choisissez un modèle.
- Choisissez une Relabeling strategy.
- Pour Create revised outputs, vérifiez le nombre de conversations de référence et les instructions de réétiquetage.
- Facultatif : si vous avez publié la révision du dataset dans W&B Weave, sélectionnez Publish outputs to Weave pour publier les sorties finalisées à côté de celle-ci.
- Pour démarrer le run de réétiquetage, sélectionnez Relabel dataset.
- Comparez côte à côte les sorties d’origine et les sorties réétiquetées.
- Filtrez les lignes inchangées ou en erreur.
- Sélectionnez le run de réétiquetage comme sortie d’entraînement lors de la création d’un modèle affiné.
- Utilisez-le comme référence principale dans une évaluation comparative.
API : réétiqueter un jeu de données (POST /tasks/{alias}/datasets/{datasetId}/relabels)
API : réétiqueter un jeu de données (POST /tasks/{alias}/datasets/{datasetId}/relabels)
Remplacez l’ID du dataset et choisissez n’importe quel modèle de fournisseur enregistré. Pour régénérer les sorties :Pour créer des sorties révisées, définissez Pour publier les sorties finalisées vers Weave à côté de la révision publiée du dataset, ajoutez
use_original_output sur true. Vous pouvez omettre instructions et reference_conversation_count pour utiliser les valeurs par défaut décrites précédemment :"publish_to_weave": true à l’une ou l’autre requête.La réponse contient l’ID du run de réétiquetage et son statut. Voir Démarrer un run de réétiquetage.Réutiliser une stratégie pour les nouvelles lignes
Après avoir ajouté du trafic à un dataset réétiqueté, vous pouvez réutiliser une stratégie de réétiquetage existante pour ne réétiqueter que les nouvelles lignes. Les runs de réétiquetage existants ne couvrent que la révision précédente : leurs sorties sont donc absentes pour les nouvelles lignes, et ces runs deviennent obsolètes. L’interface regroupe en une seule stratégie de réétiquetage les runs de réétiquetage qui partagent le même modèle, la même stratégie, les mêmes instructions et le même nombre de conversations de référence. Le menu Active outputs du dataset répertorie les stratégies par modèle, sous les libellés Regenerate ou Revise v0, Revise v1, etc. Pour réétiqueter les nouvelles lignes, sélectionnez la stratégie dans le menu Active outputs. L’interface indique le nombre de lignes manquantes, conserve les sorties existantes et ne génère des sorties que pour les nouvelles lignes.API : appliquer une stratégie aux nouvelles lignes (POST /tasks/{alias}/datasets/{datasetId}/relabels/{relabelRunId}/apply-missing)
API : appliquer une stratégie aux nouvelles lignes (POST /tasks/{alias}/datasets/{datasetId}/relabels/{relabelRunId}/apply-missing)
Transmettez l’ID d’un run de réétiquetage terminé ou obsolète :Model Distillation crée un nouveau run pour la révision actuelle du dataset, réutilise les sorties existantes et ne génère que celles qui manquent. La requête renvoie
202 Accepted avec le nouveau run. Voir Appliquer une stratégie de réétiquetage aux nouvelles lignes.