Recueillir du feedback et utiliser des annotations
Recueillir et analyser le feedback sur les applications LLM via l’interface utilisateur et le SDK
L’évaluation des applications LLM nécessite des outils permettant de recueillir et d’analyser le feedback. W&B Weave propose un système de feedback intégré qui vous permet de fournir du feedback sur les appels directement dans l’interface utilisateur, ou par programmation via le SDK. Weave prend en charge plusieurs types de feedback, notamment les réactions emoji, les commentaires textuels et les données structurées, afin que votre équipe puisse :
Constituer des jeux de données d’évaluation pour le monitoring des performances.
Identifier et résoudre les problèmes liés au contenu généré par les LLM.
Rassembler des exemples pour des tâches avancées comme le fine-tuning.
Ce guide s’adresse aux développeurs et aux relecteurs qui travaillent sur des applications LLM dans Weave. Il explique comment utiliser les fonctionnalités de feedback de Weave dans l’interface utilisateur et dans le SDK, comment interroger et gérer le feedback, et comment utiliser les annotations humaines pour des évaluations approfondies.
Les sections suivantes expliquent comment fournir du feedback dans l’interface utilisateur de Weights & Biases, soit depuis le panneau des détails de l’appel, soit à l’aide des icônes de feedback.
Dans la barre latérale du projet Weave, accédez à Traces.
Trouvez la ligne correspondant à l’appel auquel vous souhaitez ajouter du feedback.
Cliquez sur le lien portant le nom de la trace pour ouvrir l’arborescence de trace et le panneau des détails de l’appel.
Dans la barre d’onglets des détails de l’appel, sélectionnez Feedback.
Ajoutez, affichez ou supprimez du feedback :
Ajoutez et affichez du feedback à l’aide des icônes situées dans le coin supérieur droit de la vue Feedback des détails de l’appel.
Affichez et supprimez du feedback depuis le tableau Feedback des détails de l’appel. Pour supprimer un feedback, cliquez sur l’icône de corbeille dans la dernière colonne à droite de la ligne de feedback concernée.
Vous pouvez ajouter ou supprimer une réaction, ainsi qu’ajouter une note, à l’aide des icônes situées à la fois dans le tableau des traces et dans le panneau des détails de chaque appel.
Tableau des traces : dans la colonne Feedback de la ligne concernée du tableau Traces.
Panneau des détails de l’appel : dans le coin supérieur droit de chaque panneau des détails de l’appel.
Pour ajouter une réaction :
Cliquez sur l’icône emoji.
Ajoutez un pouce levé ou un pouce baissé, ou cliquez sur l’icône + pour afficher d’autres emojis.
Utilisez le SDK pour automatiser la collecte de feedback ou l’intégrer à des pipelines d’évaluation, plutôt que de saisir le feedback manuellement dans l’interface utilisateur.Vous trouverez des exemples d’utilisation du SDK pour le feedback dans l’interface utilisateur, sous l’onglet Use du panneau des détails de l’appel.Le SDK Python de Weave vous permet d’ajouter, de supprimer et d’interroger le feedback des appels par programmation. Le SDK TypeScript ne prend pas en charge le feedback.
Vous pouvez interroger le feedback de votre projet Weave à l’aide du SDK. Le SDK prend en charge les opérations de requête de feedback suivantes :
client.get_feedback() : renvoie l’ensemble du feedback d’un projet.
client.get_feedback("[FEEDBACK-UUID]") : renvoie, sous forme de collection, l’objet de feedback désigné par [FEEDBACK-UUID].
client.get_feedback(reaction="[REACTION-TYPE]") : renvoie tous les objets de feedback correspondant à un type de réaction donné.
Vous pouvez également obtenir des informations supplémentaires sur chaque objet de feedback renvoyé par client.get_feedback() :
id : l’ID de l’objet de feedback.
created_at : la date de création de l’objet de feedback.
feedback_type : le type de feedback (réaction, note, personnalisé).
payload : la charge utile du feedback.
Python
TypeScript
import weaveclient = weave.init('intro-example')# Obtenir l'ensemble du feedback d'un projetall_feedback = client.get_feedback()# Récupérer un objet de feedback précis à partir de son id.# L'API renvoie une collection, qui doit contenir au plus un élément.one_feedback = client.get_feedback("[FEEDBACK-UUID]")[0]# Trouver tous les objets de feedback ayant une réaction donnée. Vous pouvez spécifier offset et limit.thumbs_up = client.get_feedback(reaction="👍", limit=10)# Une fois les objets récupérés, afficher les détails de chaque objet de feedback.for f in client.get_feedback(): print(f.id) print(f.created_at) print(f.feedback_type) print(f.payload)
Cette fonctionnalité n'est pas encore disponible en TypeScript.
Vous pouvez ajouter du feedback à un Appel à l’aide de son UUID. Pour obtenir un Appel précis à partir de son UUID, récupérez celui-ci pendant ou après l’exécution de l’Appel. Le SDK prend en charge les opérations suivantes pour ajouter du feedback à un Appel :
call.feedback.add_reaction("[REACTION-TYPE]") : ajoute l’une des valeurs [REACTION-TYPE] prises en charge (emojis), comme 👍.
call.feedback.add_note("[NOTE]") : ajoute une note.
call.feedback.add("[LABEL]", [OBJECT]) : ajoute un [OBJECT] de feedback personnalisé identifié par [LABEL].
Une note de feedback ne peut pas dépasser 1 024 caractères. Si une note dépasse cette limite, Weave ne la crée pas.
Python
TypeScript
import weaveclient = weave.init('intro-example')call = client.get_call("[CALL-UUID]")# Ajout d’une réaction emojicall.feedback.add_reaction("👍")# Ajout d’une notecall.feedback.add_note("this is a note")# Ajout de paires clé/valeur personnalisées.# Le premier argument est une chaîne « type » définie par l’utilisateur.# Le feedback doit être sérialisable en JSON et peser moins de 1 Ko une fois sérialisé.call.feedback.add("correctness", { "value": 5 })
Cette fonctionnalité n’est pas encore disponible en TypeScript.
Si vous devez ajouter du feedback juste après un Appel, vous pouvez récupérer l’UUID de l’Appel par programmation, pendant ou après son exécution.Pour récupérer l’UUID pendant l’exécution de l’appel, obtenez l’appel en cours, puis renvoyez son ID.
Python
TypeScript
import weaveweave.init("uuid")@weave.op()def simple_operation(input_value): # Effectuer une opération simple output = f"Processed {input_value}" # Obtenir l'ID de l'appel en cours current_call = weave.require_current_call() call_id = current_call.id return output, call_id
Cette fonctionnalité n'est pas encore disponible en TypeScript.
Vous pouvez également utiliser la méthode call() pour exécuter l’opération et récupérer l’ID une fois l’appel exécuté :
Python
TypeScript
import weaveweave.init("uuid")@weave.op()def simple_operation(input_value): return f"Processed {input_value}"# Exécuter l'opération, puis récupérer le résultat et l'ID de l'appelresult, call = simple_operation.call("example input")call_id = call.id
Cette fonctionnalité n'est pas encore disponible en TypeScript.
Les annotations humaines vous permettent de capturer des jugements structurés et vérifiés par des humains sur les appels, afin que les réviseurs puissent évaluer la sortie du modèle selon vos propres critères.Les annotations humaines sont prises en charge dans l’interface utilisateur de Weights & Biases. Cette fonctionnalité vous permet de créer des champs personnalisés pour ajouter à vos traces des données saisies manuellement, sous forme de feedback. Pour réaliser des annotations humaines, vous devez d’abord créer un évaluateur d’annotation humaine, soit dans l’interface utilisateur, soit à l’aide de l’API. Vous pouvez ensuite utiliser l’évaluateur dans l’interface utilisateur pour réaliser des annotations et modifier vos évaluateurs d’annotation à l’aide de l’API.
Créer un évaluateur d’annotation humaine dans l’interface utilisateur
Pour créer un évaluateur d’annotation humaine dans l’interface utilisateur, procédez comme suit :
Dans la barre latérale du projet, accédez à Assets.
Dans le panneau de navigation Assets, cliquez sur Scorers.
Dans l’en-tête du panneau Scorers, cliquez sur New scorer.
Dans la boîte de dialogue modale Create Scorer, renseignez les champs suivants :
Scorer type : Human annotation
Name
Description
Type, qui détermine le type de feedback à recueillir, par exemple boolean ou integer.
Cliquez sur Create scorer. Vous pouvez désormais utiliser votre évaluateur pour créer des annotations.
Dans l’exemple suivant, un annotateur humain indique le type de document chargé par le LLM. Le Type de la configuration du score est un enum qui contient les types de documents possibles.
Utiliser l’évaluateur d’annotation humaine dans l’interface utilisateur
Une fois que vous avez créé un évaluateur d’annotation humaine, vous pouvez l’utiliser sur la page Traces.Pour utiliser l’évaluateur, procédez comme suit :
Dans la barre latérale du projet, accédez à Traces.
Repérez la ligne de l’appel auquel vous souhaitez ajouter une annotation humaine.
Cliquez sur le lien portant le nom de la trace pour ouvrir l’arborescence de trace et le panneau des détails de l’appel.
Dans le coin supérieur droit de la barre d’onglets des détails de l’appel, cliquez sur le bouton Show feedback.Les évaluateurs d’annotation humaine disponibles s’affichent dans un panneau Annotate.
Saisissez votre annotation.
Cliquez sur Save.
Dans la barre d’onglets du panneau des détails de l’appel, cliquez sur l’onglet Feedback pour afficher le tableau Feedback. La nouvelle annotation y apparaît. Vous pouvez également consulter les annotations dans la colonne Annotations du tableau Traces principal.
Actualisez le tableau Traces pour afficher les informations les plus récentes.
Créer un évaluateur d’annotation humaine à l’aide de l’API
Vous pouvez également créer des évaluateurs d’annotation humaine via l’API. Chaque évaluateur est un objet à part entière, que vous créez et mettez à jour séparément. Pour créer un évaluateur d’annotation humaine par programmation, procédez comme suit :
Importez la classe AnnotationSpec depuis weave.flow.annotation_spec.
Utilisez la méthode publish de weave pour créer l’évaluateur.
L’exemple suivant crée deux évaluateurs. Le premier, Temperature, évalue la température perçue de l’appel LLM. Le second, Tone, évalue le ton de la réponse du LLM. Chaque évaluateur est enregistré (save) avec un ID d’objet associé (temperature-scorer et tone-scorer).
Python
TypeScript
import weavefrom weave.flow.annotation_spec import AnnotationSpecclient = weave.init("feedback-example")spec1 = AnnotationSpec( name="Temperature", description="The perceived temperature of the llm call", field_schema={ "type": "number", "minimum": -1, "maximum": 1, })spec2 = AnnotationSpec( name="Tone", description="The tone of the llm response", field_schema={ "type": "string", "enum": ["Aggressive", "Neutral", "Polite", "N/A"], },)weave.publish(spec1, "temperature-scorer")weave.publish(spec2, "tone-scorer")
Cette fonctionnalité n’est pas encore disponible en TypeScript.
Modifier un évaluateur d’annotation humaine à l’aide de l’API
Dans le prolongement de la section Créer un évaluateur d’annotation humaine à l’aide de l’API, l’exemple suivant crée une nouvelle version de l’évaluateur Temperature en réutilisant l’ID d’objet d’origine (temperature-scorer) lors de l’appel à publish. Vous obtenez ainsi un objet mis à jour, accompagné de l’historique de toutes ses versions.
Vous pouvez consulter l’historique des objets d’évaluateur d’annotation humaine dans l’onglet Scorers, sous Human annotations.
Python
TypeScript
import weavefrom weave.flow.annotation_spec import AnnotationSpecclient = weave.init("feedback-example")# créer une nouvelle version de l'évaluateurspec1 = AnnotationSpec( name="Temperature", description="The perceived temperature of the llm call", field_schema={ "type": "integer", # <<- remplacer le type par integer "minimum": -1, "maximum": 1, })weave.publish(spec1, "temperature-scorer")
Cette fonctionnalité n'est pas encore disponible en TypeScript.
Utiliser un évaluateur d’annotation humaine à l’aide de l’API
L’API de feedback vous permet d’utiliser un évaluateur d’annotation humaine en spécifiant un nom construit selon un format particulier ainsi qu’un champ annotation_ref. Vous pouvez obtenir la valeur annotation_spec_ref depuis l’interface utilisateur en sélectionnant l’onglet correspondant, ou lors de la création de l’AnnotationSpec.