Les moniteurs personnalisés constituent l’ancienne approche de surveillance du trafic de production. Pour toute nouvelle mise en œuvre, utilisez Signals dans Weave for Agents. Voir Afficher les signaux d’agent.
Signaux et moniteurs personnalisés
Utilisez les signaux, des évaluateurs automatisés prédéfinis pour les traces de production, pour mettre rapidement en place la surveillance en production, puis ajoutez des moniteurs personnalisés pour les critères d’évaluation propres à votre application.Créer un moniteur dans Weave
Pour créer un moniteur personnalisé dans Weave :- Ouvrez l’interface utilisateur de Weights & Biases, puis ouvrez votre projet Weights & Biases.
- Dans la barre latérale de Weave, sélectionnez Moniteurs, puis cliquez sur le bouton + New Moniteur. La boîte de dialogue modale Create new moniteur s’ouvre.
-
Dans le menu Create new moniteur, configurez les champs suivants :
- Name : doit commencer par une lettre ou un chiffre. Peut contenir des lettres, des chiffres, des traits d’union et des caractères de soulignement.
- Description (facultatif) : décrivez le rôle du moniteur.
- Bouton bascule Active moniteur : activez ou désactivez le moniteur.
- Calls to moniteur :
- Operations : choisissez un ou plusieurs
@weave.opà surveiller. Vous devez journaliser au moins une trace utilisant l’op pour qu’il apparaisse dans la liste des ops disponibles. - Filter (facultatif) : restreignez les appels éligibles (par exemple, selon
max_tokensoutop_p). - Sampling rate : le pourcentage d’appels à évaluer (de 0 % à 100 %).
- Operations : choisissez un ou plusieurs
- LLM-as-a-judge configuration :
- Scorer name : doit commencer par une lettre ou un chiffre. Peut contenir des lettres, des chiffres, des traits d’union et des caractères de soulignement.
- Score Audio : filtre les modèles LLM disponibles pour n’afficher que ceux qui prennent en charge l’audio, et ouvre le champ Media Scoring JSON Paths.
- Score Images : filtre les modèles LLM disponibles pour n’afficher que ceux qui prennent en charge les images, et ouvre le champ Media Scoring JSON Paths.
- Judge model : sélectionnez le modèle chargé d’évaluer vos ops. Le menu contient les modèles LLM commerciaux que vous avez configurés dans votre compte CoreWeave Forge, ainsi que les modèles Serverless Inference. Les modèles prenant en charge l’audio affichent une étiquette Audio Input à côté de leur nom. Pour le modèle sélectionné, configurez les paramètres suivants :
- Configuration name : un nom pour cette configuration de modèle.
- System prompt : définit le rôle et la persona du modèle juge, par exemple « You are an impartial AI judge. »
- Response format : le format dans lequel le juge produit sa réponse, par exemple
json_objectoutextbrut. - Scoring prompt : la tâche d’évaluation appliquée à vos ops. Vous pouvez référencer des variables de prompt issues de vos ops dans vos prompts d’évaluation. Par exemple : « Évaluez si
{output}est exact au regard de{ground_truth}. »
- Media Scoring JSON Paths : spécifiez des expressions JSONPath (RFC 9535) pour extraire les médias de vos données de trace. Si vous ne spécifiez aucun chemin, le moniteur inclut tous les médias évaluables des messages utilisateur. Ce champ apparaît lorsque vous activez Score Audio ou Score Images.
- Une fois les champs du moniteur configurés, sélectionnez Create moniteur. Le moniteur est alors ajouté à votre projet Weights & Biases. Dès que votre code commence à générer des traces, vous pouvez consulter les scores dans l’onglet Traces en sélectionnant le nom du moniteur, puis en examinant les données dans le panneau qui s’affiche.
feedback de l’objet Call.
Exemple : créer un moniteur de véracité
L’exemple de bout en bout suivant explique comment créer un moniteur qui évalue la véracité d’affirmations générées. À la fin, vous disposerez d’un moniteur actif qui évalue un op d’exemple dans votre projet Weave, et les traces évaluées seront visibles dans l’interface Weights & Biases.- Définissez une fonction qui génère des affirmations, dont certaines sont vraies et d’autres non :
- Python
- TypeScript
- Exécutez la fonction au moins une fois pour journaliser une trace dans votre projet. L’op pourra ainsi être surveillé dans l’interface Weights & Biases.
- Ouvrez votre projet dans l’interface Weights & Biases et sélectionnez Monitors dans la barre latérale, puis New Monitor.
-
Dans le menu Create new monitor, renseignez les champs avec les valeurs suivantes :
- Name :
truthfulness-monitor - Description :
Evaluates the truthfulness of generated statements. - Active monitor : basculez sur on.
- Operations : sélectionnez
generate_statement. - Sampling rate : définissez la valeur sur
100%pour évaluer chaque appel. - Scorer name :
truthfulness-scorer - Judge model :
o3-mini-2025-01-31 - System prompt :
You are an impartial AI judge. Your task is to evaluate the truthfulness of statements. - Response format :
json_object - Scoring prompt :
- Name :
- Sélectionnez Create monitor. Le moniteur est alors ajouté à votre projet Weave.
- Dans votre script, appelez votre fonction avec des affirmations plus ou moins véridiques pour tester la fonction de score :
- Python
- TypeScript
- Après avoir exécuté le script avec plusieurs affirmations différentes, ouvrez l’interface Weights & Biases et accédez à l’onglet Traces. Sélectionnez une trace LLMAsAJudgeScorer.score pour afficher les résultats.
Vous disposez désormais d’un moniteur de véracité opérationnel qui évalue chaque invocation de generate_statement et stocke les résultats aux côtés de la trace d’origine, prêts à être analysés et comparés dans l’interface de Weights & Biases.