Skip to main content
W&B Weave est une plateforme d’observabilité et d’évaluation conçue pour créer des agents et des applications LLM fiables. Weave vous aide à comprendre ce que fait votre application d’IA, à mesurer ses performances et à l’améliorer méthodiquement au fil du temps. Le développement d’applications LLM diffère fondamentalement du développement logiciel traditionnel. Les sorties des LLM ne sont pas déterministes, ce qui complique le débogage. La qualité est subjective et dépend du contexte. De légères modifications d’un prompt peuvent entraîner des changements de comportement inattendus. Les approches de test traditionnelles montrent leurs limites.

Fonctionnalités principales

Weave offre les fonctionnalités principales suivantes :
  • Visibilité sur les sessions d’agent et les conversations sur plusieurs tours de conversation, ou sur les appels de fonctions individuels et leurs sorties dans le code de l’application.
  • Évaluation systématique pour mesurer les performances à partir de cas de test sélectionnés.
  • Suivi des versions des prompts, des modèles et des données pour comprendre ce qui a été modifié.
  • Expérimentation pour comparer différents prompts et modèles.
  • Collecte de feedback pour capturer les jugements et les annotations humains.
  • Monitoring en production à l’aide de garde-fous et d’évaluateurs pour garantir la sécurité et la qualité des LLM.

Choisir un flux de travail

Weave fournit cette fonctionnalité au moyen de deux flux de travail distincts :
  • Le traçage automatique des agents
  • L’instrumentation de n’importe quels appels LLM et fonctions de votre application, afin d’en tracer les entrées, les sorties et le code

Tracer un agent

Weave’s agent tracing workflows are also available in CoreWeave Agent Lens, the successor to Weights & Biases Weave. Both services already receive your agent tracing data, so there is nothing to migrate. See What is Agent Lens for more information.
Weave offre une observabilité des agents couvrant le cycle de vie complet de leurs conversations, y compris les sessions, les appels LLM et les exécutions d’outils. Le traçage des agents repose sur OpenTelemetry (OTel) et sur les conventions sémantiques GenAI. Si votre agent est déjà instrumenté avec OTel, vous pouvez envoyer ses spans existants vers Weave sans réinstrumenter votre code. Weave accepte n’importe quel span OTel et stocke ses attributs pour que vous puissiez les interroger. Les spans conformes aux conventions GenAI pour les agents, comme invoke_agent et execute_tool, s’affichent sous forme de conversations, de tours de conversation et d’appels d’outils dans la vue Agents. Pour savoir comment émettre ces spans depuis votre propre agent, consultez le démarrage rapide pour les agents personnalisés. Si vous développez un agent, commencez par le démarrage rapide d’intégration d’agents pour choisir l’une des intégrations natives, ou suivez le démarrage rapide pour les agents personnalisés pour instrumenter manuellement votre propre agent. Pour découvrir comment le SDK Weave modélise les agents, consultez Tracer vos agents. Si vous utilisez un harness d’agent tiers pris en charge, comme Claude Code ou OpenAI Agent SDK, Weave l’instrumente automatiquement, sans aucun code supplémentaire. Consultez la page Intégrations pour voir tous les frameworks pris en charge.

Instrumenter et tracer des fonctions

Pour tracer des appels de fonctions individuels, du code applicatif ou une logique personnalisée, utilisez les ops et les appels Weave. Ajoutez une seule ligne à n’importe quelle fonction pour suivre les entrées, les sorties, le coût, le nombre de jetons et la latence. Vous pouvez également :
  • Suivre de bout en bout le cheminement des données dans votre application LLM.
  • Voir les documents sources utilisés pour produire le feedback du LLM.
  • Examiner en détail des prompts spécifiques et la manière dont les réponses sont générées.
Pour tracer des fonctions individuelles, suivez le guide de démarrage rapide du traçage des ops de Weave ou apprenez à utiliser les ops et appels Weave. Le SDK Weave patche également automatiquement de nombreux frameworks et fournisseurs de LLM afin de capturer les traces des appels LLM dans votre code. Consultez la page Intégrations pour voir l’ensemble des fournisseurs et frameworks pris en charge.

Quand utiliser le traçage d’agent ou l’instrumentation d’application

Choisissez le flux de travail en fonction de ce que vous souhaitez observer :
  • Utilisez le traçage d’agent si vous développez ou exécutez un agent. C’est l’option adaptée si vous utilisez un harness d’agent ou un SDK d’agent pris en charge, ou si vous avez développé un agent personnalisé que vous pouvez instrumenter vous-même.
  • Utilisez l’instrumentation d’application si vous tracez du code applicatif. C’est l’option adaptée aux applications structurées autour d’appels distincts plutôt que de conversations, comme un pipeline RAG, un point de terminaison de synthèse ou une logique métier personnalisée.
Chaque approche enregistre ses traces dans une section distincte de l’interface : les traces d’agent apparaissent sur la page Agents, et les appels weave.op sur la page Traces. Vous pouvez utiliser les deux approches dans le même projet Weave, mais elles produisent des traces distinctes. Si vous ne savez pas par où commencer et que votre système comporte un agent, commencez par le traçage d’agent à l’aide du guide de démarrage rapide d’intégration d’agent. Sinon, commencez par le guide de démarrage rapide du traçage des op.

Évaluations

Mesurez et surveillez les performances de votre agent ou de votre application LLM à l’aide d’évaluations, afin d’en améliorer progressivement la qualité et la fiabilité.
  • Suivez les versions de modèle et de prompt à l’origine de chaque niveau de performances.
  • Définissez des métriques pour évaluer les réponses à l’aide d’une ou plusieurs fonctions de score.
  • Comparez plusieurs évaluations sur différentes métriques. Confrontez les performances d’échantillons spécifiques.
Créer un pipeline d’évaluation

Versionnez tout

Weave suit les versions de vos prompts, de vos datasets et de vos configurations de modèle. En cas de problème, vous voyez précisément ce qui a été modifié. Quand quelque chose fonctionne, vous pouvez le reproduire. En savoir plus sur la gestion des versions

Expérimenter avec des prompts et des modèles

Utilisez vos propres clés API pour tester des prompts et comparer les réponses de différents modèles commerciaux dans le Playground. Expérimenter dans le Weave Playground

Recueillir du feedback

Capturez le feedback humain, les annotations et les corrections issus de l’utilisation en production. Servez-vous de ces données pour concevoir de meilleurs cas de test et améliorer votre application. Recueillir du feedback

Surveiller la production

Évaluez le trafic de production avec les mêmes évaluateurs que ceux de vos évaluations. Configurez des garde-fous pour détecter les problèmes avant qu’ils n’atteignent les utilisateurs. Configurer des garde-fous et des moniteurs

Premiers pas avec Weave

Weave propose des SDK pour Python et TypeScript. Les deux SDK prennent en charge le traçage, l’évaluation, les datasets et les principales fonctionnalités de Weave. Certaines fonctionnalités avancées, comme les Models et les Scorers basés sur des classes, ne sont pas disponibles dans le SDK TypeScript de Weave. Pour commencer à utiliser Weave :
  1. Créez un compte CoreWeave Forge sur https://id.coreweave.com/signup et obtenez votre clé API sur https://forge.coreweave.com/settings#apikeys.
  2. Installez Weave :
  1. Dans votre script, importez Weave et initialisez un projet. Remplacez <your-team> par le nom de votre équipe CoreWeave Forge et <your-project> par le nom de votre projet Weights & Biases.
Vous pouvez maintenant utiliser Weave.
Dernière modification le 30 septembre 2026