Fonctionnalités principales
Weave offre les fonctionnalités principales suivantes :- Visibilité sur les sessions d’agent et les conversations sur plusieurs tours de conversation, ou sur les appels de fonctions individuels et leurs sorties dans le code de l’application.
- Évaluation systématique pour mesurer les performances à partir de cas de test sélectionnés.
- Suivi des versions des prompts, des modèles et des données pour comprendre ce qui a été modifié.
- Expérimentation pour comparer différents prompts et modèles.
- Collecte de feedback pour capturer les jugements et les annotations humains.
- Monitoring en production à l’aide de garde-fous et d’évaluateurs pour garantir la sécurité et la qualité des LLM.
Choisir un flux de travail
Weave fournit cette fonctionnalité au moyen de deux flux de travail distincts :- Le traçage automatique des agents
- L’instrumentation de n’importe quels appels LLM et fonctions de votre application, afin d’en tracer les entrées, les sorties et le code
Tracer un agent
Weave’s agent tracing workflows are also available in CoreWeave Agent Lens, the successor to Weights & Biases Weave. Both services already receive your agent tracing data, so there is nothing to migrate. See What is Agent Lens for more information.
invoke_agent et execute_tool, s’affichent sous forme de conversations, de tours de conversation et d’appels d’outils dans la vue Agents. Pour savoir comment émettre ces spans depuis votre propre agent, consultez le démarrage rapide pour les agents personnalisés.
Si vous développez un agent, commencez par le démarrage rapide d’intégration d’agents pour choisir l’une des intégrations natives, ou suivez le démarrage rapide pour les agents personnalisés pour instrumenter manuellement votre propre agent. Pour découvrir comment le SDK Weave modélise les agents, consultez Tracer vos agents.
Si vous utilisez un harness d’agent tiers pris en charge, comme Claude Code ou OpenAI Agent SDK, Weave l’instrumente automatiquement, sans aucun code supplémentaire. Consultez la page Intégrations pour voir tous les frameworks pris en charge.
Instrumenter et tracer des fonctions
Pour tracer des appels de fonctions individuels, du code applicatif ou une logique personnalisée, utilisez les ops et les appels Weave. Ajoutez une seule ligne à n’importe quelle fonction pour suivre les entrées, les sorties, le coût, le nombre de jetons et la latence. Vous pouvez également :- Suivre de bout en bout le cheminement des données dans votre application LLM.
- Voir les documents sources utilisés pour produire le feedback du LLM.
- Examiner en détail des prompts spécifiques et la manière dont les réponses sont générées.
Quand utiliser le traçage d’agent ou l’instrumentation d’application
Choisissez le flux de travail en fonction de ce que vous souhaitez observer :- Utilisez le traçage d’agent si vous développez ou exécutez un agent. C’est l’option adaptée si vous utilisez un harness d’agent ou un SDK d’agent pris en charge, ou si vous avez développé un agent personnalisé que vous pouvez instrumenter vous-même.
- Utilisez l’instrumentation d’application si vous tracez du code applicatif. C’est l’option adaptée aux applications structurées autour d’appels distincts plutôt que de conversations, comme un pipeline RAG, un point de terminaison de synthèse ou une logique métier personnalisée.
weave.op sur la page Traces. Vous pouvez utiliser les deux approches dans le même projet Weave, mais elles produisent des traces distinctes.
Si vous ne savez pas par où commencer et que votre système comporte un agent, commencez par le traçage d’agent à l’aide du guide de démarrage rapide d’intégration d’agent. Sinon, commencez par le guide de démarrage rapide du traçage des op.
Évaluations
Mesurez et surveillez les performances de votre agent ou de votre application LLM à l’aide d’évaluations, afin d’en améliorer progressivement la qualité et la fiabilité.- Suivez les versions de modèle et de prompt à l’origine de chaque niveau de performances.
- Définissez des métriques pour évaluer les réponses à l’aide d’une ou plusieurs fonctions de score.
- Comparez plusieurs évaluations sur différentes métriques. Confrontez les performances d’échantillons spécifiques.
Versionnez tout
Weave suit les versions de vos prompts, de vos datasets et de vos configurations de modèle. En cas de problème, vous voyez précisément ce qui a été modifié. Quand quelque chose fonctionne, vous pouvez le reproduire. En savoir plus sur la gestion des versionsExpérimenter avec des prompts et des modèles
Utilisez vos propres clés API pour tester des prompts et comparer les réponses de différents modèles commerciaux dans le Playground. Expérimenter dans le Weave PlaygroundRecueillir du feedback
Capturez le feedback humain, les annotations et les corrections issus de l’utilisation en production. Servez-vous de ces données pour concevoir de meilleurs cas de test et améliorer votre application. Recueillir du feedbackSurveiller la production
Évaluez le trafic de production avec les mêmes évaluateurs que ceux de vos évaluations. Configurez des garde-fous pour détecter les problèmes avant qu’ils n’atteignent les utilisateurs. Configurer des garde-fous et des moniteursPremiers pas avec Weave
Weave propose des SDK pour Python et TypeScript. Les deux SDK prennent en charge le traçage, l’évaluation, les datasets et les principales fonctionnalités de Weave. Certaines fonctionnalités avancées, comme les Models et les Scorers basés sur des classes, ne sont pas disponibles dans le SDK TypeScript de Weave. Pour commencer à utiliser Weave :- Créez un compte CoreWeave Forge sur https://id.coreweave.com/signup et obtenez votre clé API sur https://forge.coreweave.com/settings#apikeys.
- Installez Weave :
- Dans votre script, importez Weave et initialisez un projet. Remplacez
<your-team>par le nom de votre équipe CoreWeave Forge et<your-project>par le nom de votre projet Weights & Biases.