- W&B Skills apprend aux agents de développement à utiliser efficacement Weights & Biases dans votre code et vos flux de travail d’analyse.
- Le serveur MCP Weights & Biases connecte les assistants IA à vos données et à la documentation Weights & Biases afin qu’ils puissent répondre à des questions en langage naturel sur vos runs, vos traces, vos évaluations et vos artifacts.
- Claude Code
- Codex
- Cursor
- Gemini CLI
- Visual Studio Code (VS Code)
- Mistral LeChat
- Claude Desktop
W&B Skills
Les W&B Skills sont des ensembles d’instructions réutilisables qui apprennent aux agents de développement à utiliser efficacement Weights & Biases. Plutôt que de guider vous-même votre agent dans les API et les bonnes pratiques de W&B, installez des Skills pour que l’agent prenne en charge de manière autonome le suivi des expériences, le traçage, les évaluations et la surveillance.Fonctionnalités
Les skills couvrent à la fois le SDK Python W&B (runs d’entraînement, métriques, artifacts, sweeps) et le SDK Weave (traces, évaluations, évaluateurs). Ils incluent des bibliothèques utilitaires, de la documentation de référence et des modèles d’analyse de données qui permettent à votre agent de prendre en charge les flux de travail suivants.Prérequis
Les W&B Skills nécessitent les éléments suivants :-
Node.js pour la commande
npx. -
Une clé API Forge. Créez-en une sur forge.coreweave.com/settings#apikeys, puis définissez-la comme variable d’environnement. Remplacez
[YOUR-API-KEY]par votre clé API : -
Facultatif : définissez le nom de votre projet Weights & Biases dans la variable d’environnement
WANDB_PROJECT. Votre agent peut ainsi cibler le bon projet Weights & Biases sans que vous ayez à le préciser à chaque fois.
Installer W&B Skills
Choisissez une installation globale pour rendre les Skills disponibles dans tous vos projets, ou une installation propre à un projet pour limiter la portée des Skills à ce seul projet. Pour installer W&B Skills de façon globale, pour l’ensemble de vos projets, utilisez l’option--global :
--global :
--agent :
--agent et --skill, consultez la documentation de la CLI skills de Vercel Labs.
Une fois l’installation terminée, votre agent a accès aux W&B Skills et peut prendre en charge les tâches liées à Weights & Biases.
Utiliser W&B Skills
Demandez à votre agent d’effectuer des tâches liées à Weights & Biases pour votre projet. Les exemples de prompts suivants illustrent quelques-unes des tâches que votre agent peut réaliser avec W&B Skills :- « Journalise les métriques d’entraînement de mon modèle PyTorch dans Weights & Biases. »
- « Analyse les courbes de perte de mes 10 derniers runs et identifie la configuration la plus performante. »
- « Trace mon agent LangChain et journalise les résultats dans Weave. »
- « Lance une évaluation de mon agent sur le dataset de test et résume les résultats. »
- « Identifie les modes de défaillance de ma dernière évaluation et classe-les. »
- « Compare les configurations du run A et du run B, et montre-moi les différences. »
Conseils d’utilisation de W&B Skills
Skills donne de meilleurs résultats avec des requêtes précises qu’avec des questions générales et ouvertes. Le tableau suivant compare des prompts recommandés à des prompts trop vagues.serveur MCP Weights & Biases
Le Model Context Protocol (MCP) est une norme ouverte qui permet aux agents d’IA d’appeler des outils externes. Le serveur MCP Weights & Biases offre à votre IDE, à votre assistant de programmation ou à votre agent de chat un accès direct à vos données et à votre documentation Weights & Biases. Votre agent peut ainsi répondre à des questions sur vos runs, vos traces, vos évaluations et vos artifacts, sans avoir à copier-coller quoi que ce soit. Pour découvrir tout ce que vous pouvez faire avec le serveur, consultez la section Fonctionnalités du serveur MCP Weights & Biases.Types de déploiement
Le serveur MCP Weights & Biases est proposé selon deux options de déploiement. Utilisez le serveur hébergé pour une configuration plus rapide, ou configurez une version locale si vous avez besoin de davantage d’isolation et de flexibilité. Avec la version locale, votre client doit utiliser une autre URL pour accéder au serveur.Serveur hébergé (recommandé)
Un serveur MCP géré par Weights & Biases, auquel votre client se connecte via HTTP avec votre clé API. Aucune installation, aucun processus local à maintenir.Utiliser le serveur hébergé
Installation locale
Exécutez le serveur MCP sur votre propre machine via STDIO ou HTTP. Choisissez cette option si vous avez besoin d’un fonctionnement isolé du réseau, d’épingler une version précise ou de personnaliser le comportement du serveur, si vous développez activement le serveur, ou si votre client ne prend en charge que STDIO.Exécuter le serveur MCP en local
Prérequis
Avant de configurer un client, assurez-vous de disposer des éléments suivants :- Créez une clé API sur forge.coreweave.com/settings#apikeys.
- Définissez la clé dans la variable d’environnement
WANDB_API_KEY, ou transmettez-la à votre client sous forme de jeton Bearer. - Pour le Cloud dédié, les déploiements autogérés et les installations locales qui utilisent une instance autre que celle par défaut, définissez la variable d’environnement
WANDB_BASE_URLsur l’URL de votre instance. - Weights & Biases épingle le SDK
mcpà la version 1.14.0, version2024-11-05. Les clients doivent se connecter avec le SDKmcp1.14.x. Pour la prise en charge du transport HTTP en streaming (streamable HTTP) dans le Cloud dédié de W&B, le SDKmcp1.14.x en version2025-03-26ou ultérieure est requis.
Utiliser le serveur hébergé
Weights & Biases propose un serveur MCP géré pour chaque type de déploiement. Vous n’avez rien à installer. Configurez votre client pour qu’il se connecte en HTTP avec une clé API dans l’en-têteAuthorization.
URL de connexion
L’URL dépend du type de déploiement Weights & Biases que vous utilisez :
Pour un déploiement Cloud dédié ou autogéré, remplacez
https://mcp.withwandb.com/mcp par https://[YOUR-INSTANCE]/mcp sans rien modifier d’autre. Les configurations client ci-dessous utilisent l’URL du Cloud mutualisé.
- Claude Code
- Claude Desktop
- Codex
- Cursor
- Gemini CLI
- Mistral LeChat
- API Responses d’OpenAI
- VS Code
Enregistrez le serveur MCP Weights & Biases dans Claude Code, en remplaçant le jeton Bearer par votre clé API :Ajoutez
--scope user pour configurer Claude Code globalement. Omettez-le pour ne configurer que le projet actuel.Vérifiez la connexion en demandant List my W&B entities. L’agent doit appeler list_entities_tool et renvoyer votre nom d’utilisateur ainsi que les éventuelles équipes dont vous faites partie. Si la connexion échoue, consultez la section Dépannage. Pour plus d’informations, voir la documentation MCP de Claude Code.Exécuter le serveur MCP en local
Une installation locale est une alternative au serveur hébergé, et non l’option par défaut pour quelque type de déploiement que ce soit. Utilisez-la lorsque le serveur hébergé n’est pas adapté à votre configuration. Raisons courantes d’une exécution en local :- Environnements isolés du réseau ou hors ligne, dans lesquels votre client ne peut pas joindre un point de terminaison Weights & Biases hébergé.
- Version épinglée. Le serveur hébergé suit la branche principale. Une installation locale peut être épinglée sur un tag de version précis.
- Comportement personnalisé du serveur, par exemple pour modifier la description des outils, ajouter des outils ou définir un budget de jetons de réponse autre que celui par défaut.
- Développement actif du serveur lui-même.
- Clients compatibles uniquement avec STDIO ou clients qui nécessitent un processus local.
WANDB_BASE_URL sur l’URL de votre instance.
Prérequis locaux
Pour exécuter le serveur localement, assurez-vous de disposer des éléments suivants :- Python 3.11 ou version ultérieure.
uvoupip.- Une clé API, définie dans
WANDB_API_KEY. - La variable
WANDB_BASE_URL, définie sur l’URL de votre instance si vous utilisez le Cloud dédié ou un déploiement autogéré.
Installer le serveur
Choisissez une méthode d’installation, puis exécutez la commande suivante pour installer le serveur MCP :- uvx (sans installation permanente)
- uv
- pip
- Installer depuis GitHub
Configurer votre client
Après avoir installé le serveur, configurez votre client pour qu’il le lance. Sélectionnez votre client MCP, puis appliquez la configuration suivante en remplaçant[YOUR-WANDB-API-KEY] par votre clé API si nécessaire :
- Claude Code
- Claude Desktop
- Codex
- Cursor
- VS Code
Enregistrez le serveur local auprès de Claude Code. Ajoutez
--scope user pour une configuration globale.Exécuter le serveur avec le transport HTTP
Pour les clients web et les tests, exécutez le serveur avec le transport HTTP :Variables d’environnement
Les variables d’environnement suivantes contrôlent l’authentification, l’acheminement vers l’instance et le comportement du serveur pour les installations locales. Définissez-les dans le blocenv de votre client ou exportez-les dans votre shell.
Pour la référence complète de la ligne de commande et les options avancées, consultez le README de wandb-mcp-server.
Fonctionnalités du serveur MCP Weights & Biases
Utilisez le serveur MCP pour analyser des expériences, déboguer des traces, créer des rapports, gérer le registre et les artifacts, et obtenir des réponses tirées de la documentation Weights & Biases. Les exemples de prompts suivants illustrent quelques-unes des tâches que vous pouvez confier à votre agent lorsqu’il est connecté au serveur MCP Weights & Biases :- « Affiche les 5 meilleurs runs selon
eval/accuracydansyour-team/your-project. » - « Comment la latence des traces predict de mon agent de recrutement a-t-elle évolué au cours du dernier mois ? »
- « Génère un W&B Report comparant les décisions prises par l’agent de recrutement la semaine dernière. »
- « Quelles sont les versions existantes de l’artifact
production-model, et qu’est-ce qui a changé entrev2etv3? » - « Comment puis-je créer un leaderboard dans Weave ? »
Outils disponibles
Le serveur propose plusieurs outils, regroupés par usage. Le tableau suivant répertorie le nom de chaque outil, les situations dans lesquelles l’agent doit l’utiliser, ainsi qu’un exemple concret de prompt permettant de l’invoquer.- Découverte
- Experiments et runs
- Traces Weave
- Reports
- Artifacts et registre
- Documentation
Outils permettant de découvrir les noms de projets et d’entity, et d’inspecter les schémas.
Requêtes de traces guidées par le schéma
Pour les requêtes de traces Weave, appelez d’abordinfer_trace_schema_tool afin de découvrir les champs disponibles, puis appelez query_weave_traces_tool avec une liste de colonnes précise et un detail_level :
Cette approche limite l’utilisation des jetons pour les questions générales et permet à l’agent de passer à
full uniquement pour les traces pertinentes.
Conseils d’utilisation
Les sections suivantes décrivent des pratiques et des flux de travail qui vous aideront à obtenir de meilleurs résultats avec le serveur MCP Weights & Biases. Commencez par les pratiques générales, puis consultez la section adaptée à votre charge de travail pour obtenir des conseils plus précis et des enchaînements d’outils en plusieurs étapes.Bonnes pratiques générales
Suivez ces pratiques quel que soit votre cas d’usage :- Précisez l’entity et le projet. Les outils MCP nécessitent une entity explicite (votre équipe ou votre compte personnel) et un nom de projet. Indiquez-les tous les deux dans chaque question, par exemple « dans
your-team/your-project». - Posez des questions ciblées. Préférez « Quelle évaluation a obtenu le meilleur score F1 ? » à « Quelle est ma meilleure évaluation ? ». Des métriques et des plages temporelles précises donnent lieu à de meilleurs appels d’outils.
- Vérifiez que la récupération est complète. Pour les questions générales telles que « Quels sont mes runs les plus performants ? », demandez à l’agent de confirmer qu’il a bien récupéré tous les runs disponibles, et pas uniquement les plus récents.
- Associez-le à W&B Skills. W&B Skills apprend aux agents de développement à structurer les flux de travail Weights & Biases. Les Skills fournissent des modèles, MCP donne accès aux données : les deux se complètent parfaitement.
Pour les flux de travail riches en traces
Suivez ces bonnes pratiques lorsque vous travaillez avec les traces Weave :- Commencez par le schéma. Appelez
infer_trace_schema_toolavantquery_weave_traces_toolafin de fournir à l’agent les champs et les valeurs de filtre valides. - Choisissez le bon
detail_level. Utilisezschemapour parcourir les données,summary(la valeur par défaut) pour l’analyse, etfulluniquement pour examiner en détail un petit nombre de traces précises. - Enchaînez avec
resolve_trace_roots_tool. Après une requête sur des traces enfants, transmettez la liste detrace_idobtenue àresolve_trace_roots_toolpour associer chaque trace à sa session racine en un seul appel par lot. - Privilégiez
summarize_evaluation_toolpour les évaluations. Cet outil agrège automatiquement la hiérarchieEvaluation.evaluateetpredict_and_score. Ne revenez àquery_weave_traces_toolque pour obtenir les données de trace brutes.
Pour les flux de travail centrés sur les runs
Suivez ces bonnes pratiques lorsque vous travaillez avec des runs W&B :- Sondez avant d’interroger. Appelez
probe_project_toolsur un projet basé sur des runs que vous ne connaissez pas afin de découvrir les clés de métriques, les clés de configuration et les tags avant de rédiger une requête GraphQL. - Utilisez
get_run_history_toolpour les séries temporelles. GraphQL n’effectue pas d’échantillonnage : pour les courbes de perte et les autres séries temporelles,get_run_history_toolest donc à la fois plus rapide et moins coûteux. - Confiez la comparaison à
compare_runs_tool. Il renvoie les écarts de configuration et de métriques, avec un historique aligné, en un appel unique, ce qui vous évite toute comparaison manuelle. - Commencez par un contrôle de santé. Lorsqu’un run d’entraînement semble anormal, appelez
diagnose_run_toolavant d’examiner manuellement l’historique.
Pour le Cloud dédié et les déploiements autogérés
Appliquez ces bonnes pratiques pour les déploiements non mutualisés :- Privilégiez le serveur hébergé sur votre instance à l’adresse
https://[YOUR-INSTANCE]/mcp. Il expose les mêmes outils que le serveur multilocataire, sans qu’il soit nécessaire de définirWANDB_BASE_URLcôté client. N’optez pour une installation locale que si le serveur hébergé n’est pas encore activé. - Si vous exécutez le serveur localement en le connectant à votre instance, définissez
WANDB_BASE_URLsur l’URL de votre instance dans le blocenvdu client. Sans cela, le serveur cibleapi.wandb.aiet ne renvoie aucune donnée. - Les limites de débit du Cloud dédié sont distinctes de celles du Cloud mutualisé. Consultez Limites de débit du Cloud dédié pour connaître les valeurs par défaut et la procédure à suivre pour demander une modification.
Pour les installations locales
Suivez ces bonnes pratiques lorsque vous exécutez le serveur sur votre propre machine :- Privilégiez le transport STDIO pour les clients de bureau (Cursor, VS Code, Claude Code, Claude Desktop). Ne passez au transport HTTP que si un client l’exige explicitement (par exemple, l’API Responses d’OpenAI).
- Si des appels d’outil échouent sans signaler d’erreur, définissez
MCP_SERVER_LOG_LEVEL=DEBUGdans le blocenvdu client, puis vérifiez de nouveau les journaux MCP du client. - Si vous effectuez l’installation depuis GitHub (
uvx --from git+https://github.com/wandb/wandb-mcp-server wandb_mcp_server),uvxutilise par défaut la branche principale du dépôt. Si vous avez besoin d’une version stable, épinglez un tag précis en ajoutant@v0.3.2à l’URL Git.
Flux de travail recommandés
La plupart des questions concrètes font appel à plusieurs outils. Les flux de travail suivants présentent des enchaînements d’outils courants, en plusieurs étapes, que vous pouvez confier à votre agent.Explorer un projet inconnu
Pour explorer ce qui a été journalisé dans un projet, enchaînez ces outils :list_entities_toolpour trouver une entity ou une équipe.query_wandb_entity_projectspour trouver le projet.probe_project_toolpour les projets basés sur des runs, ouinfer_trace_schema_toolpour les projets de traces Weave.- Un appel ciblé à
query_wandb_toolou àquery_weave_traces_toolavec les clés identifiées.
Analyser les appels LLM en échec
Pour trouver les traces défaillantes et les sessions dont elles proviennent, enchaînez ces outils :query_weave_traces_toolavec un filtre sur les champs d’erreur ou d’exception, etdetail_level="summary".resolve_trace_roots_toolsur la liste detrace_idobtenue, afin de rattacher chaque échec à sa session racine.query_weave_traces_toolavecdetail_level="full"sur quelques racines ciblées, pour les examiner en détail.create_wandb_report_toolpour documenter les constats.
Diagnostiquer un run d’entraînement défaillant
Pour effectuer un contrôle de santé sur un run d’entraînement suspect, enchaînez ces outils :get_run_history_toolpour récupérer les courbes de perte et de validation.diagnose_run_toolpour vérifier automatiquement la convergence, le surapprentissage et la présence de valeurs NaN.compare_runs_toolpour comparer le run à un run de référence dont la fiabilité est établie.create_wandb_report_toolavec des panneaux de graphiques linéaires pour partager le diagnostic.
Résumer les évaluations et comparer les versions de modèle
Pour trouver la version de modèle la plus performante à une évaluation, enchaînez ces outils :summarize_evaluation_toolpour obtenir les taux de réussite et le nombre d’erreurs par évaluateur.list_artifact_versions_toolsur la collection de modèles concernée.compare_artifact_versions_toolentre la version candidate et la version actuellement en production.log_analysis_to_wandbetcreate_wandb_report_toolpour publier la comparaison.