- W&B Skills は、コードや分析のワークフローで Weights & Biases を効果的に使う方法をコーディングエージェントに教えます。
- Weights & Biases MCP サーバー は、AI アシスタントを Weights & Biases のデータやドキュメントに接続します。これにより、AI アシスタントは run、トレース、評価、アーティファクトに関する自然言語の質問に回答できるようになります。
- Claude Code
- Codex
- Cursor
- Gemini CLI
- Visual Studio Code (VS Code)
- Mistral LeChat
- Claude Desktop
W&B Skills
W&B Skills は、コーディングエージェントに Weights & Biases を効果的に使用する方法を教える、再利用可能な指示セットです。W&B の API やベストプラクティスをエージェントに逐一指示しなくても、Skills をインストールすれば、エージェントが実験管理、トレース、評価、モニタリングを自律的に行えるようになります。機能
Skills は、W&B Python SDK (トレーニング run、メトリクス、アーティファクト、sweep) と Weave SDK (トレース、評価、Scorer) の両方に対応しています。ヘルパーライブラリ、リファレンスドキュメント、データ分析パターンが含まれているため、エージェントは次のワークフローを実行できます。前提条件
W&B Skills を使用するには、以下が必要です。-
npxコマンドを実行するための Node.js。 -
Forge APIキー。forge.coreweave.com/settings#apikeys で作成し、環境変数として設定します。
[YOUR-API-KEY]をご自身のAPIキーに置き換えてください。 -
オプション: Weights & Biases のプロジェクト名を
WANDB_PROJECT環境変数に設定します。これにより、毎回指定しなくても、エージェントが対象とする Weights & Biases の project を正しく判別できるようになります。
W&B Skills をインストールする
すべての project で Skills を使用できるようにするにはグローバルインストールを、Skills の適用範囲を 1 つの project に限定するには project 単位のインストールを選択します。 W&B Skills をグローバルにインストールしてすべての project で使用できるようにするには、--global フラグを使用します。
--global フラグを付けずにインストールコマンドを実行します。
--agent フラグを使用します。
--agent および --skill で指定できるオプションの一覧については、Vercel Labs skills CLI のドキュメントを参照してください。
インストールが完了すると、エージェントが W&B Skills を利用できるようになり、Weights & Biases 関連のタスクを処理できる状態になります。
W&B Skills を使用する
project に関連する Weights & Biases のタスクをエージェントに依頼できます。次のプロンプト例は、W&B Skills を使ってエージェントが実行できるタスクの一部です。- 「PyTorch モデルのトレーニングメトリクスを Weights & Biases にログして。」
- 「直近 10 件の run の損失曲線を分析して、最もパフォーマンスの高い設定を特定して。」
- 「LangChain エージェントをトレースして、結果を Weave にログして。」
- 「テストデータセットを使ってエージェントの評価を実行し、結果を要約して。」
- 「直近の評価で発生した失敗モードを洗い出して分類して。」
- 「run A と run B の設定を比較して、差分を表示して。」
W&B Skills の使い方のヒント
Skills は、漠然とした自由形式の質問よりも、具体的なクエリのほうが適切に回答できます。次の表では、推奨されるプロンプトと曖昧すぎるプロンプトを比較しています。Weights & Biases MCP サーバー
Model Context Protocol (MCP) は、AI エージェントが外部ツールを呼び出せるようにするオープン標準です。Weights & Biases MCP サーバーを使用すると、IDE、コーディングアシスタント、チャットエージェントから Weights & Biases のデータやドキュメントに直接アクセスできます。そのため、エージェントはコピー&ペーストを必要とせずに、run、トレース、評価、アーティファクトに関する質問に回答できます。このサーバーでできることの詳細については、Weights & Biases MCP サーバーの機能セクションを参照してください。デプロイメントタイプ
Weights & Biases MCP サーバーには、2 つのデプロイメントオプションがあります。すぐに使い始めたい場合はホスト型サーバーを使用し、より高い分離性や柔軟性が必要な場合はローカルバージョンを設定してください。ローカルバージョンでは、クライアントがサーバーにアクセスする際に別の URL を使用する必要があります。ホスト型サーバー(推奨)
Weights & Biases が管理する MCP サーバーです。クライアントは APIキーを使用して HTTP 経由で接続します。インストールは不要で、ローカルプロセスを保守する必要もありません。ホスト型サーバーを使用する
ローカルインストール
MCP サーバーを自分のマシン上で STDIO または HTTP 経由で実行します。エアギャップ環境での運用、特定のリリースへのバージョン固定、サーバー動作のカスタマイズ、サーバー自体の開発を行う場合や、STDIO のみに対応したクライアントを使用する場合に適しています。MCP サーバーをローカルで実行する
前提条件
クライアントを設定する前に、以下の準備が整っていることを確認してください。- forge.coreweave.com/settings#apikeys で APIキーを作成します。
- キーを
WANDB_API_KEY環境変数に設定するか、Bearer token としてクライアントに渡します。 - 専用クラウド、セルフマネージド、およびデフォルト以外のインスタンスに接続するローカルインストールの場合は、
WANDB_BASE_URL環境変数にインスタンスの URL を設定します。 - Weights & Biases では、
mcpSDK のバージョンを 1.14.0 (リリース2024-11-05) に固定しています。クライアントはmcpSDK 1.14.x で接続する必要があります。W&B 専用クラウドで Streamable HTTP を利用するには、mcpSDK 1.14.x のリリース2025-03-26以降が必須です。
ホスト型サーバーを使用する
Weights & Biases は、すべてのデプロイメントタイプ向けにマネージド MCP サーバーを提供しています。インストールは必要ありません。HTTP 経由で接続し、Authorization ヘッダーで APIキーを渡すようにクライアントを設定してください。
接続 URL
URL は、使用している Weights & Biases のデプロイメントのタイプによって異なります。
専用クラウドまたはセルフマネージドの場合は、
https://mcp.withwandb.com/mcp を https://[YOUR-INSTANCE]/mcp に置き換えてください。それ以外の設定は変更不要です。以下のクライアント設定例では、Multi-tenant Cloud の URL を使用しています。
- Claude Code
- Claude Desktop
- Codex
- Cursor
- Gemini CLI
- Mistral LeChat
- OpenAI Responses API
- VS Code
Weights & Biases の MCP サーバーを Claude Code に登録します。その際、Bearer token はご自身の APIキーに置き換えてください:Claude Code をグローバルに設定するには、
--scope user を追加します。現在の project のみを対象に設定する場合は、このオプションを省略します。List my W&B entities. と質問して、接続を検証します。エージェントが list_entities_tool を呼び出し、ユーザー名と所属するチームが返されれば成功です。接続に失敗した場合は、トラブルシューティングを参照してください。詳細については、Claude Code の MCP ドキュメントを参照してください。MCP サーバーをローカルで実行する
ローカルインストールはホスト型サーバーの代替手段であり、どのデプロイメントタイプでもデフォルトではありません。ホスト型サーバーが環境構成に合わない場合に使用してください。 ローカルで実行する主な理由は次のとおりです。- エアギャップ環境またはオフライン環境で、クライアントがホスト型の Weights & Biases エンドポイントにアクセスできない場合。
- バージョンを固定したい場合。ホスト型サーバーは main ブランチに追従します。ローカルインストールでは、特定のリリースタグにバージョンを固定できます。
- サーバーの動作をカスタマイズしたい場合。ツールの説明の変更、ツールの追加、デフォルト以外の応答トークン予算の設定などが該当します。
- サーバー自体を開発中の場合。
- STDIO のみに対応するクライアント、またはローカルプロセスを必要とするクライアントを使用する場合。
WANDB_BASE_URL 環境変数にインスタンスの URL を設定します。
ローカル環境の前提条件
サーバーをローカルで実行するには、以下の要件を満たしていることを確認してください。- Python 3.11 以降
uvまたはpipWANDB_API_KEYに設定済みの APIキー- 専用クラウドまたはセルフマネージドを使用している場合は、
WANDB_BASE_URLにインスタンスの URL を設定済みであること
サーバーをインストールする
インストール方法を選択し、次のコマンドを実行して MCP サーバーをインストールします。- uvx(恒久的なインストールは不要)
- uv
- pip
- GitHub からインストール
クライアントを設定する
サーバーをインストールしたら、サーバーを起動するようにクライアントを設定します。お使いの MCP クライアントを選択し、以下の設定を行います。必要に応じて、[YOUR-WANDB-API-KEY] をお使いのAPIキーに置き換えてください。
- Claude Code
- Claude Desktop
- Codex
- Cursor
- VS Code
ローカルサーバーを Claude Code に登録します。グローバルに設定する場合は
--scope user を追加します。HTTP トランスポートでサーバーを実行する
Web ベースのクライアントで使用する場合やテストを行う場合は、HTTP トランスポートでサーバーを実行します。環境変数
以下の環境変数は、ローカルインストール時の認証、インスタンスのルーティング、サーバーの動作を制御します。クライアントのenv ブロックで設定するか、シェルでエクスポートしてください。
コマンドラインの完全なリファレンスと詳細オプションについては、wandb-mcp-server README を参照してください。
Weights & Biases MCP サーバーの機能
MCP サーバーを使用すると、実験の分析、トレースのデバッグ、report の作成、Registry とアーティファクトの管理を行えるほか、Weights & Biases のドキュメントに基づいて質問に回答することもできます。以下のプロンプト例は、Weights & Biases MCP サーバーに接続したエージェントに依頼できるタスクの一部です。- 「
your-team/your-projectでeval/accuracyの上位 5 件の run を表示してください。」 - 「採用エージェントの predict トレースのレイテンシーは、過去 1 か月でどのように推移しましたか?」
- 「先週、採用エージェントが行った判断を比較する W&B report を生成してください。」
- 「
production-modelアーティファクトにはどのようなバージョンがありますか?また、v2とv3の間で何が変わりましたか?」 - 「Weave で leaderboard を作成するにはどうすればよいですか?」
利用可能なツール
このサーバーは、用途別に分類された複数のツールを提供します。次の表は、各ツールの名前、エージェントがそのツールを使用すべき場面、およびそのツールを呼び出すための具体的なプロンプト例を示しています。- ディスカバリー
- 実験と run
- Weave トレース
- Reports
- アーティファクトと Registry
- ドキュメント
project 名や entity 名を調べたり、スキーマを確認したりするためのツールです。
スキーマ優先のトレースクエリ
Weave のトレースをクエリする場合は、まずinfer_trace_schema_tool を呼び出して利用可能なフィールドを確認し、次に取得する列を正確に指定したリストと detail_level を渡して query_weave_traces_tool を呼び出します。
このパターンを使用すると、広範な質問ではトークン使用量を低く抑えられ、エージェントは重要なトレースに対してのみ
full に切り替えることができます。
使用のヒント
以下のセクションでは、Weights & Biases MCP サーバーをより効果的に活用するためのプラクティスとワークフローについて説明します。まず一般的なプラクティスを確認してから、ご自身のワークロードに合ったセクションで、より具体的なアドバイスや複数ステップのツールチェーンを確認してください。一般的なベストプラクティス
ユースケースにかかわらず、次のプラクティスに従ってください。- entity と project を指定します。 MCP ツールには、entity (チームまたは個人アカウント) とプロジェクト名を明示的に指定する必要があります。すべての質問に両方を含めてください (例: 「
your-team/your-projectで」)。 - 質問の焦点を絞ります。 「最も良い評価はどれですか?」ではなく、「F1 スコアが最も高い評価はどれですか?」のように質問してください。具体的なメトリクスや期間を指定すると、より的確なツール呼び出しが行われます。
- すべて取得されたことを検証します。 「最もパフォーマンスの良い run はどれですか?」のような広範な質問では、最新の run だけでなく、利用可能なすべての run を取得したかどうかをエージェントに確認させてください。
- W&B Skills と組み合わせます。 W&B Skills は、Weights & Biases のワークフローを構成する方法をコーディングエージェントに教えます。Skills はパターンを、MCP はデータへのアクセスを提供するため、両者を組み合わせると効果的です。
トレースを多用するワークフローの場合
Weave トレースを扱う際は、次のプラクティスに従ってください。- まずスキーマを確認します。
query_weave_traces_toolの前にinfer_trace_schema_toolを呼び出し、有効なフィールドとフィルター値をエージェントに渡します。 - 適切な
detail_levelを選択します。 概要の閲覧にはschema、分析にはsummary(デフォルト) を使用します。fullは、少数の特定のトレースを詳しく調べる場合にのみ使用してください。 resolve_trace_roots_toolをチェーンします。 子トレースをクエリした後、得られたtrace_idのリストをresolve_trace_roots_toolに渡すと、1 回のバッチ Call で各トレースをルートセッションにマッピングできます。- 評価には
summarize_evaluation_toolを優先して使用します。 このツールはEvaluation.evaluateとpredict_and_scoreの階層を自動的に集計します。query_weave_traces_toolは、生のトレースデータが必要な場合にのみ使用してください。
run 中心のワークフロー向け
W&B run を扱う際は、次のプラクティスに従ってください。- クエリする前にプローブします。 使い慣れていない run ベースの project では、GraphQL を組み立てる前に
probe_project_toolを呼び出して、メトリクスキー、設定キー、タグを確認します。 - 時系列には
get_run_history_toolを使用します。 GraphQL はサンプリングを行わないため、損失曲線などの時系列データにはget_run_history_toolを使用するほうが高速かつ低コストです。 - 差分の算出は
compare_runs_toolに任せます。 このツールは設定とメトリクスの差分を、揃えた履歴とともに 1 回の呼び出しで返すため、手動で比較する必要はありません。 - まずヘルスチェックを実行します。 トレーニング run の挙動がおかしい場合は、履歴を手動で調べる前に
diagnose_run_toolを呼び出します。
専用クラウドおよびセルフマネージドの場合
マルチテナント以外のデプロイメントでは、次のプラクティスに従ってください。- インスタンス上の
https://[YOUR-INSTANCE]/mcpにあるホスト型サーバーを優先して使用してください。このサーバーは Multi-tenant サーバーと同じツールを提供しており、クライアント側でWANDB_BASE_URLを設定する必要はありません。ローカルインストールは、ホスト型サーバーがまだ有効になっていない場合にのみ使用してください。 - インスタンスに対してローカルで実行する場合は、クライアントの
envブロックでWANDB_BASE_URLにインスタンスの URL を設定してください。設定しないと、サーバーはapi.wandb.aiに接続するため、データは返されません。 - 専用クラウドのレート制限は、Multi-tenant とは別に設定されています。デフォルト値や変更のリクエスト方法については、専用クラウドのレート制限を参照してください。
ローカルインストールの場合
ご自身のマシンでサーバーを実行する場合は、次のプラクティスに従ってください。- デスクトップクライアント (Cursor、VS Code、Claude Code、Claude Desktop) では、STDIO トランスポートを優先して使用してください。HTTP トランスポートに切り替えるのは、クライアントが明示的に必要とする場合 (OpenAI Responses API など) に限定してください。
- ツール呼び出しがエラーを出さずに失敗する場合は、クライアントの
envブロックでMCP_SERVER_LOG_LEVEL=DEBUGを設定し、クライアントの MCP ログを改めて確認してください。 - GitHub からインストールする場合 (
uvx --from git+https://github.com/wandb/wandb-mcp-server wandb_mcp_server) 、uvxはデフォルトブランチに固定されます。安定したバージョンが必要な場合は、Git URL の末尾に@v0.3.2を付けて、特定のタグを明示的に指定してください。
推奨ワークフロー
実際の質問の多くは、1 つのツールだけでは解決できません。以下のワークフローでは、エージェントに依頼できる、複数のステップからなる一般的なツールチェーンを紹介します。見慣れない project を調べる
project にログされた内容を調べるには、次のツールを順に組み合わせて使用します。list_entities_toolで entity またはチームを検索します。query_wandb_entity_projectsで project を検索します。- run ベースの project には
probe_project_toolを、Weave トレースの project にはinfer_trace_schema_toolを使用します。 - 検出したキーを使って、対象を絞った
query_wandb_toolまたはquery_weave_traces_toolを呼び出します。
失敗した LLM Call のトリアージ
問題のあるトレースと、その発生元のセッションを検索するには、次のツールをチェーンで組み合わせて使用します。- error フィールドまたは exception フィールドでフィルターし、
detail_level="summary"を指定してquery_weave_traces_toolを実行します。 - 得られた
trace_idのリストに対してresolve_trace_roots_toolを実行し、各失敗をそのルートセッションに対応付けます。 - 対象を絞った少数のルートに対して
detail_level="full"を指定してquery_weave_traces_toolを実行し、詳細を掘り下げます。 create_wandb_report_toolを使用して、検出結果をまとめます。
不調なトレーニング run を診断する
問題が疑われるトレーニング run のヘルスチェックを行うには、次のツールを順に組み合わせて使用します。get_run_history_toolで損失曲線と検証曲線を取得します。diagnose_run_toolで収束、過学習、NaN を自動チェックします。compare_runs_toolで、正常であることが確認済みのベースライン run と比較します。create_wandb_report_toolで折れ線グラフのパネルを含む report を作成し、診断結果を共有します。
評価を要約してモデルのバージョンを比較する
評価で最も高い性能を示したモデルのバージョンを検索するには、次のツールをチェーンとして組み合わせます。summarize_evaluation_toolで、scorer ごとの合格率とエラー数を取得します。- 対象のモデルコレクションに対して
list_artifact_versions_toolを実行します。 - 候補バージョンと現在の本番バージョンを対象に
compare_artifact_versions_toolを実行します。 log_analysis_to_wandbとcreate_wandb_report_toolを使用して、比較結果をパブリッシュします。