Skip to main content
Weights & Biases は、互いに補完し合う 2 つの方法で AI アシスタントと連携します。
  • W&B Skills は、コードや分析のワークフローで Weights & Biases を効果的に使う方法をコーディングエージェントに教えます。
  • Weights & Biases MCP サーバー は、AI アシスタントを Weights & Biases のデータやドキュメントに接続します。これにより、AI アシスタントは run、トレース、評価、アーティファクトに関する自然言語の質問に回答できるようになります。
Weights & Biases を活用するコードをコーディングエージェントに作成・変更させたい場合は、Skills を使用します。AI アシスタントに Weights & Biases のライブデータをクエリさせたり、Weights & Biases のドキュメントを検索させたりしたい場合は、MCP サーバーを使用します。この 2 つは組み合わせて使うと効果的です。Skills はワークフローのパターンを、MCP はデータへのアクセスを提供します。 インテグレーションによって異なりますが、Weights & Biases は次のような主要なコーディングエージェント、IDE、チャットアシスタントで利用できます。
  • Claude Code
  • Codex
  • Cursor
  • Gemini CLI
  • Visual Studio Code (VS Code)
  • Mistral LeChat
  • Claude Desktop
W&B Skills がサポートしているエージェントの一覧については、W&B Skills CLI のドキュメントを参照してください。

W&B Skills

W&B Skills は、コーディングエージェントに Weights & Biases を効果的に使用する方法を教える、再利用可能な指示セットです。W&B の API やベストプラクティスをエージェントに逐一指示しなくても、Skills をインストールすれば、エージェントが実験管理、トレース、評価、モニタリングを自律的に行えるようになります。

機能

Skills は、W&B Python SDK (トレーニング run、メトリクス、アーティファクト、sweep) と Weave SDK (トレース、評価、Scorer) の両方に対応しています。ヘルパーライブラリ、リファレンスドキュメント、データ分析パターンが含まれているため、エージェントは次のワークフローを実行できます。

前提条件

W&B Skills を使用するには、以下が必要です。
  • npx コマンドを実行するための Node.js。
  • Forge APIキー。forge.coreweave.com/settings#apikeys で作成し、環境変数として設定します。[YOUR-API-KEY] をご自身のAPIキーに置き換えてください。
  • オプション: Weights & Biases のプロジェクト名を WANDB_PROJECT 環境変数に設定します。これにより、毎回指定しなくても、エージェントが対象とする Weights & Biases の project を正しく判別できるようになります。

W&B Skills をインストールする

すべての project で Skills を使用できるようにするにはグローバルインストールを、Skills の適用範囲を 1 つの project に限定するには project 単位のインストールを選択します。 W&B Skills をグローバルにインストールしてすべての project で使用できるようにするには、--global フラグを使用します。
現在のプロジェクトにのみ Skills をインストールするには、プロジェクトのディレクトリで --global フラグを付けずにインストールコマンドを実行します。
特定のエージェント向けに Skills をインストールするには、--agent フラグを使用します。
--agent および --skill で指定できるオプションの一覧については、Vercel Labs skills CLI のドキュメントを参照してください。 インストールが完了すると、エージェントが W&B Skills を利用できるようになり、Weights & Biases 関連のタスクを処理できる状態になります。

W&B Skills を使用する

project に関連する Weights & Biases のタスクをエージェントに依頼できます。次のプロンプト例は、W&B Skills を使ってエージェントが実行できるタスクの一部です。
  • 「PyTorch モデルのトレーニングメトリクスを Weights & Biases にログして。」
  • 「直近 10 件の run の損失曲線を分析して、最もパフォーマンスの高い設定を特定して。」
  • 「LangChain エージェントをトレースして、結果を Weave にログして。」
  • 「テストデータセットを使ってエージェントの評価を実行し、結果を要約して。」
  • 「直近の評価で発生した失敗モードを洗い出して分類して。」
  • 「run A と run B の設定を比較して、差分を表示して。」

W&B Skills の使い方のヒント

Skills は、漠然とした自由形式の質問よりも、具体的なクエリのほうが適切に回答できます。次の表では、推奨されるプロンプトと曖昧すぎるプロンプトを比較しています。

Weights & Biases MCP サーバー

Model Context Protocol (MCP) は、AI エージェントが外部ツールを呼び出せるようにするオープン標準です。Weights & Biases MCP サーバーを使用すると、IDE、コーディングアシスタント、チャットエージェントから Weights & Biases のデータやドキュメントに直接アクセスできます。そのため、エージェントはコピー&ペーストを必要とせずに、run、トレース、評価、アーティファクトに関する質問に回答できます。このサーバーでできることの詳細については、Weights & Biases MCP サーバーの機能セクションを参照してください。

デプロイメントタイプ

Weights & Biases MCP サーバーには、2 つのデプロイメントオプションがあります。すぐに使い始めたい場合はホスト型サーバーを使用し、より高い分離性や柔軟性が必要な場合はローカルバージョンを設定してください。ローカルバージョンでは、クライアントがサーバーにアクセスする際に別の URL を使用する必要があります。

ホスト型サーバー(推奨)

Weights & Biases が管理する MCP サーバーです。クライアントは APIキーを使用して HTTP 経由で接続します。インストールは不要で、ローカルプロセスを保守する必要もありません。ホスト型サーバーを使用する

ローカルインストール

MCP サーバーを自分のマシン上で STDIO または HTTP 経由で実行します。エアギャップ環境での運用、特定のリリースへのバージョン固定、サーバー動作のカスタマイズ、サーバー自体の開発を行う場合や、STDIO のみに対応したクライアントを使用する場合に適しています。MCP サーバーをローカルで実行する

前提条件

クライアントを設定する前に、以下の準備が整っていることを確認してください。
  • forge.coreweave.com/settings#apikeys で APIキーを作成します。
  • キーを WANDB_API_KEY 環境変数に設定するか、Bearer token としてクライアントに渡します。
  • 専用クラウド、セルフマネージド、およびデフォルト以外のインスタンスに接続するローカルインストールの場合は、WANDB_BASE_URL 環境変数にインスタンスの URL を設定します。
  • Weights & Biases では、mcp SDK のバージョンを 1.14.0 (リリース 2024-11-05) に固定しています。クライアントは mcp SDK 1.14.x で接続する必要があります。W&B 専用クラウドで Streamable HTTP を利用するには、mcp SDK 1.14.x のリリース 2025-03-26 以降が必須です。

ホスト型サーバーを使用する

Weights & Biases は、すべてのデプロイメントタイプ向けにマネージド MCP サーバーを提供しています。インストールは必要ありません。HTTP 経由で接続し、Authorization ヘッダーで APIキーを渡すようにクライアントを設定してください。

接続 URL

URL は、使用している Weights & Biases のデプロイメントのタイプによって異なります。 専用クラウドまたはセルフマネージドの場合は、https://mcp.withwandb.com/mcp を https://[YOUR-INSTANCE]/mcp に置き換えてください。それ以外の設定は変更不要です。以下のクライアント設定例では、Multi-tenant Cloud の URL を使用しています。
Weights & Biases の MCP サーバーを Claude Code に登録します。その際、Bearer token はご自身の APIキーに置き換えてください:
Claude Code をグローバルに設定するには、--scope user を追加します。現在の project のみを対象に設定する場合は、このオプションを省略します。List my W&B entities. と質問して、接続を検証します。エージェントが list_entities_tool を呼び出し、ユーザー名と所属するチームが返されれば成功です。接続に失敗した場合は、トラブルシューティングを参照してください。詳細については、Claude Code の MCP ドキュメントを参照してください。

MCP サーバーをローカルで実行する

ローカルインストールはホスト型サーバーの代替手段であり、どのデプロイメントタイプでもデフォルトではありません。ホスト型サーバーが環境構成に合わない場合に使用してください。 ローカルで実行する主な理由は次のとおりです。
  • エアギャップ環境またはオフライン環境で、クライアントがホスト型の Weights & Biases エンドポイントにアクセスできない場合。
  • バージョンを固定したい場合。ホスト型サーバーは main ブランチに追従します。ローカルインストールでは、特定のリリースタグにバージョンを固定できます。
  • サーバーの動作をカスタマイズしたい場合。ツールの説明の変更、ツールの追加、デフォルト以外の応答トークン予算の設定などが該当します。
  • サーバー自体を開発中の場合。
  • STDIO のみに対応するクライアント、またはローカルプロセスを必要とするクライアントを使用する場合。
専用クラウドまたはセルフマネージドのユーザーは、ホスト型サーバーを優先して使用してください。お使いのインスタンスでホスト型サーバーがまだ有効になっていない場合、または前述の理由のいずれかに該当する場合にのみ、wandb/wandb-mcp-server からローカルインストールしてください。その際は、WANDB_BASE_URL 環境変数にインスタンスの URL を設定します。

ローカル環境の前提条件

サーバーをローカルで実行するには、以下の要件を満たしていることを確認してください。
  • Python 3.11 以降
  • uv または pip
  • WANDB_API_KEY に設定済みの APIキー
  • 専用クラウドまたはセルフマネージドを使用している場合は、WANDB_BASE_URL にインスタンスの URL を設定済みであること

サーバーをインストールする

インストール方法を選択し、次のコマンドを実行して MCP サーバーをインストールします。

クライアントを設定する

サーバーをインストールしたら、サーバーを起動するようにクライアントを設定します。お使いの MCP クライアントを選択し、以下の設定を行います。必要に応じて、[YOUR-WANDB-API-KEY] をお使いのAPIキーに置き換えてください。
ローカルサーバーを Claude Code に登録します。グローバルに設定する場合は --scope user を追加します。

HTTP トランスポートでサーバーを実行する

Web ベースのクライアントで使用する場合やテストを行う場合は、HTTP トランスポートでサーバーを実行します。
ローカルサーバーを OpenAI Responses API などの外部クライアントに公開するには、トンネルを使用します。
トンネル URL を使用するように MCP クライアントの設定を更新します。

環境変数

以下の環境変数は、ローカルインストール時の認証、インスタンスのルーティング、サーバーの動作を制御します。クライアントの env ブロックで設定するか、シェルでエクスポートしてください。 コマンドラインの完全なリファレンスと詳細オプションについては、wandb-mcp-server README を参照してください。

Weights & Biases MCP サーバーの機能

MCP サーバーを使用すると、実験の分析、トレースのデバッグ、report の作成、Registry とアーティファクトの管理を行えるほか、Weights & Biases のドキュメントに基づいて質問に回答することもできます。以下のプロンプト例は、Weights & Biases MCP サーバーに接続したエージェントに依頼できるタスクの一部です。
  • 「your-team/your-project で eval/accuracy の上位 5 件の run を表示してください。」
  • 「採用エージェントの predict トレースのレイテンシーは、過去 1 か月でどのように推移しましたか?」
  • 「先週、採用エージェントが行った判断を比較する W&B report を生成してください。」
  • 「production-model アーティファクトにはどのようなバージョンがありますか?また、v2 と v3 の間で何が変わりましたか?」
  • 「Weave で leaderboard を作成するにはどうすればよいですか?」

利用可能なツール

このサーバーは、用途別に分類された複数のツールを提供します。次の表は、各ツールの名前、エージェントがそのツールを使用すべき場面、およびそのツールを呼び出すための具体的なプロンプト例を示しています。
project 名や entity 名を調べたり、スキーマを確認したりするためのツールです。

スキーマ優先のトレースクエリ

Weave のトレースをクエリする場合は、まず infer_trace_schema_tool を呼び出して利用可能なフィールドを確認し、次に取得する列を正確に指定したリストと detail_level を渡して query_weave_traces_tool を呼び出します。 このパターンを使用すると、広範な質問ではトークン使用量を低く抑えられ、エージェントは重要なトレースに対してのみ full に切り替えることができます。

使用のヒント

以下のセクションでは、Weights & Biases MCP サーバーをより効果的に活用するためのプラクティスとワークフローについて説明します。まず一般的なプラクティスを確認してから、ご自身のワークロードに合ったセクションで、より具体的なアドバイスや複数ステップのツールチェーンを確認してください。

一般的なベストプラクティス

ユースケースにかかわらず、次のプラクティスに従ってください。
  • entity と project を指定します。 MCP ツールには、entity (チームまたは個人アカウント) とプロジェクト名を明示的に指定する必要があります。すべての質問に両方を含めてください (例: 「your-team/your-project で」)。
  • 質問の焦点を絞ります。 「最も良い評価はどれですか?」ではなく、「F1 スコアが最も高い評価はどれですか?」のように質問してください。具体的なメトリクスや期間を指定すると、より的確なツール呼び出しが行われます。
  • すべて取得されたことを検証します。 「最もパフォーマンスの良い run はどれですか?」のような広範な質問では、最新の run だけでなく、利用可能なすべての run を取得したかどうかをエージェントに確認させてください。
  • W&B Skills と組み合わせます。 W&B Skills は、Weights & Biases のワークフローを構成する方法をコーディングエージェントに教えます。Skills はパターンを、MCP はデータへのアクセスを提供するため、両者を組み合わせると効果的です。

トレースを多用するワークフローの場合

Weave トレースを扱う際は、次のプラクティスに従ってください。
  • まずスキーマを確認します。 query_weave_traces_tool の前に infer_trace_schema_tool を呼び出し、有効なフィールドとフィルター値をエージェントに渡します。
  • 適切な detail_level を選択します。 概要の閲覧には schema、分析には summary (デフォルト) を使用します。full は、少数の特定のトレースを詳しく調べる場合にのみ使用してください。
  • resolve_trace_roots_tool をチェーンします。 子トレースをクエリした後、得られた trace_id のリストを resolve_trace_roots_tool に渡すと、1 回のバッチ Call で各トレースをルートセッションにマッピングできます。
  • 評価には summarize_evaluation_tool を優先して使用します。 このツールは Evaluation.evaluate と predict_and_score の階層を自動的に集計します。query_weave_traces_tool は、生のトレースデータが必要な場合にのみ使用してください。
エンドツーエンドのワークフローについては、失敗した LLM Call をトリアージするを参照してください。

run 中心のワークフロー向け

W&B run を扱う際は、次のプラクティスに従ってください。
  • クエリする前にプローブします。 使い慣れていない run ベースの project では、GraphQL を組み立てる前に probe_project_tool を呼び出して、メトリクスキー、設定キー、タグを確認します。
  • 時系列には get_run_history_tool を使用します。 GraphQL はサンプリングを行わないため、損失曲線などの時系列データには get_run_history_tool を使用するほうが高速かつ低コストです。
  • 差分の算出は compare_runs_tool に任せます。 このツールは設定とメトリクスの差分を、揃えた履歴とともに 1 回の呼び出しで返すため、手動で比較する必要はありません。
  • まずヘルスチェックを実行します。 トレーニング run の挙動がおかしい場合は、履歴を手動で調べる前に diagnose_run_tool を呼び出します。
エンドツーエンドのワークフローについては、問題のあるトレーニング run を診断すると評価を要約してモデルのバージョンを比較するを参照してください。

専用クラウドおよびセルフマネージドの場合

マルチテナント以外のデプロイメントでは、次のプラクティスに従ってください。
  • インスタンス上の https://[YOUR-INSTANCE]/mcp にあるホスト型サーバーを優先して使用してください。このサーバーは Multi-tenant サーバーと同じツールを提供しており、クライアント側で WANDB_BASE_URL を設定する必要はありません。ローカルインストールは、ホスト型サーバーがまだ有効になっていない場合にのみ使用してください。
  • インスタンスに対してローカルで実行する場合は、クライアントの env ブロックで WANDB_BASE_URL にインスタンスの URL を設定してください。設定しないと、サーバーは api.wandb.ai に接続するため、データは返されません。
  • 専用クラウドのレート制限は、Multi-tenant とは別に設定されています。デフォルト値や変更のリクエスト方法については、専用クラウドのレート制限を参照してください。

ローカルインストールの場合

ご自身のマシンでサーバーを実行する場合は、次のプラクティスに従ってください。
  • デスクトップクライアント (Cursor、VS Code、Claude Code、Claude Desktop) では、STDIO トランスポートを優先して使用してください。HTTP トランスポートに切り替えるのは、クライアントが明示的に必要とする場合 (OpenAI Responses API など) に限定してください。
  • ツール呼び出しがエラーを出さずに失敗する場合は、クライアントの env ブロックで MCP_SERVER_LOG_LEVEL=DEBUG を設定し、クライアントの MCP ログを改めて確認してください。
  • GitHub からインストールする場合 (uvx --from git+https://github.com/wandb/wandb-mcp-server wandb_mcp_server) 、uvx はデフォルトブランチに固定されます。安定したバージョンが必要な場合は、Git URL の末尾に @v0.3.2 を付けて、特定のタグを明示的に指定してください。
実際の質問の多くは、1 つのツールだけでは解決できません。以下のワークフローでは、エージェントに依頼できる、複数のステップからなる一般的なツールチェーンを紹介します。

見慣れない project を調べる

project にログされた内容を調べるには、次のツールを順に組み合わせて使用します。
  1. list_entities_tool で entity またはチームを検索します。
  2. query_wandb_entity_projects で project を検索します。
  3. run ベースの project には probe_project_tool を、Weave トレースの project には infer_trace_schema_tool を使用します。
  4. 検出したキーを使って、対象を絞った query_wandb_tool または query_weave_traces_tool を呼び出します。

失敗した LLM Call のトリアージ

問題のあるトレースと、その発生元のセッションを検索するには、次のツールをチェーンで組み合わせて使用します。
  1. error フィールドまたは exception フィールドでフィルターし、detail_level="summary" を指定して query_weave_traces_tool を実行します。
  2. 得られた trace_id のリストに対して resolve_trace_roots_tool を実行し、各失敗をそのルートセッションに対応付けます。
  3. 対象を絞った少数のルートに対して detail_level="full" を指定して query_weave_traces_tool を実行し、詳細を掘り下げます。
  4. create_wandb_report_tool を使用して、検出結果をまとめます。

不調なトレーニング run を診断する

問題が疑われるトレーニング run のヘルスチェックを行うには、次のツールを順に組み合わせて使用します。
  1. get_run_history_tool で損失曲線と検証曲線を取得します。
  2. diagnose_run_tool で収束、過学習、NaN を自動チェックします。
  3. compare_runs_tool で、正常であることが確認済みのベースライン run と比較します。
  4. create_wandb_report_tool で折れ線グラフのパネルを含む report を作成し、診断結果を共有します。

評価を要約してモデルのバージョンを比較する

評価で最も高い性能を示したモデルのバージョンを検索するには、次のツールをチェーンとして組み合わせます。
  1. summarize_evaluation_tool で、scorer ごとの合格率とエラー数を取得します。
  2. 対象のモデルコレクションに対して list_artifact_versions_tool を実行します。
  3. 候補バージョンと現在の本番バージョンを対象に compare_artifact_versions_tool を実行します。
  4. log_analysis_to_wandb と create_wandb_report_tool を使用して、比較結果をパブリッシュします。

トラブルシューティング

Weights & Biases MCP サーバーの使用中に発生した問題を診断・解決するには、次の表を参考にしてください。
最終更新日 2026年9月30日