Skip to main content
Agents ビューでは、エージェントのすべての会話をターンごとに記録し、トークン使用量、ツール invocation、実行スパンとともに確認できます。 エージェントアプリケーションのデバッグが難しいのは、注目すべき動作がユーザーのリクエストから最終的な応答までの間に起こるためです。W&B Weave の Agents ビューは、この中間層を可視化します。ここでは、エージェントのすべての会話が取得され、メッセージ履歴全体、スパン単位の実行の詳細、トークンのコストが関連付けられます。エージェントがタスクを完了したか、ツール呼び出しを何回行ったか、どこで時間や費用が費やされたかを一目で確認できます。エージェントの構築と改善を繰り返すチームにとって、本番環境での動作を理解するための出発点となります。

はじめに

project の Agents ビューを開くには、次の手順に従います。
  1. Forge にアクセスし、project を選択します。
  2. サイドバーメニューで Agents を選択すると、project に保存されたすべてのエージェントの会話が表示されます。
Agents ビューの上部には、Dashboard、Agents、Conversations、Spans、Signals のタブが並んでいます。Dashboard タブでは project 全体のエージェントの活動の概要を確認でき、その他のタブでは個々のエージェント、会話、スパン、シグナルの詳細を確認できます。

Dashboard タブ

Dashboard タブは、project 全体のすべてのエージェントの活動を概観できます。一目で把握できるように設計されているため、チームは特定のエージェントや会話を詳しく調べる前に、毎日のヘルスチェックの出発点として使用します。 Dashboard タブに表示される、project 全体のエージェントの活動に関する統計サマリーカード、時系列の処理量チャート、上位 N 件の内訳。 上部のサマリーカードには、選択したウィンドウの合計値として Spans、Conversations、Tokens、Cost、Error rate、Agents が表示されます。カードの下には、スパン数、会話数、トークン数、コストの推移を示す時系列チャートが、エラー数やシグナルの活動とともに表示されます。最下段には、使用量に基づく上位のツール、エージェント、モデル、プロバイダーの内訳が表示されます。左側には最近の会話またはスパンの一覧が表示され、Conversations と Spans を切り替えられます。期間セレクターでは、すべてのパネルに反映される期間を指定します。

Agents tab

Agents タブでは、この project にトレースをログしたすべてのエージェントの概要を確認できます。実行中のエージェントを把握したり、エージェント間でレイテンシーやエラー率を比較したりするのに役立ちます。また、個々の会話を詳しく調べる前に、対応が必要なエージェントを特定するのにも便利です。 エージェントカードのグリッドを表示する Agents タブ。各カードには会話数、スパン数、コスト、平均レイテンシー、エラー率が表示されています。 次のようなシナリオで役立ちます。
  • エージェントのフリートをモニタリングする。 カードグリッドを使用すると、個々の会話を開かなくても、すべてのエージェントのレイテンシーとエラー率を一度に比較できます。 いずれかのカードでレイテンシーが急上昇していたり、エラー率が新たに赤く表示されていたりする場合は、調査すべき回帰が発生している可能性があります。
  • 古いエージェントを特定する。 Last seen で並べ替えると、最近アクティビティを記録していないエージェントが強調表示されます。デプロイメントが稼働中であることを確認したり、予期せずトレースのログが止まった可能性のあるエージェントを見つけたりするのに役立ちます。
  • バージョンを比較する。 各カードのバージョン数は、そのエージェントでこれまでにデプロイされた一意のバージョンの数を示します。バージョン数が多く、かつエラー率が上昇している場合は、最近のデプロイメントで回帰が導入された可能性があります。
  • エージェントを詳しく調べる。 任意のカードをクリックすると、そのエージェントの詳細パネルが開き、そこから会話やスパンにアクセスできます。
Agents タブで選択されたエージェントカード。右側に詳細パネルが開き、エージェントのメタデータとナビゲーションオプションが表示されています。

エージェントカード

各エージェントは、次の情報を示すカードとして表示されます。

エージェントの検索と並べ替え

Search and filter agents フィールドを使用して、エージェント名でエージェントを検索します。 並べ替えドロップダウン (デフォルト: Last seen) を使用して、グリッドの順序を変更します。利用可能な並べ替えオプションは次のとおりです。
  • Last seen: 直近に実行中だったエージェントから順に表示されます。
  • Most invocations: 会話量が多い順に表示されます。
  • Most input tokens: トークン消費量が多い順に表示されます。
  • Most errors: エラー数が多い順に表示されます。
Most errors で並べ替えると、毎日の簡単なヘルスチェックに便利です。エラー率がゼロでないエージェントがすぐに上位に表示され、カード上の赤いエラー率で、調査が必要なエージェントを一目で確認できます。

Conversations tab

Conversations タブは、Agents ページで個々のエージェント run を閲覧、フィルター、検査できます。これを使用して、失敗の調査、トークンコストの測定、run を構成する LLM Call と ツール実行 のシーケンスを理解できます。 会話全体でエージェントが何を言い、何をしたかについての高レベルの質問については、Conversations タブから始めます。 エージェントの会話のリストを表示する Conversations タブ。列にはエージェント名、invocation、スパン、トークン数、最終アクティビティが含まれます。

会話表

会話表には、会話ごとに1行が表示されます。デフォルトで以下の列が表示されます。 スパン列には、会話内のイベントの流れをプレビューする色分けされたストリップもレンダリングされます。このストリップでは、Events timelineと同じイベントの色が使用されます。そのため、会話を開かなくても、ツール呼び出しが中心か、LLM呼び出しが中心か、サブエージェントへの委譲が含まれていたかを一目で判断できます。 追加の列を表示または非表示にするには、ツールバーの Columns をクリックします。

フィルターと期間セレクター

フィルター バーを使用して、エージェント、モデル、エラーステータス、またはその他の属性で結果を絞り込みます。 SDK でエージェント スパンに設定したカスタム属性も、ここでフィルターできます。会話リストを特定の属性の特定の値にフィルターできます。 カスタム属性を独自の列として表示するには、ツールバーで Columns をクリックします。これらの属性の設定方法については、エージェント スパンに属性とイベントを設定する を参照してください。 期間セレクター (1m、1h、6h、24h、7d、または 30d) を使用して、その期間内に実行中だった会話をリストに制限します。リスト上の会話ボリュームのヒストグラムは、選択したウィンドウを反映するように更新されます。 会話リストの任意の列ヘッダーにホバーして、その列を特定の値または範囲にフィルターします。

エージェントの会話の詳細

会話の行をクリックすると詳細パネルが開きます。このパネルには、ターン と Events の 2 つのサブパネルがあります。パネルのヘッダーには、エージェント名と会話 ID のほか、Summarize (会話の要約を生成) と データセットに追加 の action が表示されます。 Conversations タブで会話を選択し、詳細パネルを開いた状態。ターンごとのメッセージスレッド、ツール呼び出し、推論に加え、右側に Events timeline が表示されています。

ターン

会話の詳細のターンパネルには、時系列順に各ターンが表示され、1から番号が付けられます。 各ターンには、中間応答とツール呼び出しの数、および合計のウォールクロック時間が表示されます。ターンを展開すると、完全なメッセージスレッドが表示されます。 ターン内では、メッセージはロール別にグループ化されます。 ユーザーメッセージには、メッセージのテキストと、関連付けられたメディアやコンテンツへの 参照が表示されます。 アシスタント メッセージには、次の情報が表示されます。
  • エージェント名と使用したモデル (例:gpt-5.5-2026-04-23) 。
  • タイムスタンプと所要時間。
  • 入力と出力のトークン数およびコスト (例:18823 in · 96 out · $0.0717) 。
  • モデルが拡張思考を使用した場合、展開可能な推論セクション。
  • 応答テキスト。長い応答は自動的に折りたたまれます。
ツール呼び出しには、ツール名、タイムスタンプ、所要時間が表示されます。引数または 結果のデータがある場合、ツール呼び出しを展開すると、引数と 結果がキーと値の表に表示されます。呼び出しが失敗した場合は、ERROR バッジが 表示されます。 ツール呼び出しがエラーのステータスを返すと、赤い ERROR バッジがインラインで その横に表示されます。Events timeline では、そのイベントもタイプに関係なく赤で表示されます。

イベント

右側の Events パネルには、選択したターン内のイベントの順序を表す 色分けされた帯が表示されます。 Events タイムラインでは、各区間の色がイベントのタイプを示します。 Events タイムラインを使用すると、ターンの構成をすばやく把握できます。たとえば、 メッセージスレッド全体を読む前に、LLM が中心だったのか、ツールが中心だったのか、 サブエージェントへの委譲が含まれていたのかを確認できます。 project で有効なシグナルがある場合、スコアセクションに会話のメトリクスが表示されます。シグナルのスコアラー名、0 から 1 の総合的な数値評価、 信頼度のパーセンテージ、およびスコアに寄与した個々の評価基準の項目が 表示されます。各評価項目には、それぞれの信頼度も表示されます。これを使用すると、 ターンのスコアが良好だったかどうかだけでなく、具体的にどの評価基準に 合格または不合格だったかを把握できます。 メタサマリーセクションには、選択した 会話の集計統計が表示されます。 Token breakdown セクションでは、選択した会話のキャッシュと推論の詳細が表示されます。 参加者セクションには、会話に関与するエージェントとモデルが 一覧表示されます。複数のエージェントによる会話では、ターンごとに異なる モデル名がここに表示されることがあります。

エージェントのメッセージをデータセットに追加する

Dataset にエージェントのメッセージを追加するには:
  1. 会話の詳細パネルのヘッダーで、Add to dataset をクリックして Add example to dataset ドロワーを開きます。
  2. Choose a dataset で、トレースを追加するデータセットをドロップダウンから選択します。
  3. Select context で、データセットに追加するメッセージを選択します。Next をクリックします。
  4. 選択内容を確認し、Add to dataset をクリックします。

Spans タブ

Spans タブには、project 内のすべてのエージェントの 活動で記録された個々のスパンが表示されます。Conversations タブは活動を 対話単位の行に集約します。Spans タブは、その基盤となる操作を表示します。各 LLM Call、ツール実行、エージェントの invocation がそれぞれ独立した行になります。このタブを使用すると、 どの Call が遅かったか、どのモデルが想定外のトークンを消費したか、どの ツール invocation が失敗したかを正確に追跡できます。 エージェントの会話のスパンを表示する Spans タブ。

スパン表

スパン表は、会話表とほとんどの列を共有しています (エージェント、モデル、 ツール、トークン数、ステータス) 。このビュー固有の列には、次のものがあります。 キャッシュのトークン数の内訳、推論トークン、LLM パラメーター、W&B run のメタデータに関する追加の列は、列ボタンから表示できます。 スパンタブは、会話タブでは得られない操作単位の詳細が 必要な場合に特に役立ちます。
  • コストの高い Call の特定。 In または Out のトークン数で並べ替えて、 会話単位の合計ではなく、どの個別の LLM Call がコストを 増加させているかを検索します。
  • 特定の操作タイプのデバッグ。 オペレーションでフィルターして、 すべての execute_tool スパンを抽出してエラー率を確認したり、特定の モデルのすべての chat スパンを抽出したりします。
  • 出力の切り詰めの調査。 終了を max_tokens でフィルターして、 正常に完了せず、モデルがトークン上限に達したスパンを検索します。
  • W&B run との関連付け。 デフォルトでは非表示の列に W&B run ID と run のステップが表示されるため、特定のスパンを W&B のトレーニング run や 評価 run に関連付けることができます。

トレースグループ

任意の行をクリックすると、そのトレースが選択され、同じトレース ID を共有する他のすべてのスパンがハイライト表示されます。これにより、1 回のエージェントの invocation で実行されたすべての操作を確認できます。ここでは、会話単位ではなくトレース単位でグループ化されます。そのため、サブエージェントへの委譲が行われた場合、1 つの会話に複数のトレースが含まれることがあります。

エージェントの invocation の詳細

Spans 表の行をクリックすると、選択した完全なエージェントの invocation のデータが表示された詳細パネルが開きます。 詳細パネルの上部には、選択したトレース内のすべてのスパンのウォールクロック位置と相対的な継続時間を、滝のように配置した棒チャートが表示されます。親の invocation は全幅にわたり、各子スパンはその実際の継続時間に合わせてスケーリングされた色付きのバーとしてその下に表示され、トレースの開始からのミリ秒単位の開始時刻に位置づけられます。タイムラインを使用して以下を行います:
  • 一目で最も長い操作を見つける。 幅の広いバーは、合計レイテンシーの大部分を占めたスパンを示します。
  • 並列度を確認する。 重なり合うバーは、順次ではなく同時に実行されたスパンを示します。
  • 任意のスパンをインラインで検査する。 タイムラインのバーをクリックすると、そのスパンの詳細 (入力メッセージと出力メッセージ、トークン数、その他の メタデータ を含む) がビューに読み込まれます。
The Spans tab with a trace selected, highlighting a group of related spans in the table and showing the waterfall bar chart in the detail panel on the right. 詳細パネルのヘッダーで Show trace tree アイコンを選択すると、子スパンを階層的なトレース ツリーとして表示することもできます。

シグナル タブ

シグナルタブには、エージェントの会話のタグと評価が表示されます。シグナルは品質や安全性の問題を明らかにし、問題の検出、パターンの検索、注意が必要なトレースの強調表示に役立ちます。シグナルを使用すると、エージェントの応答の品質を自動的にスコア化したり、ユーザーの不満を検知したり、NSFW コンテンツにフラグを付けたりできます。 設定方法と詳しい使用方法については、シグナルでエージェントを監視するを参照してください。
最終更新日 2026年9月30日