はじめに
project の Agents ビューを開くには、次の手順に従います。- Forge にアクセスし、project を選択します。
- サイドバーメニューで Agents を選択すると、project に保存されたすべてのエージェントの会話が表示されます。
Dashboard タブ
Dashboard タブは、project 全体のすべてのエージェントの活動を概観できます。一目で把握できるように設計されているため、チームは特定のエージェントや会話を詳しく調べる前に、毎日のヘルスチェックの出発点として使用します。
上部のサマリーカードには、選択したウィンドウの合計値として Spans、Conversations、Tokens、Cost、Error rate、Agents が表示されます。カードの下には、スパン数、会話数、トークン数、コストの推移を示す時系列チャートが、エラー数やシグナルの活動とともに表示されます。最下段には、使用量に基づく上位のツール、エージェント、モデル、プロバイダーの内訳が表示されます。左側には最近の会話またはスパンの一覧が表示され、Conversations と Spans を切り替えられます。期間セレクターでは、すべてのパネルに反映される期間を指定します。
Agents tab
Agents タブでは、この project にトレースをログしたすべてのエージェントの概要を確認できます。実行中のエージェントを把握したり、エージェント間でレイテンシーやエラー率を比較したりするのに役立ちます。また、個々の会話を詳しく調べる前に、対応が必要なエージェントを特定するのにも便利です。
次のようなシナリオで役立ちます。
- エージェントのフリートをモニタリングする。 カードグリッドを使用すると、個々の会話を開かなくても、すべてのエージェントのレイテンシーとエラー率を一度に比較できます。 いずれかのカードでレイテンシーが急上昇していたり、エラー率が新たに赤く表示されていたりする場合は、調査すべき回帰が発生している可能性があります。
- 古いエージェントを特定する。 Last seen で並べ替えると、最近アクティビティを記録していないエージェントが強調表示されます。デプロイメントが稼働中であることを確認したり、予期せずトレースのログが止まった可能性のあるエージェントを見つけたりするのに役立ちます。
- バージョンを比較する。 各カードのバージョン数は、そのエージェントでこれまでにデプロイされた一意のバージョンの数を示します。バージョン数が多く、かつエラー率が上昇している場合は、最近のデプロイメントで回帰が導入された可能性があります。
- エージェントを詳しく調べる。 任意のカードをクリックすると、そのエージェントの詳細パネルが開き、そこから会話やスパンにアクセスできます。
エージェントカード
各エージェントは、次の情報を示すカードとして表示されます。エージェントの検索と並べ替え
Search and filter agents フィールドを使用して、エージェント名でエージェントを検索します。 並べ替えドロップダウン (デフォルト: Last seen) を使用して、グリッドの順序を変更します。利用可能な並べ替えオプションは次のとおりです。- Last seen: 直近に実行中だったエージェントから順に表示されます。
- Most invocations: 会話量が多い順に表示されます。
- Most input tokens: トークン消費量が多い順に表示されます。
- Most errors: エラー数が多い順に表示されます。
Conversations tab
Conversations タブは、Agents ページで個々のエージェント run を閲覧、フィルター、検査できます。これを使用して、失敗の調査、トークンコストの測定、run を構成する LLM Call と ツール実行 のシーケンスを理解できます。 会話全体でエージェントが何を言い、何をしたかについての高レベルの質問については、Conversations タブから始めます。
会話表
会話表には、会話ごとに1行が表示されます。デフォルトで以下の列が表示されます。
スパン列には、会話内のイベントの流れをプレビューする色分けされたストリップもレンダリングされます。このストリップでは、Events timelineと同じイベントの色が使用されます。そのため、会話を開かなくても、ツール呼び出しが中心か、LLM呼び出しが中心か、サブエージェントへの委譲が含まれていたかを一目で判断できます。
追加の列を表示または非表示にするには、ツールバーの Columns をクリックします。
フィルターと期間セレクター
フィルター バーを使用して、エージェント、モデル、エラーステータス、またはその他の属性で結果を絞り込みます。 SDK でエージェント スパンに設定したカスタム属性も、ここでフィルターできます。会話リストを特定の属性の特定の値にフィルターできます。 カスタム属性を独自の列として表示するには、ツールバーで Columns をクリックします。これらの属性の設定方法については、エージェント スパンに属性とイベントを設定する を参照してください。 期間セレクター (1m、1h、6h、24h、7d、または 30d) を使用して、その期間内に実行中だった会話をリストに制限します。リスト上の会話ボリュームのヒストグラムは、選択したウィンドウを反映するように更新されます。 会話リストの任意の列ヘッダーにホバーして、その列を特定の値または範囲にフィルターします。エージェントの会話の詳細
会話の行をクリックすると詳細パネルが開きます。このパネルには、ターン と Events の 2 つのサブパネルがあります。パネルのヘッダーには、エージェント名と会話 ID のほか、Summarize (会話の要約を生成) と データセットに追加 の action が表示されます。
ターン
会話の詳細のターンパネルには、時系列順に各ターンが表示され、1から番号が付けられます。 各ターンには、中間応答とツール呼び出しの数、および合計のウォールクロック時間が表示されます。ターンを展開すると、完全なメッセージスレッドが表示されます。 ターン内では、メッセージはロール別にグループ化されます。 ユーザーメッセージには、メッセージのテキストと、関連付けられたメディアやコンテンツへの 参照が表示されます。 アシスタント メッセージには、次の情報が表示されます。- エージェント名と使用したモデル (例:
gpt-5.5-2026-04-23) 。 - タイムスタンプと所要時間。
- 入力と出力のトークン数およびコスト (例:
18823 in · 96 out · $0.0717) 。 - モデルが拡張思考を使用した場合、展開可能な推論セクション。
- 応答テキスト。長い応答は自動的に折りたたまれます。
イベント
右側の Events パネルには、選択したターン内のイベントの順序を表す 色分けされた帯が表示されます。 Events タイムラインでは、各区間の色がイベントのタイプを示します。
Events タイムラインを使用すると、ターンの構成をすばやく把握できます。たとえば、
メッセージスレッド全体を読む前に、LLM が中心だったのか、ツールが中心だったのか、
サブエージェントへの委譲が含まれていたのかを確認できます。
project で有効なシグナルがある場合、スコアセクションに会話のメトリクスが表示されます。シグナルのスコアラー名、0 から 1 の総合的な数値評価、
信頼度のパーセンテージ、およびスコアに寄与した個々の評価基準の項目が
表示されます。各評価項目には、それぞれの信頼度も表示されます。これを使用すると、
ターンのスコアが良好だったかどうかだけでなく、具体的にどの評価基準に
合格または不合格だったかを把握できます。
メタサマリーセクションには、選択した
会話の集計統計が表示されます。
Token breakdown セクションでは、選択した会話のキャッシュと推論の詳細が表示されます。
参加者セクションには、会話に関与するエージェントとモデルが
一覧表示されます。複数のエージェントによる会話では、ターンごとに異なる
モデル名がここに表示されることがあります。
エージェントのメッセージをデータセットに追加する
Dataset にエージェントのメッセージを追加するには:
- 会話の詳細パネルのヘッダーで、Add to dataset をクリックして Add example to dataset ドロワーを開きます。
- Choose a dataset で、トレースを追加するデータセットをドロップダウンから選択します。
- Select context で、データセットに追加するメッセージを選択します。Next をクリックします。
- 選択内容を確認し、Add to dataset をクリックします。
Spans タブ
Spans タブには、project 内のすべてのエージェントの 活動で記録された個々のスパンが表示されます。Conversations タブは活動を 対話単位の行に集約します。Spans タブは、その基盤となる操作を表示します。各 LLM Call、ツール実行、エージェントの invocation がそれぞれ独立した行になります。このタブを使用すると、 どの Call が遅かったか、どのモデルが想定外のトークンを消費したか、どの ツール invocation が失敗したかを正確に追跡できます。
スパン表
スパン表は、会話表とほとんどの列を共有しています (エージェント、モデル、 ツール、トークン数、ステータス) 。このビュー固有の列には、次のものがあります。
キャッシュのトークン数の内訳、推論トークン、LLM
パラメーター、W&B run のメタデータに関する追加の列は、列ボタンから表示できます。
スパンタブは、会話タブでは得られない操作単位の詳細が
必要な場合に特に役立ちます。
- コストの高い Call の特定。 In または Out のトークン数で並べ替えて、 会話単位の合計ではなく、どの個別の LLM Call がコストを 増加させているかを検索します。
- 特定の操作タイプのデバッグ。 オペレーションでフィルターして、
すべての
execute_toolスパンを抽出してエラー率を確認したり、特定の モデルのすべてのchatスパンを抽出したりします。 - 出力の切り詰めの調査。 終了を
max_tokensでフィルターして、 正常に完了せず、モデルがトークン上限に達したスパンを検索します。 - W&B run との関連付け。 デフォルトでは非表示の列に W&B run ID と run のステップが表示されるため、特定のスパンを W&B のトレーニング run や 評価 run に関連付けることができます。
トレースグループ
任意の行をクリックすると、そのトレースが選択され、同じトレース ID を共有する他のすべてのスパンがハイライト表示されます。これにより、1 回のエージェントの invocation で実行されたすべての操作を確認できます。ここでは、会話単位ではなくトレース単位でグループ化されます。そのため、サブエージェントへの委譲が行われた場合、1 つの会話に複数のトレースが含まれることがあります。エージェントの invocation の詳細
Spans 表の行をクリックすると、選択した完全なエージェントの invocation のデータが表示された詳細パネルが開きます。 詳細パネルの上部には、選択したトレース内のすべてのスパンのウォールクロック位置と相対的な継続時間を、滝のように配置した棒チャートが表示されます。親の invocation は全幅にわたり、各子スパンはその実際の継続時間に合わせてスケーリングされた色付きのバーとしてその下に表示され、トレースの開始からのミリ秒単位の開始時刻に位置づけられます。タイムラインを使用して以下を行います:- 一目で最も長い操作を見つける。 幅の広いバーは、合計レイテンシーの大部分を占めたスパンを示します。
- 並列度を確認する。 重なり合うバーは、順次ではなく同時に実行されたスパンを示します。
- 任意のスパンをインラインで検査する。 タイムラインのバーをクリックすると、そのスパンの詳細 (入力メッセージと出力メッセージ、トークン数、その他の メタデータ を含む) がビューに読み込まれます。
詳細パネルのヘッダーで Show trace tree アイコンを選択すると、子スパンを階層的なトレース ツリーとして表示することもできます。