> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# launch キューをモニタリングする

> インタラクティブなダッシュボードで launch キューのワークロードをモニタリングし、非効率なジョブを特定してリソースの使用状況を分析します。

インタラクティブな **Queue monitoring dashboard** を使用すると、launch キューが高負荷の状態かアイドル状態かを確認したり、実行中のワークロードを可視化したり、非効率なジョブを特定したりできます。launch キューのダッシュボードを使えば、コンピュートハードウェアやクラウドリソースを効率的に使用できているかどうかを判断できます。

さらに詳しく分析する場合は、このページから W\&B の実験管理 Workspace や、Datadog、NVIDIA Base Command、クラウドコンソールなどの外部インフラストラクチャーモニタリングプロバイダーにアクセスできます。

<Note>
  キューのモニタリングダッシュボードは、W\&B Multi-tenant Cloud デプロイメントオプションでのみ利用できます。
</Note>

<h2 id="dashboard-and-plots">
  ダッシュボードとプロット
</h2>

**Monitor** タブを使用すると、過去 7 日間のキューのアクティビティを確認できます。時間範囲、グループ化、フィルターは左側のパネルで設定します。

ダッシュボードには複数のプロットがあり、パフォーマンスや効率に関するよくある疑問を把握するのに役立ちます。以下のセクションでは、キューダッシュボードの UI 要素について説明します。

<h3 id="job-status">
  ジョブステータス
</h3>

**Job status** プロットには、各時間間隔で実行中、保留中、キューに追加済み、完了のジョブがそれぞれいくつあるかが表示されます。**Job status** プロットを使用すると、キューがアイドル状態になっている期間を特定できます。

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/platform/_media/launch_obs_jobstatus.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=a03ac7e71ed00cb26f1a08593b7eed37" alt="ジョブステータスのタイムライン" width="2550" height="650" data-path="products/wandb/platform/_media/launch_obs_jobstatus.png" />
</Frame>

たとえば、固定リソース (DGX BasePod など) を使用しているとします。固定リソースでキューがアイドル状態になっている場合は、その空き時間を利用して、sweep などの優先度の低いプリエンプト可能な Launch job を実行できる可能性があります。

一方、クラウドリソースを使用していて、アクティビティが周期的に急増している場合は、特定の時間帯にリソースを予約することでコストを削減できる可能性があります。

プロットの右側にある凡例には、各色がどの [Launch job のステータス](/ja/products/wandb/platform/launch/launch-view-jobs#check-the-status-of-a-job)を表すかが示されます。

<Note>
  `Queued` のアイテムが多い場合は、ワークロードを他のキューに移すことを検討できます。失敗が急増している場合は、Launch job のセットアップにサポートが必要なユーザーを特定する手がかりになります。
</Note>

<h3 id="queued-time">
  キュー時間
</h3>

**Queued time** プロットには、指定した日付または時間範囲において Launch job がキューで待機していた時間 (秒単位) が表示されます。

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/platform/_media/launch_obs_queuedtime.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=19eb7ad9b44345d556203ffadd2fbc18" alt="キュー時間のメトリクス" width="2384" height="618" data-path="products/wandb/platform/_media/launch_obs_queuedtime.png" />
</Frame>

X 軸には指定した時間、Y 軸には Launch job が launch キューで待機していた時間 (秒単位) が表示されます。たとえば、ある日に 10 個の Launch job がキューに追加されたとします。これら 10 個の Launch job がそれぞれ平均 60 秒待機した場合、**Queue time** プロットには 600 秒と表示されます。

<Note>
  **Queued time** プロットを使用すると、キュー時間が長いことで影響を受けているユーザーを特定できます。
</Note>

左側のバーにある **Grouping** コントロールを使用すると、ジョブごとに色をカスタマイズできます。これにより、キューのキャパシティ不足の影響を受けているユーザーやジョブを特定しやすくなります。

<h3 id="job-runs">
  Job runs
</h3>

**Job runs** プロットには、指定した期間内に実行されたすべてのジョブの開始と終了が、run ごとに一意の色で表示されます。これにより、特定の時点でキューがどのワークロードを処理していたかを一目で把握できます。

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/platform/_media/launch_obs_jobruns2.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=8a070ac1d1aa39d437bca5f2ed8446ac" alt="Job runs のタイムライン" width="2390" height="720" data-path="products/wandb/platform/_media/launch_obs_jobruns2.png" />
</Frame>

パネル右下の **Select** ツールを使用してジョブをブラシ選択すると、その詳細が下の表に表示されます。

<h3 id="cpu-and-gpu-usage">
  CPU と GPU の使用状況
</h3>

**GPU use by a job**、**CPU use by a job**、**GPU memory by job**、**System memory by job** の各プロットを使用すると、Launch job の効率を確認できます。

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/platform/_media/launch_obs_gpu.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=b5bcc644c93646a7035a9d7444a3224b" alt="GPU 使用状況のメトリクス" width="2672" height="1696" data-path="products/wandb/platform/_media/launch_obs_gpu.png" />
</Frame>

たとえば、**GPU memory by job** プロットを使用すると、W\&B run の完了に時間がかかっていないか、また CPU コアの使用率が低くなっていないかを確認できます。

各プロットの X 軸は、W\&B run (Launch job によって作成されたもの) の実行時間を秒単位で示します。データポイントにマウスカーソルを合わせると、run ID、run が属する project、その W\&B run を作成した Launch job など、W\&B run に関するさまざまな情報が表示されます。

<h3 id="errors">
  Errors
</h3>

**Errors** パネルには、特定の launch キューで発生したエラーが表示されます。具体的には、エラーが発生した日時のタイムスタンプ、エラーの発生元である Launch job 名、および生成されたエラーメッセージが表示されます。デフォルトでは、エラーは新しい順に表示されます。

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/platform/_media/launch_obs_errors.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=11b6383ac61619ee8c8a600e65e836b1" alt="エラーログパネル" width="2532" height="834" data-path="products/wandb/platform/_media/launch_obs_errors.png" />
</Frame>

**Errors** パネルを使用すると、問題が発生しているユーザーを特定し、その問題を解消できます。

<h2 id="external-links">
  外部リンク
</h2>

キューの可観測性ダッシュボードの表示はすべてのキュータイプで共通ですが、環境固有のモニターに直接移動できると便利なことがよくあります。その場合は、キューの可観測性ダッシュボードから、コンソールへのリンクを直接追加します。

外部リンクを追加するには、**Manage Links** をクリックしてパネルを開きます。目的のページの完全な URL を入力し、続いてラベルを入力します。追加したリンクは **External Links** セクションに表示されます。
