> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

> Reference for CPU, GPU, memory, disk, and network system metrics that the W&B SDK automatically logs during runs.

# System Metrics Reference

このページでは、W\&B SDK が追跡するシステムメトリクスの詳細情報を提供します。

<Note>
  `wandb` は 15 秒ごとにシステムメトリクスを自動的にログします。
</Note>

<h2 id="view-system-metrics">
  システムメトリクスを表示する
</h2>

W\&B アプリまたは `wandb leet` ターミナル UI を使用して、システムメトリクスを表示および監視できます。

<Tabs>
  <Tab title="App">
    W\&B アプリでシステムメトリクスを表示するには:

    1. W\&B アプリで対象の project にアクセスします。
    2. **Runs** 表から run を選択します。
    3. Workspace で **System** セクションを探します。このセクションには次のチャートが表示されます:
       * GPU 使用率とメモリ
       * CPU 使用量
       * メモリ使用量
       * ディスク I/O
       * ネットワークトラフィック

    Workspace にパネルを追加すると、表示するシステムメトリクスをカスタマイズできます。可視化の作成とカスタマイズの詳細については、[パネル](/ja/products/wandb/app/features/panels)を参照してください。
  </Tab>

  <Tab title="LEET">
    `wandb leet` ターミナル UI を使用して、ローカル run のシステムメトリクスをターミナルで表示するには:

    1. スクリプトからローカルで run を開始した場合は、コードを実行したディレクトリに移動します。このディレクトリには `wandb/` ディレクトリがあり、その中に run ごとのサブディレクトリと `latest-run/` シンボリックリンクが含まれています。各 run ディレクトリには、`run-<run-ID>.wandb` という形式の名前のトランザクションログがあります。

       run をローカルで開始せず、`.wandb` トランザクションログファイルをダウンロードした場合は、そのファイルの場所を控えておいてください。
    2. 次のいずれかのコマンドで `wandb leet` を起動します:

       ```bash theme={"system"}
       # Workspace を開き、最新のローカル run を選択する
       wandb leet

       # run ディレクトリを指定する
       wandb leet ./wandb/run-20250813_124246-n67z9ude

       # .wandb ファイルを指定する
       wandb leet ./wandb/run-20250813_124246-n67z9ude/run-n67z9ude.wandb
       ```

    run パスを指定しない場合、LEET はデフォルトで Workspace ビューを開きます。`2` を押すと、ハイライトされている run のシステムメトリクスが表示されます。run ディレクトリまたは `.wandb` ファイルを指定すると単一 run ビューが開き、システムメトリクスはデフォルトで右サイドバーに表示されます。

    システムメトリクスのペインには次の項目が表示されます:

    * GPU 使用率 (%) とメモリ使用量 (GB)
    * CPU 使用量
    * RAM 使用量 (GB)
    * ディスク I/O
    * ネットワークアクティビティ

    まずは次のキーボードショートカットを使ってみてください:

    * `h` または `?`: 現在のビューのキーボードショートカットを表示します。
    * `\`: パターンでシステムメトリクスをフィルターします。
    * `y`: フォーカス中のチャートの表示モードを、線形、対数、バケット化ヒートマップ (パーセンテージのメトリクスのみ) の順に切り替えます。
    * `n` と `N`: フォーカス中のペイン内でページを移動します。
    * `q` または `ctrl+c`: 終了します。

    run を使わずに現在のマシンを監視するには、スタンドアロンのシステムモニター (SYMON) を起動します:

    ```bash theme={"system"}
    wandb leet symon --interval 2s
    ```

    詳細なガイドについては [LEET ターミナル UI](/ja/products/wandb/app/leet-tui) を、コマンド構文については [`wandb leet`](/ja/products/wandb/ref/cli/wandb-leet) CLI リファレンスを参照してください。
  </Tab>
</Tabs>

<h2 id="cpu">
  CPU
</h2>

<h3 id="process-cpu-percent-cpu">
  プロセスの CPU 使用率 (CPU)
</h3>

利用可能な CPU の数で正規化した、プロセスの CPU 使用量の割合です。

W\&B はこのメトリクスに `cpu` タグを割り当てます。

<h3 id="process-cpu-threads">
  プロセスの CPU スレッド数
</h3>

プロセスが使用するスレッドの数です。

W\&B はこのメトリクスに `proc.cpu.threads` タグを割り当てます。

<h2 id="disk">
  ディスク
</h2>

デフォルトでは、使用状況メトリクスは `/` パスを対象に収集されます。監視するパスを設定するには、次の設定を使用します。

```python theme={"system"}
run = wandb.init(
    settings=wandb.Settings(
        x_stats_disk_paths=("/System/Volumes/Data", "/home", "/mnt/data"),
    ),
)
```

<h3 id="disk-usage-percent">
  ディスク使用率
</h3>

指定したパスにおけるシステムディスクの総使用率をパーセンテージで表します。

W\&B は、このメトリクスに `disk.{path}.usagePercent` タグを割り当てます。

<h3 id="disk-usage">
  ディスク利用状況
</h3>

指定されたパスに対するシステム全体のディスク利用状況をギガバイト (GB) で表します。
アクセス可能なパスがサンプリングされ、各パスのディスク利用状況 (GB) がサンプルに追加されます。

W\&B はこのメトリクスに `disk.{path}.usageGB` タグを割り当てます。

<h3 id="disk-in">
  Disk In
</h3>

システム全体のディスク読み取り量をメガバイト (MB) 単位で示します。
最初のサンプルを取得した時点で、初期ディスク読み取りバイト数が記録されます。以降のサンプルでは、現在の読み取りバイト数と初期値の差を計算します。

W\&B はこのメトリクスに `disk.in` タグを割り当てます。

<h3 id="disk-out">
  ディスクアウト
</h3>

システムのディスク書き込みの合計をメガバイト (MB) で表します。
[Disk In](#disk-in) と同様に、最初のサンプルが取得された時点で初期のディスク書き込みバイト数が記録されます。以降のサンプルでは、現在の書き込みバイト数と初期値の差を計算します。

W\&B はこのメトリクスに `disk.out` タグを割り当てます。

<h2 id="memory">
  メモリ
</h2>

<h3 id="process-memory-rss">
  プロセスのメモリ RSS
</h3>

プロセスのメモリ常駐セットサイズ (RSS) をメガバイト (MB) 単位で表します。RSS は、プロセスが使用するメモリのうち、主記憶 (RAM) に保持されている部分です。

W\&B はこのメトリクスに `proc.memory.rssMB` タグを割り当てます。

<h3 id="process-memory-percent">
  プロセスのメモリ使用率
</h3>

利用可能なメモリの総量に対するプロセスのメモリ使用量の割合を示します。

W\&B はこのメトリクスに `proc.memory.percent` タグを割り当てます。

<h3 id="memory-percent">
  メモリ使用率
</h3>

システム全体のメモリ使用量を、使用可能なメモリの総量に対する割合で示します。

W\&B はこのメトリクスに `memory_percent` タグを割り当てます。

<h3 id="memory-available">
  利用可能なメモリ
</h3>

利用可能なシステムメモリの合計をメガバイト (MB) 単位で示します。

W\&B はこのメトリクスに `proc.memory.availableMB` タグを割り当てます。

<h2 id="network">
  ネットワーク
</h2>

<h3 id="network-sent">
  ネットワーク送信
</h3>

ネットワーク経由で送信された総バイト数を表します。
初回の送信バイト数は、メトリクスの初期化時に記録されます。以降のサンプルでは、現在の送信バイト数と初期値との差を計算します。

W\&B はこのメトリクスに `network.sent` タグを割り当てます。

<h3 id="network-received">
  ネットワーク受信
</h3>

ネットワーク経由で受信した合計バイト数を示します。
[ネットワーク送信](#network-sent)と同様に、メトリクスの初期化時に受信バイト数の初期値が記録されます。その後のサンプルでは、現在の受信バイト数と初期値の差を計算します。

W\&B はこのメトリクスに `network.recv` タグを割り当てます。

<h2 id="nvidia-gpu">
  NVIDIA GPU
</h2>

以下で説明するメトリクスに加えて、プロセスやその子孫プロセスが特定の GPU を使用する場合、W\&B は対応するメトリクスを `gpu.process.{gpu_index}.{metric_name}` として取得します。

<h3 id="gpu-memory-utilization">
  GPU メモリ使用率
</h3>

各 GPU のメモリ使用率をパーセントで表します。

W\&B は、このメトリクスに `gpu.{gpu_index}.memory` タグを割り当てます。

<h3 id="gpu-memory-allocated">
  割り当て済みメモリ
</h3>

各 GPU の利用可能なメモリ総量に対する、割り当て済み GPU メモリの割合を示します。

W\&B はこのメトリクスに `gpu.{gpu_index}.memoryAllocated` タグを割り当てます。

<h3 id="gpu-memory-allocated-bytes">
  GPU 割り当て済みメモリ (バイト)
</h3>

各 GPU に割り当てられた GPU メモリをバイト単位で示します。

W\&B はこのメトリクスに `gpu.{gpu_index}.memoryAllocatedBytes` タグを割り当てます。

<h3 id="gpu-utilization">
  GPU 使用率
</h3>

各 GPU の GPU 使用率をパーセントで示します。

W\&B はこのメトリクスに `gpu.{gpu_index}.gpu` タグを割り当てます。

<h3 id="gpu-temperature">
  GPU 温度
</h3>

各 GPU の温度 (摂氏) です。

W\&B はこのメトリクスに `gpu.{gpu_index}.temp` タグを割り当てます。

<h3 id="gpu-power-usage-watts">
  GPU 消費電力 (ワット)
</h3>

各 GPU の GPU 消費電力をワット単位で示します。

W\&B は、このメトリクスに `gpu.{gpu_index}.powerWatts` タグを割り当てます。

<h3 id="gpu-power-usage-percent">
  消費電力の割合
</h3>

各 GPU の GPU 消費電力を、その電力容量に対する割合として反映します。

W\&B はこのメトリクスに `gpu.{gpu_index}.powerPercent` というタグを割り当てます。

<h3 id="gpu-sm-clock-speed">
  GPU SM クロック速度
</h3>

GPU の Streaming Multiprocessor (SM) のクロック速度を MHz 単位で表します。このメトリクスは、計算タスクを担う GPU コア内の処理速度を示します。

W\&B は、このメトリクスに `gpu.{gpu_index}.smClock` タグを割り当てます。

<h3 id="gpu-memory-clock-speed">
  GPU メモリクロック速度
</h3>

GPU メモリのクロック速度 (MHz) を表します。この値は、GPU メモリと演算コア間のデータ転送速度に影響します。

W\&B は、このメトリクスに `gpu.{gpu_index}.memoryClock` タグを割り当てます。

<h3 id="gpu-graphics-clock-speed">
  GPU グラフィックスクロック速度
</h3>

GPU でのグラフィックスのレンダリング操作におけるベースクロック速度を MHz 単位で表します。このメトリクスは、多くの場合、可視化やレンダリングタスク中のパフォーマンスを反映します。

W\&B は、このメトリクスに `gpu.{gpu_index}.graphicsClock` タグを割り当てます。

<h3 id="gpu-corrected-memory-errors">
  GPU の訂正済みメモリエラー
</h3>

W\&B がエラーチェックプロトコルによって自動的に訂正する GPU 上のメモリエラーの数をトラッキングします。これは、回復可能なハードウェアの問題を示します。

W\&B はこのメトリクスに `gpu.{gpu_index}.correctedMemoryErrors` タグを割り当てます。

<h3 id="gpu-uncorrected-memory-errors">
  GPU 未修正メモリエラー
</h3>

GPU 上のメモリエラーの数をトラッキングし、W\&B が未修正のものを示します。これは回復不能なエラーであり、処理の信頼性に影響を与える可能性があります。

W\&B はこのメトリクスに `gpu.{gpu_index}.unCorrectedMemoryErrors` タグを割り当てます。

<h3 id="gpu-encoder-utilization">
  GPU エンコーダー使用率
</h3>

GPU の動画エンコーダーの使用率をパーセントで表し、エンコードタスク (動画のレンダリングなど) の実行時の負荷を示します。

W\&B はこのメトリクスに `gpu.{gpu_index}.encoderUtilization` タグを割り当てます。

<h2 id="amd-gpu">
  AMD GPU
</h2>

W\&B は AMD が提供する `rocm-smi` ツールの出力 (`rocm-smi -a --json`) からメトリクスを抽出します。

ROCm の [6.x (latest)](https://rocm.docs.amd.com/en/latest/) および [5.x](https://rocm.docs.amd.com/en/docs-5.6.0/) 形式がサポートされます。ROCm 形式の詳細については、[AMD ROCm ドキュメント](https://rocm.docs.amd.com/en/latest/compatibility/compatibility-matrix.html) を参照してください。新しい形式にはより多くの詳細が含まれています。

<h3 id="amd-gpu-utilization">
  AMD GPU 使用率
</h3>

各 AMD GPU デバイスにおける GPU 使用率をパーセントで表します。

W\&B はこのメトリクスに `gpu.{gpu_index}.gpu` タグを割り当てます。

<h3 id="amd-gpu-memory-allocated">
  AMD GPU 割り当て済みメモリ
</h3>

各 AMD GPU デバイスで、割り当て済みメモリが利用可能なメモリの合計に対する割合を示します。

W\&B はこのメトリクスに `gpu.{gpu_index}.memoryAllocated` タグを割り当てます。

<h3 id="amd-gpu-temperature">
  AMD GPU 温度
</h3>

各 AMD GPU デバイスにおける GPU 温度 (摂氏) 。

W\&B はこのメトリクスに `gpu.{gpu_index}.temp` タグを割り当てます。

<h3 id="amd-gpu-power-usage-watts">
  AMD GPU 消費電力 (ワット)
</h3>

各 AMD GPU デバイスにおける GPU 消費電力 (ワット単位) です。

W\&B はこのメトリクスに `gpu.{gpu_index}.powerWatts` タグを割り当てます。

<h3 id="amd-gpu-power-usage-percent">
  AMD GPU 消費電力の割合
</h3>

各 AMD GPU デバイスの GPU 消費電力を、最大消費電力に対する割合で示します。

W\&B はこのメトリクスに `gpu.{gpu_index}.powerPercent` を割り当てます。

<h2 id="apple-arm-mac-gpu">
  Apple ARM Mac の GPU
</h2>

<h3 id="apple-gpu-utilization">
  Apple GPU 使用率
</h3>

Apple GPU デバイス、特に ARM Mac 上の GPU 使用率をパーセントで示します。

W\&B はこのメトリクスに `gpu.0.gpu` タグを割り当てます。

<h3 id="apple-gpu-memory-allocated">
  Apple GPU 割り当て済みメモリ
</h3>

ARM Mac の Apple GPU デバイスで、利用可能なメモリ総量に対する割り当て済み GPU メモリの割合です。

W\&B はこのメトリクスに `gpu.0.memoryAllocated` タグを割り当てます。

<h3 id="apple-gpu-temperature">
  Apple GPU 温度
</h3>

ARM Mac 上の Apple GPU デバイスの GPU 温度 (摂氏) です。

W\&B はこのメトリクスに `gpu.0.temp` タグを割り当てます。

<h3 id="apple-gpu-power-usage-watts">
  Apple GPU 消費電力 (ワット)
</h3>

Apple GPU デバイス上の ARM Mac 向けの GPU 消費電力 (Watts 単位) です。

W\&B はこのメトリクスに `gpu.0.powerWatts` タグを割り当てます。

<h3 id="apple-gpu-power-usage-percent">
  Apple GPU 消費電力の割合
</h3>

Apple GPU デバイス上の ARM Mac 向けに、GPU の消費電力の割合として表した GPU 消費電力です。

W\&B はこのメトリクスに `gpu.0.powerPercent` タグを割り当てます。

<h2 id="graphcore-ipu">
  Graphcore IPU
</h2>

Graphcore IPUs (Intelligence Processing Units) は、機械知能タスク向けに特別に設計された独自のハードウェアアクセラレータです。

<h3 id="ipu-device-metrics">
  IPU デバイスのメトリクス
</h3>

これらのメトリクスは、特定の IPU デバイスのさまざまな統計を表します。各メトリクスには、デバイス ID (`device_id`) とメトリクス キー (`metric_key`) があり、これらで識別されます。W\&B はこのメトリクスに `ipu.{device_id}.{metric_key}` タグを割り当てます。

メトリクスは、Graphcore の `gcipuinfo` バイナリとやり取りする独自の `gcipuinfo` ライブラリを使用して抽出されます。`sample` メソッドは、プロセス ID (`pid`) に関連付けられた各 IPU デバイスのこれらのメトリクスを取得します。時間とともに変化するメトリクス、またはデバイスのメトリクスが初めて取得される場合のみをログすることで、冗長なデータのログを避けます。

各メトリクスについて、`parse_metric` メソッドを使用して、生の文字列表現からメトリクスの値を抽出します。その後、`aggregate` メソッドを使用して、複数のサンプルにわたってメトリクスを集計します。

以下に、利用可能なメトリクスとその単位を一覧で示します。

* **Average Board Temperature** (`average board temp (C)`): IPU ボードの温度 (摂氏) 。
* **Average Die Temperature** (`average die temp (C)`): IPU ダイの温度 (摂氏) 。
* **クロック速度** (`clock (MHz)`): IPU のクロック速度 (MHz) 。
* **IPU Power** (`ipu power (W)`): IPU の消費電力 (ワット) 。
* **IPU Utilization** (`ipu utilisation (%)`): IPU 使用率 (パーセント) 。
* **IPU Session Utilization** (`ipu utilisation (session) (%)`): 現在のセッションに固有の IPU 使用率 (パーセント) 。
* **Data Link Speed** (`speed (GT/s)`): データ転送速度 (ギガトランスファー/秒) 。

<h2 id="google-cloud-tpu">
  Google Cloud TPU
</h2>

Tensor Processing Units (TPUs) は、Google が独自に開発した ASIC (Application Specific Integrated Circuit) で、機械学習ワークロードの高速化に使用されます。

<Note>
  報告されるメトリクスの詳細は、v4、v5e、v5p、v6e、または 7x などの TPU チップ世代やランタイム環境によって異なります。
</Note>

利用可能なメトリクスとその定義の詳細については、[Google の Cloud TPU ドキュメントのサポートされるメトリクス](https://docs.cloud.google.com/tpu/docs/tpu-monitoring-library) を参照してください。

<h3 id="tpu-compute-metrics">
  TPU コンピュート メトリクス
</h3>

* `tpu.{tpu_index}.tensorcoreUtilization`: デバイスごとの TensorCore 使用率のパーセンテージです。これは、TensorCore コンピュートユニットが完全に利用されているかどうかを最も直接的に測定するものです。

* `tpu.{tpu_index}.dutyCycle`: サンプル期間中にアクセラレータの TensorCore がアクティブに処理していた時間の割合です。このメトリクスはチップごとに報告され、マルチデバイスチップ上のすべてのデバイスにファンアウトされます。値が高いほど、TensorCore 使用率が優れていることを示します。

<h3 id="tpu-memory-metrics">
  TPU メモリ メトリクス
</h3>

* `tpu.{tpu_index}.hbmCapacityTotal`: デバイスごとの合計 High Bandwidth Memory (HBM) キャパシティ (バイト単位) 。

* `tpu.{tpu_index}.hbmCapacityUsage`: デバイスごとの現在の HBM 利用量 (バイト単位) 。

<h3 id="tpu-interconnect-health">
  TPU Interconnect の健全性
</h3>

* `tpu.{tpu_index}.iciLinkHealth`: デバイスごとの Inter-Chip Interconnect (ICI) リンクの健全性。このメトリクスは libtpu SDK 経由でのみ取得できます。

<h3 id="tpu-transfer-latency">
  TPU 転送レイテンシー
</h3>

マイクロ秒単位のレイテンシー分布です。報告される統計には、平均、p50、p90、p95、p999 が含まれます。これらのメトリクスは、マルチスライス TPU Pod 構成で最も関連があります。

* `tpu.bufferTransferLatency.{label}.{stat}Us`: スライス間の DCN (データセンター ネットワーク) バッファ転送レイテンシー。

* `tpu.inboundBufferTransferLatency.{label}.{stat}Us`: インバウンド DCN バッファ転送レイテンシー。

* `tpu.hostToDeviceTransferLatency.{label}.{stat}Us`: ホストからデバイスへのデータ転送レイテンシー。

* `tpu.deviceToHostTransferLatency.{label}.{stat}Us`: デバイスからホストへのデータ転送レイテンシー。

<h3 id="tpu-collective-communication">
  TPU 集団通信
</h3>

* `tpu.collectiveE2ELatency.{label}.{stat}Us`: all-reduce や all-gather などの集団通信操作のエンドツーエンドレイテンシー。

* `tpu.hostComputeLatency.{label}.{stat}Us`: MXLA コンピュートレイテンシーを含む、ホスト側のコンピュートレイテンシー。

<h3 id="tpu-network-metrics">
  TPU ネットワーク メトリクス
</h3>

* `tpu.grpcTcpMinRtt.{stat}Us`: gRPC 接続の TCP ラウンドトリップ時間の最小値。

* `tpu.grpcTcpDeliveryRate.{stat}Mbps`: gRPC 接続の TCP デリバリー レート (メガビット毎秒)。

<h3 id="tpu-hlo-execution-metrics">
  TPU HLO 実行メトリクス
</h3>

* `tpu.hloExecTiming.{label}.{stat}Us`: HLO (High Level Operations) の実行タイミング分布をマイクロ秒単位で示します。このメトリクスは、操作ごとの実行時間を報告します。

* `tpu.hloQueueSize.{label}`: HLO 実行キューの現在のサイズを示します。このメトリクスは、実行のためにキューに追加された操作の数を示します。

<h2 id="aws-trainium">
  AWS Trainium
</h2>

[AWS Trainium](https://aws.amazon.com/machine-learning/trainium/) は、AWS が提供する機械学習ワークロードの高速化に特化したハードウェアプラットフォームです。AWS の `neuron-monitor` ツールは、AWS Trainium のメトリクスを取得するために使用されます。

<h3 id="trainium-neuron-core-utilization">
  Trainium Neuron Core 使用率
</h3>

各 NeuronCore の使用率を、コアごとに報告します。

W\&B はこのメトリクスに `trn.{core_index}.neuroncore_utilization` タグを割り当てます。

<h3 id="trainium-host-memory-usage-total">
  Trainium ホストメモリ使用量、合計
</h3>

ホスト上の合計メモリ消費量 (バイト単位) 。

W\&B はこのメトリクスに `trn.host_total_memory_usage` タグを割り当てます。

<h3 id="trainium-neuron-device-total-memory-usage">
  Trainium Neuron Device Total メモリ使用量
</h3>

Neuron デバイス上の合計メモリ使用量をバイト単位で表します。

W\&B はこのメトリクスに `trn.neuron_device_total_memory_usage)` タグを割り当てます。

<h3 id="trainium-host-memory-usage-breakdown">
  Trainium ホストメモリ使用量の内訳:
</h3>

以下はホスト上のメモリ使用量の内訳です:

* **アプリケーションメモリ** (`trn.host_total_memory_usage.application_memory`): アプリケーションが使用するメモリ。
* **定数** (`trn.host_total_memory_usage.constants`): 定数に使用されるメモリ。
* **DMA バッファ** (`trn.host_total_memory_usage.dma_buffers`): Direct Memory Access バッファに使用されるメモリ。
* **テンソル** (`trn.host_total_memory_usage.tensors`): テンソルに使用されるメモリ。

<h3 id="trainium-neuron-core-memory-usage-breakdown">
  Trainium Neuron Core メモリ使用量の内訳
</h3>

各 NeuronCore の詳細なメモリ使用量情報:

* **定数** (`trn.{core_index}.neuroncore_memory_usage.constants`)
* **モデル Code** (`trn.{core_index}.neuroncore_memory_usage.model_code`)
* **モデル Shared Scratchpad** (`trn.{core_index}.neuroncore_memory_usage.model_shared_scratchpad`)
* **Runtime メモリ** (`trn.{core_index}.neuroncore_memory_usage.runtime_memory`)
* **テンソル** (`trn.{core_index}.neuroncore_memory_usage.tensors`)

<h2 id="openmetrics">
  OpenMetrics
</h2>

OpenMetrics / Prometheus互換のデータを公開する外部のエンドポイントからメトリクスを取得し、ログします。消費するエンドポイントに適用するカスタム正規表現ベースのメトリクスフィルターをサポートしています。

[GPUクラスターのパフォーマンスをW\&Bでモニタリングする](https://forge.coreweave.com/wandb/dimaduev/dcgm/reports/Monitoring-GPU-cluster-performance-with-NVIDIA-DCGM-Exporter-and-Weights-Biases--Vmlldzo0MDYxMTA1) を参照して、[NVIDIA DCGM-Exporter](https://docs.nvidia.com/datacenter/cloud-native/gpu-telemetry/latest/dcgm-exporter.html) を使用したGPUクラスターのパフォーマンスのモニタリングという特定のケースでこの機能の使い方の詳細な例を確認してください。


## Related topics

- [How often are system metrics collected?](/support/models/articles/how-often-are-system-metrics-collected.md)
