> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

> Référence des métriques système CPU, GPU, mémoire, disque et réseau que le SDK W&B journalise automatiquement pendant les runs.

# Référence des métriques système

Cette page fournit des informations détaillées sur les métriques système suivies par le SDK W\&B.

<Note>
  `wandb` journalise automatiquement les métriques système toutes les 15 secondes.
</Note>

<h2 id="view-system-metrics">
  Afficher les métriques système
</h2>

Vous pouvez afficher et surveiller les métriques système dans la W\&B App ou dans l’interface terminal `wandb leet`.

<Tabs>
  <Tab title="App">
    Pour afficher les métriques système dans la W\&B App :

    1. Accédez à votre projet dans la W\&B App.
    2. Sélectionnez un run dans le tableau **Runs**.
    3. Dans le workspace, repérez la section **System**, qui affiche des graphiques pour :
       * l’utilisation et la mémoire du GPU
       * l’utilisation du CPU
       * l’utilisation de la mémoire
       * les E/S disque
       * le trafic réseau

    Vous pouvez choisir les métriques système à afficher en ajoutant des panneaux à votre workspace. Pour plus d’informations sur la création et la personnalisation de visualisations, consultez [Panneaux](/fr/products/wandb/app/features/panels).
  </Tab>

  <Tab title="LEET">
    Pour afficher dans votre terminal les métriques système d’un run local à l’aide de l’interface terminal `wandb leet` :

    1. Si vous avez démarré le run localement à partir d’un script, accédez au répertoire dans lequel vous avez exécuté votre code. Il contient un répertoire `wandb/` avec un sous-répertoire par run et un lien symbolique `latest-run/`. Chaque répertoire de run contient un journal de transactions nommé au format `run-<run-ID>.wandb`.

       Si vous n’avez pas démarré le run localement, mais avez plutôt téléchargé un fichier journal de transactions `.wandb`, notez son emplacement.
    2. Démarrez `wandb leet` avec l’une des commandes suivantes :

       ```bash theme={"system"}
       # Ouvrir le workspace et sélectionner le run local le plus récent
       wandb leet

       # Spécifier un répertoire de run
       wandb leet ./wandb/run-20250813_124246-n67z9ude

       # Spécifier un fichier .wandb
       wandb leet ./wandb/run-20250813_124246-n67z9ude/run-n67z9ude.wandb
       ```

    Sans chemin de run, LEET ouvre par défaut la vue workspace. Appuyez sur `2` pour afficher les métriques système du run sélectionné. Si vous indiquez un répertoire de run ou un fichier `.wandb`, LEET ouvre la vue run unique, où les métriques système apparaissent par défaut dans la barre latérale droite.

    Le volet des métriques système affiche :

    * l’utilisation du GPU (%) et l’utilisation de la mémoire (Go)
    * l’utilisation du CPU
    * l’utilisation de la RAM (Go)
    * les E/S disque
    * l’activité réseau

    Pour vos premiers pas, utilisez ces raccourcis clavier :

    * `h` ou `?` : afficher les raccourcis clavier de la vue actuelle.
    * `\` : filtrer les métriques système par motif.
    * `y` : faire alterner le graphique actif entre les modes linéaire, logarithmique et, pour les métriques en pourcentage, carte thermique par buckets.
    * `n` et `N` : naviguer entre les pages du volet actif.
    * `q` ou `ctrl+c` : quitter.

    Pour surveiller la machine actuelle sans run, lancez le moniteur système autonome (SYMON) :

    ```bash theme={"system"}
    wandb leet symon --interval 2s
    ```

    Consultez [Interface terminal LEET](/fr/products/wandb/app/leet-tui) pour le guide complet, ou la référence CLI [`wandb leet`](/fr/products/wandb/ref/cli/wandb-leet) pour la syntaxe des commandes.
  </Tab>
</Tabs>

<h2 id="cpu">
  CPU
</h2>

<h3 id="process-cpu-percent-cpu">
  Process CPU Percent (CPU)
</h3>

Pourcentage d’utilisation du CPU par le processus, normalisé par le nombre de CPU disponibles.

W\&B attribue le tag `cpu` à cette métrique.

<h3 id="process-cpu-threads">
  Threads CPU du processus
</h3>

Nombre de threads utilisés par le processus.

W\&B attribue le tag `proc.cpu.threads` à cette métrique.

<h2 id="disk">
  Disque
</h2>

Par défaut, les métriques d’utilisation sont collectées pour le chemin `/`. Pour configurer les chemins à surveiller, utilisez le paramètre suivant :

```python theme={"system"}
run = wandb.init(
    settings=wandb.Settings(
        x_stats_disk_paths=("/System/Volumes/Data", "/home", "/mnt/data"),
    ),
)
```

<h3 id="disk-usage-percent">
  Pourcentage d’utilisation du disque
</h3>

Représente l’utilisation totale du disque système, en pourcentage, pour les chemins spécifiés.

W\&B attribue le tag `disk.{path}.usagePercent` à cette métrique.

<h3 id="disk-usage">
  Utilisation du disque
</h3>

Représente l’utilisation totale du disque système, en gigaoctets (Go), pour les chemins spécifiés.
Les chemins accessibles sont échantillonnés, et l’utilisation du disque (en Go) de chacun d’eux est ajoutée aux échantillons.

W\&B attribue le tag `disk.{path}.usageGB` à cette métrique.

<h3 id="disk-in">
  Disque en lecture
</h3>

Indique le volume total lu sur le disque système, en mégaoctets (Mo).
Le nombre initial d’octets lus sur le disque est enregistré lors du premier échantillonnage. Chaque échantillon suivant calcule la différence entre le nombre actuel d’octets lus et cette valeur initiale.

W\&B attribue le tag `disk.in` à cette métrique.

<h3 id="disk-out">
  Disque en écriture
</h3>

Représente le volume total d’écriture sur le disque système, en mégaoctets (Mo).
Comme pour [Disque en lecture](#disk-in), le nombre initial d’octets écrits sur le disque est enregistré lors du premier échantillonnage. Chaque échantillon suivant calcule la différence entre le nombre actuel d’octets écrits et cette valeur initiale.

W\&B attribue le tag `disk.out` à cette métrique.

<h2 id="memory">
  Mémoire
</h2>

<h3 id="process-memory-rss">
  Mémoire RSS du processus
</h3>

Représente la taille de l’ensemble résident (RSS, Resident Set Size) du processus, en mégaoctets (Mo). Le RSS correspond à la part de la mémoire occupée par un processus qui se trouve dans la mémoire principale (RAM).

W\&B attribue le tag `proc.memory.rssMB` à cette métrique.

<h3 id="process-memory-percent">
  Pourcentage de mémoire du processus
</h3>

Indique l’utilisation de la mémoire par le processus, en pourcentage de la mémoire totale disponible.

W\&B attribue le tag `proc.memory.percent` à cette métrique.

<h3 id="memory-percent">
  Pourcentage de mémoire
</h3>

Représente l’utilisation totale de la mémoire système, exprimée en pourcentage de la mémoire totale disponible.

W\&B attribue le tag `memory_percent` à cette métrique.

<h3 id="memory-available">
  Mémoire disponible
</h3>

Indique la quantité totale de mémoire système disponible, en mégaoctets (Mo).

W\&B attribue le tag `proc.memory.availableMB` à cette métrique.

<h2 id="network">
  Réseau
</h2>

<h3 id="network-sent">
  Octets réseau envoyés
</h3>

Représente le nombre total d’octets envoyés sur le réseau.
Le nombre initial d’octets envoyés est enregistré lors de la première initialisation de la métrique. Les échantillons suivants correspondent à la différence entre le nombre actuel d’octets envoyés et cette valeur initiale.

W\&B attribue le tag `network.sent` à cette métrique.

<h3 id="network-received">
  Octets réseau reçus
</h3>

Indique le nombre total d’octets reçus sur le réseau.
Comme pour les [octets réseau envoyés](#network-sent), le nombre initial d’octets reçus est enregistré lors de la première initialisation de la métrique. Chaque échantillon suivant correspond à la différence entre le nombre actuel d’octets reçus et cette valeur initiale.

W\&B attribue le tag `network.recv` à cette métrique.

<h2 id="nvidia-gpu">
  GPU NVIDIA
</h2>

Outre les métriques décrites ci-dessous, si le processus ou ses processus descendants utilisent un GPU donné, W\&B capture les métriques correspondantes sous la forme `gpu.process.{gpu_index}.{metric_name}`

<h3 id="gpu-memory-utilization">
  Utilisation de la mémoire GPU
</h3>

Représente l’utilisation de la mémoire de chaque GPU, en pourcentage.

W\&B attribue un tag `gpu.{gpu_index}.memory` à cette métrique.

<h3 id="gpu-memory-allocated">
  Mémoire GPU allouée
</h3>

Indique la mémoire GPU allouée, en pourcentage de la mémoire totale disponible, pour chaque GPU.

W\&B attribue le tag `gpu.{gpu_index}.memoryAllocated` à cette métrique.

<h3 id="gpu-memory-allocated-bytes">
  Mémoire GPU allouée Bytes
</h3>

Indique la mémoire GPU allouée, en octets, pour chaque GPU.

W\&B attribue le tag `gpu.{gpu_index}.memoryAllocatedBytes` à cette métrique.

<h3 id="gpu-utilization">
  Utilisation du GPU
</h3>

Indique le taux d’utilisation de chaque GPU, en pourcentage.

W\&B attribue le tag `gpu.{gpu_index}.gpu` à cette métrique.

<h3 id="gpu-temperature">
  Température du GPU
</h3>

La température de chaque GPU, en degrés Celsius.

W\&B attribue le tag `gpu.{gpu_index}.temp` à cette métrique.

<h3 id="gpu-power-usage-watts">
  Consommation électrique du GPU en watts
</h3>

Indique la consommation électrique de chaque GPU, en watts.

W\&B attribue le tag `gpu.{gpu_index}.powerWatts` à cette métrique.

<h3 id="gpu-power-usage-percent">
  Pourcentage de consommation électrique du GPU
</h3>

Indique la consommation électrique de chaque GPU, en pourcentage de sa puissance maximale.

W\&B attribue un tag `gpu.{gpu_index}.powerPercent` à cette métrique.

<h3 id="gpu-sm-clock-speed">
  Fréquence d’horloge SM du GPU
</h3>

Représente la fréquence d’horloge du Streaming Multiprocessor (SM) du GPU, en MHz. Cette métrique reflète la vitesse de traitement des cœurs du GPU chargés des tâches de calcul.

W\&B attribue le tag `gpu.{gpu_index}.smClock` à cette métrique.

<h3 id="gpu-memory-clock-speed">
  Fréquence d’horloge de la mémoire GPU
</h3>

Représente la fréquence d’horloge de la mémoire GPU en MHz, qui influe sur la vitesse de transfert des données entre la mémoire GPU et les cœurs de traitement.

W\&B attribue le tag `gpu.{gpu_index}.memoryClock` à cette métrique.

<h3 id="gpu-graphics-clock-speed">
  Fréquence d’horloge graphique du GPU
</h3>

Représente la fréquence d’horloge de base des opérations de rendu graphique sur le GPU, exprimée en MHz. Cette métrique reflète souvent les performances lors des tâches de visualisation ou de rendu.

W\&B attribue le tag `gpu.{gpu_index}.graphicsClock` à cette métrique.

<h3 id="gpu-corrected-memory-errors">
  Erreurs de mémoire GPU corrigées
</h3>

Suit le nombre d’erreurs de mémoire du GPU que W\&B corrige automatiquement grâce aux protocoles de détection et de correction d’erreurs, ce qui signale des problèmes matériels récupérables.

W\&B attribue le tag `gpu.{gpu_index}.correctedMemoryErrors` à cette métrique.

<h3 id="gpu-uncorrected-memory-errors">
  Erreurs de mémoire GPU non corrigées
</h3>

Suit le nombre d’erreurs de mémoire du GPU que W\&B n’a pas corrigées, signe d’erreurs irrécupérables susceptibles de compromettre la fiabilité du traitement.

W\&B attribue le tag `gpu.{gpu_index}.unCorrectedMemoryErrors` à cette métrique.

<h3 id="gpu-encoder-utilization">
  Utilisation de l'encodeur GPU
</h3>

Représente le pourcentage d'utilisation de l'encodeur vidéo du GPU, qui reflète sa charge pendant l'exécution de tâches d'encodage (par exemple, le rendu vidéo).

W\&B attribue le tag `gpu.{gpu_index}.encoderUtilization` à cette métrique.

<h2 id="amd-gpu">
  GPU AMD
</h2>

W\&B extrait les métriques de la sortie de l’outil `rocm-smi` fourni par AMD (`rocm-smi -a --json`).

Les formats ROCm [6.x (dernière version)](https://rocm.docs.amd.com/en/latest/) et [5.x](https://rocm.docs.amd.com/en/docs-5.6.0/) sont pris en charge. Pour en savoir plus sur les formats ROCm, consultez la [documentation AMD ROCm](https://rocm.docs.amd.com/en/latest/compatibility/compatibility-matrix.html). Le format le plus récent fournit des informations plus détaillées.

<h3 id="amd-gpu-utilization">
  Utilisation des GPU AMD
</h3>

Représente le taux d’utilisation du GPU, en pourcentage, pour chaque appareil GPU AMD.

W\&B attribue un tag `gpu.{gpu_index}.gpu` à cette métrique.

<h3 id="amd-gpu-memory-allocated">
  Mémoire GPU AMD allouée
</h3>

Indique la mémoire GPU allouée, en pourcentage de la mémoire totale disponible, pour chaque GPU AMD.

W\&B attribue le tag `gpu.{gpu_index}.memoryAllocated` à cette métrique.

<h3 id="amd-gpu-temperature">
  Température des GPU AMD
</h3>

Température, en degrés Celsius, de chaque GPU AMD.

W\&B attribue le tag `gpu.{gpu_index}.temp` à cette métrique.

<h3 id="amd-gpu-power-usage-watts">
  Consommation électrique des GPU AMD en watts
</h3>

Consommation électrique, en watts, de chaque GPU AMD.

W\&B attribue un tag `gpu.{gpu_index}.powerWatts` à cette métrique.

<h3 id="amd-gpu-power-usage-percent">
  Pourcentage de consommation électrique du GPU AMD
</h3>

Indique la consommation électrique de chaque GPU AMD, exprimée en pourcentage de sa capacité de puissance.

W\&B attribue la clé `gpu.{gpu_index}.powerPercent` à cette métrique.

<h2 id="apple-arm-mac-gpu">
  GPU des Mac Apple ARM
</h2>

<h3 id="apple-gpu-utilization">
  Utilisation du GPU Apple
</h3>

Indique le taux d’utilisation du GPU, en pourcentage, pour les GPU Apple, en particulier sur les Mac ARM.

W\&B attribue le tag `gpu.0.gpu` à cette métrique.

<h3 id="apple-gpu-memory-allocated">
  Mémoire GPU allouée (Apple)
</h3>

Mémoire GPU allouée, exprimée en pourcentage de la mémoire totale disponible, pour les GPU Apple des Mac ARM.

W\&B attribue le tag `gpu.0.memoryAllocated` à cette métrique.

<h3 id="apple-gpu-temperature">
  Température du GPU Apple
</h3>

La température du GPU, en degrés Celsius, des GPU Apple sur les Mac ARM.

W\&B attribue le tag `gpu.0.temp` à cette métrique.

<h3 id="apple-gpu-power-usage-watts">
  Consommation électrique du GPU Apple en watts
</h3>

La consommation électrique, en watts, des GPU Apple sur les Mac ARM.

W\&B attribue le tag `gpu.0.powerWatts` à cette métrique.

<h3 id="apple-gpu-power-usage-percent">
  Pourcentage de consommation électrique du GPU Apple
</h3>

Consommation électrique du GPU, exprimée en pourcentage de sa capacité électrique maximale, pour les GPU Apple des Mac ARM.

W\&B attribue le tag `gpu.0.powerPercent` à cette métrique.

<h2 id="graphcore-ipu">
  Graphcore IPU
</h2>

Les IPU (Intelligence Processing Units) de Graphcore sont des accélérateurs matériels d’un genre unique, conçus spécifiquement pour les tâches d’intelligence artificielle.

<h3 id="ipu-device-metrics">
  Métriques des appareils IPU
</h3>

Ces métriques représentent diverses statistiques relatives à un appareil IPU donné. Chaque métrique est identifiée par un ID d’appareil (`device_id`) et une clé de métrique (`metric_key`). W\&B attribue le tag `ipu.{device_id}.{metric_key}` à cette métrique.

Les métriques sont extraites à l’aide de la bibliothèque propriétaire `gcipuinfo`, qui interagit avec le binaire `gcipuinfo` de Graphcore. La méthode `sample` récupère ces métriques pour chaque appareil IPU associé à l’ID de processus (`pid`). Pour éviter de journaliser des données redondantes, seules les métriques qui évoluent dans le temps sont journalisées, ainsi que celles récupérées pour la première fois sur un appareil.

Pour chaque métrique, la méthode `parse_metric` extrait la valeur de la métrique à partir de sa représentation brute sous forme de chaîne de caractères. Les métriques sont ensuite agrégées sur plusieurs échantillons à l’aide de la méthode `aggregate`.

Voici la liste des métriques disponibles et de leurs unités :

* **Température moyenne de la carte** (`average board temp (C)`) : température de la carte IPU en degrés Celsius.
* **Température moyenne de la puce** (`average die temp (C)`) : température de la puce IPU en degrés Celsius.
* **Fréquence d’horloge** (`clock (MHz)`) : fréquence d’horloge de l’IPU en MHz.
* **Puissance de l’IPU** (`ipu power (W)`) : consommation électrique de l’IPU en watts.
* **Utilisation de l’IPU** (`ipu utilisation (%)`) : pourcentage d’utilisation de l’IPU.
* **Utilisation de l’IPU par session** (`ipu utilisation (session) (%)`) : pourcentage d’utilisation de l’IPU propre à la session en cours.
* **Débit de la liaison de données** (`speed (GT/s)`) : vitesse de transmission des données en gigatransferts par seconde.

<h2 id="google-cloud-tpu">
  Google Cloud TPU
</h2>

Les Tensor Processing Units (TPU) sont des ASIC (Application Specific Integrated Circuits) conçus sur mesure par Google pour accélérer les charges de travail de machine learning.

<Note>
  Les métriques exactes remontées dépendent de la génération de puce TPU (par exemple v4, v5e, v5p, v6e ou 7x) ainsi que de l’environnement d’exécution.
</Note>

Voir la section [Métriques prises en charge de la documentation Cloud TPU de Google](https://docs.cloud.google.com/tpu/docs/tpu-monitoring-library) pour en savoir plus sur les métriques disponibles et leurs définitions.

<h3 id="tpu-compute-metrics">
  Métriques de calcul TPU
</h3>

* `tpu.{tpu_index}.tensorcoreUtilization` : pourcentage d’utilisation des TensorCore par appareil. C’est l’indicateur le plus direct pour savoir si les unités de calcul TensorCore sont pleinement exploitées.

* `tpu.{tpu_index}.dutyCycle` : pourcentage du temps de la période d’échantillonnage pendant lequel le TensorCore de l’accélérateur était en cours de traitement actif. Cette métrique est remontée par puce, puis répliquée sur tous les appareils des puces multi-appareils. Plus la valeur est élevée, meilleure est l’utilisation des TensorCore.

<h3 id="tpu-memory-metrics">
  Métriques de mémoire TPU
</h3>

* `tpu.{tpu_index}.hbmCapacityTotal` : capacité totale de la mémoire à haute bande passante (HBM), en octets par appareil.

* `tpu.{tpu_index}.hbmCapacityUsage` : utilisation actuelle de la HBM, en octets par appareil.

<h3 id="tpu-interconnect-health">
  État de l’interconnexion TPU
</h3>

* `tpu.{tpu_index}.iciLinkHealth` : état des liens d’interconnexion inter-puces (Inter-Chip Interconnect, ICI) par appareil. Cette métrique n’est disponible que via le chemin du SDK libtpu.

<h3 id="tpu-transfer-latency">
  Latence de transfert TPU
</h3>

Distributions de latence en microsecondes. Les statistiques rapportées peuvent inclure la moyenne, p50, p90, p95 et p999. Ces métriques concernent surtout les configurations de pods TPU multi-slices.

* `tpu.bufferTransferLatency.{label}.{stat}Us` : latences de transfert des buffers DCN (Data Center Network) entre les slices.

* `tpu.inboundBufferTransferLatency.{label}.{stat}Us` : latences de transfert des buffers DCN entrants.

* `tpu.hostToDeviceTransferLatency.{label}.{stat}Us` : latences de transfert des données de l’hôte vers l’appareil.

* `tpu.deviceToHostTransferLatency.{label}.{stat}Us` : latences de transfert des données de l’appareil vers l’hôte.

<h3 id="tpu-collective-communication">
  Communication collective TPU
</h3>

* `tpu.collectiveE2ELatency.{label}.{stat}Us` : latence de bout en bout des opérations collectives, telles que all-reduce et all-gather.

* `tpu.hostComputeLatency.{label}.{stat}Us` : latences de calcul côté hôte, y compris les latences de calcul MXLA.

<h3 id="tpu-network-metrics">
  Métriques réseau des TPU
</h3>

* `tpu.grpcTcpMinRtt.{stat}Us` : temps d’aller-retour TCP minimum pour les connexions gRPC.

* `tpu.grpcTcpDeliveryRate.{stat}Mbps` : débit de transmission TCP pour les connexions gRPC, en mégabits par seconde.

<h3 id="tpu-hlo-execution-metrics">
  Métriques d'exécution HLO des TPU
</h3>

* `tpu.hloExecTiming.{label}.{stat}Us` : distributions des temps d'exécution HLO (High Level Operations), en microsecondes. Cette métrique fournit le temps d'exécution par opération.

* `tpu.hloQueueSize.{label}` : taille actuelle de la file d'attente d'exécution HLO. Cette métrique indique le nombre d'opérations en attente d'exécution.

<h2 id="aws-trainium">
  AWS Trainium
</h2>

[AWS Trainium](https://aws.amazon.com/machine-learning/trainium/) est une plateforme matérielle spécialisée proposée par AWS, conçue pour accélérer les charges de travail de machine learning. Les métriques AWS Trainium sont capturées à l’aide de l’outil `neuron-monitor` d’AWS.

<h3 id="trainium-neuron-core-utilization">
  Utilisation des Neuron Cores Trainium
</h3>

Pourcentage d’utilisation de chaque NeuronCore, mesuré cœur par cœur.

W\&B attribue le tag `trn.{core_index}.neuroncore_utilization` à cette métrique.

<h3 id="trainium-host-memory-usage-total">
  Utilisation totale de la mémoire de l’hôte Trainium
</h3>

Consommation totale de mémoire sur l’hôte, en octets.

W\&B attribue le tag `trn.host_total_memory_usage` à cette métrique.

<h3 id="trainium-neuron-device-total-memory-usage">
  Utilisation totale de la mémoire de l’appareil Trainium Neuron
</h3>

Utilisation totale de la mémoire sur l’appareil Neuron, en octets.

W\&B attribue un tag  `trn.neuron_device_total_memory_usage)` à cette métrique.

<h3 id="trainium-host-memory-usage-breakdown">
  Répartition de l’utilisation de la mémoire hôte Trainium :
</h3>

Voici la répartition de l’utilisation de la mémoire sur l’hôte :

* **Mémoire de l’application** (`trn.host_total_memory_usage.application_memory`) : mémoire utilisée par l’application.
* **Constantes** (`trn.host_total_memory_usage.constants`) : mémoire utilisée pour les constantes.
* **Tampons DMA** (`trn.host_total_memory_usage.dma_buffers`) : mémoire utilisée pour les tampons d’accès direct à la mémoire (DMA).
* **Tenseurs** (`trn.host_total_memory_usage.tensors`) : mémoire utilisée pour les tenseurs.

<h3 id="trainium-neuron-core-memory-usage-breakdown">
  Répartition de l’utilisation de la mémoire des Neuron Cores Trainium
</h3>

Informations détaillées sur l’utilisation de la mémoire de chaque NeuronCore :

* **Constantes** (`trn.{core_index}.neuroncore_memory_usage.constants`)
* **Code du modèle** (`trn.{core_index}.neuroncore_memory_usage.model_code`)
* **Scratchpad partagé du modèle** (`trn.{core_index}.neuroncore_memory_usage.model_shared_scratchpad`)
* **Mémoire du runtime** (`trn.{core_index}.neuroncore_memory_usage.runtime_memory`)
* **Tenseurs** (`trn.{core_index}.neuroncore_memory_usage.tensors`)

<h2 id="openmetrics">
  OpenMetrics
</h2>

Capturez et journalisez les métriques de points de terminaison externes qui exposent des données compatibles OpenMetrics / Prometheus, avec la possibilité d’appliquer aux points de terminaison consommés des filtres de métriques personnalisés basés sur des expressions régulières.

Reportez-vous à [Monitoring GPU cluster performance in W\&B](https://forge.coreweave.com/wandb/dimaduev/dcgm/reports/Monitoring-GPU-cluster-performance-with-NVIDIA-DCGM-Exporter-and-Weights-Biases--Vmlldzo0MDYxMTA1) pour un exemple détaillé d’utilisation de cette fonctionnalité, appliquée à la surveillance des performances d’un cluster GPU avec [NVIDIA DCGM-Exporter](https://docs.nvidia.com/datacenter/cloud-native/gpu-telemetry/latest/dcgm-exporter.html).


## Related topics

- [Comment modifier la fréquence de journalisation des métriques système ?](/fr/support/models/articles/how-can-i-change-how-frequently-to-log-s.md)
