Skip to main content
Utilisez le tableau de bord de surveillance des files d’attente interactif pour savoir quand une file d’attente Launch est fortement sollicitée ou inactive, visualiser les charges de travail en cours d’exécution et repérer les jobs inefficaces. Ce tableau de bord vous aide à déterminer si vous exploitez efficacement votre matériel de calcul ou vos ressources cloud. Pour une analyse plus approfondie, la page renvoie vers le workspace de suivi des expériences W&B ainsi que vers des outils externes de surveillance de l’infrastructure, tels que Datadog, NVIDIA Base Command ou les consoles des fournisseurs cloud.
Les tableaux de bord de surveillance des files d’attente sont disponibles uniquement avec l’option de déploiement Cloud mutualisé de W&B.

Tableau de bord et graphiques

Utilisez l’onglet Monitor pour consulter l’activité d’une file d’attente au cours des sept derniers jours. Le panneau de gauche vous permet de définir les plages temporelles, le regroupement et les filtres. Le tableau de bord comporte plusieurs graphiques qui répondent aux questions les plus courantes sur les performances et l’efficacité. Les sections suivantes décrivent les éléments d’interface des tableaux de bord de files d’attente.

Job status

Le graphique Job status indique le nombre de jobs en cours d’exécution, en attente, placés en file d’attente ou terminés sur chaque intervalle de temps. Utilisez le graphique Job status pour identifier les périodes d’inactivité de la file d’attente.
Chronologie du statut des jobs
Par exemple, supposons que vous disposiez d’une ressource fixe (comme un DGX BasePod). Si vous constatez que la file d’attente associée à cette ressource fixe est inactive, vous pourriez en profiter pour exécuter des jobs Launch préemptibles de moindre priorité, comme des sweeps. À l’inverse, supposons que vous utilisiez une ressource cloud et que vous observiez des pics d’activité périodiques. Ces pics peuvent indiquer qu’il est possible de réaliser des économies en réservant des ressources pour des créneaux précis. À droite du graphique, une légende indique à quel statut d’un job Launch correspond chaque couleur.
Les éléments Queued peuvent signaler des possibilités de transférer des charges de travail vers d’autres files d’attente. Un pic d’échecs peut permettre d’identifier les utilisateurs qui ont besoin d’aide pour configurer leurs jobs Launch.

Queued time

Le graphique Queued time indique la durée (en secondes) pendant laquelle un job Launch est resté dans une file d’attente pour une date ou une plage horaire donnée.
Métriques Queued time
L’axe X représente une période que vous définissez, et l’axe Y la durée (en secondes) pendant laquelle un job Launch est resté dans une file d’attente Launch. Par exemple, supposons que 10 jobs Launch soient mis en file d’attente au cours d’une journée. Le graphique Queue time affiche 600 secondes si ces 10 jobs Launch attendent en moyenne 60 secondes chacun.
Utilisez le graphique Queued time pour identifier les utilisateurs touchés par des temps d’attente prolongés.
Personnalisez la couleur de chaque job à l’aide du contrôle Grouping dans la barre de gauche. Vous pourrez ainsi identifier les utilisateurs et les jobs touchés par une capacité de file d’attente insuffisante.

Exécutions de jobs

Le graphique Job runs affiche le début et la fin de chaque job exécuté sur une période donnée, avec une couleur distincte pour chaque run. Vous pouvez ainsi voir d’un coup d’œil quelles charges de travail la file d’attente traitait à un instant donné.
Chronologie des exécutions de jobs
Utilisez l’outil Select en bas à droite du panneau pour sélectionner des jobs par balayage et afficher leurs détails dans le tableau ci-dessous.

Utilisation du CPU et du GPU

Utilisez les graphiques GPU use by a job, CPU use by a job, GPU memory by job et System memory by job pour évaluer l’efficacité de vos jobs Launch.
Métriques d’utilisation du GPU
Par exemple, le graphique GPU memory by job vous permet de déterminer si un run W&B a mis longtemps à se terminer et s’il n’a utilisé qu’un faible pourcentage de ses cœurs CPU. L’axe X de chaque graphique indique, en secondes, la durée d’un run W&B (créé par un job Launch). Survolez un point de données avec la souris pour afficher des informations sur le run W&B correspondant, comme l’ID du run, le projet auquel il appartient ou le job Launch qui l’a créé.

Errors

Le panneau Errors affiche les erreurs survenues dans une file d’attente Launch donnée. Plus précisément, il indique l’horodatage de chaque erreur, le nom du job Launch dont elle provient et le message d’erreur généré. Par défaut, les erreurs sont triées de la plus récente à la plus ancienne.
Panneau des journaux d’erreurs
Utilisez le panneau Errors pour identifier les utilisateurs en difficulté et les débloquer. La vue du tableau de bord d’observabilité de la file d’attente est identique pour tous les types de files d’attente, mais il est souvent utile d’accéder directement aux outils de surveillance propres à chaque environnement. Pour ce faire, ajoutez un lien vers la console directement depuis le tableau de bord d’observabilité de la file d’attente. Pour ajouter un lien externe, cliquez sur Manage Links pour ouvrir un panneau. Saisissez l’URL complète de la page souhaitée, puis ajoutez un libellé. Les liens ajoutés apparaissent dans la section External Links.
Dernière modification le 30 septembre 2026