wandb.Table pour journaliser des données, puis les visualiser et les interroger avec W&B. Dans ce guide, vous apprendrez à :
Créer des tableaux
Pour définir un tableau, indiquez les colonnes que vous souhaitez afficher pour chaque ligne de données. Chaque ligne peut correspondre à un élément de votre jeu de données d’entraînement, à une étape ou une époque précise de l’entraînement, à une prédiction de votre modèle sur un élément de test, à un objet généré par votre modèle, etc. Chaque colonne possède un type fixe : numérique, texte, booléen, image, vidéo, audio, etc. Il n’est pas nécessaire de spécifier le type à l’avance. Nommez chaque colonne et veillez à ne transmettre que des données de ce type à l’index de cette colonne. Pour un exemple plus détaillé, consultez le guide des tableaux W&B. Le constructeurwandb.Table s’utilise de deux manières :
-
Liste de lignes :
Journalisez des colonnes nommées et des lignes de données. Par exemple, l’extrait de code suivant génère un tableau de deux lignes et trois colonnes :
-
DataFrame Pandas : Journalisez un DataFrame avec
wandb.Table(dataframe=my_df). Les noms de colonnes sont extraits du DataFrame.
À partir d’un tableau ou d’un dataframe existant
Ajouter des données
Les tableaux sont modifiables. Pendant l’exécution de votre script, vous pouvez y ajouter des données, jusqu’à 200 000 lignes. Il existe deux façons d’ajouter des données à un tableau :- Ajouter une ligne :
table.add_data("3a", "3b", "3c"). Notez que la nouvelle ligne n’est pas représentée sous forme de liste. Si votre ligne se présente sous forme de liste, utilisez la notation étoile,*, pour décompresser la liste en arguments positionnels :table.add_data(*my_row_list). La ligne doit contenir autant d’entrées que le tableau compte de colonnes. - Ajouter une colonne :
table.add_column(name="col_name", data=col_data). Notez que la longueur decol_datadoit être égale au nombre actuel de lignes du tableau. Ici,col_datapeut être une liste ou un NDArray NumPy.
Ajouter des données de manière incrémentielle
Cet exemple de code montre comment créer et remplir un tableau W&B de manière incrémentielle. Vous définissez le tableau avec des colonnes prédéfinies, notamment les scores de confiance pour toutes les étiquettes possibles, puis vous ajoutez les données ligne par ligne pendant l’inférence. Vous pouvez également ajouter des données à des tableaux de manière incrémentielle lorsque vous reprenez des runs.Ajouter des données aux runs repris
Vous pouvez mettre à jour un tableau W&B de manière incrémentielle dans des runs repris : chargez un tableau existant depuis un artifact, récupérez la dernière ligne de données, puis ajoutez les métriques mises à jour. Réinitialisez ensuite le tableau pour assurer la compatibilité et journalisez la version mise à jour dans W&B.Récupérer des données
Une fois les données placées dans un tableau, vous pouvez y accéder par colonne ou par ligne :- Itérateur de lignes : utilisez l’itérateur de lignes du tableau, par exemple
for ndx, row in table.iterrows(): ..., pour parcourir efficacement les lignes des données. - Obtenir une colonne : récupérez une colonne de données avec
table.get_column("col_name"). Pour plus de commodité, vous pouvez passerconvert_to="numpy"afin de convertir la colonne en NDArray NumPy de types primitifs. C’est utile si votre colonne contient des types de médias commewandb.Image, car vous pouvez ainsi accéder directement aux données sous-jacentes.
Enregistrer des tableaux
Après avoir généré un tableau de données dans votre script, par exemple un tableau des prédictions d’un modèle, enregistrez-le dans W&B pour visualiser les résultats en direct.Journaliser un tableau dans un run
Utilisezwandb.Run.log() pour enregistrer votre tableau dans le run, comme suit :
Pour journaliser plus de 200 000 lignes, vous pouvez redéfinir la limite avec :
wandb.Table.MAX_ARTIFACT_ROWS = XToutefois, cela risque de provoquer des problèmes de performances dans l’interface utilisateur, comme des requêtes plus lentes.Accéder aux tableaux par programmation
Côté backend, les tableaux sont stockés sous forme d’artifacts. Pour accéder à une version précise, utilisez l’API des artifacts :Visualiser les tableaux
Tout tableau journalisé de cette manière apparaît dans votre workspace, à la fois sur la Page du run et sur la Page du projet. Pour plus d’informations, voir Visualiser et analyser des tableaux.Tableaux d’artifacts
Utilisezartifact.add() pour journaliser des tableaux dans la section Artifacts de votre run plutôt que dans le workspace. Cette approche est utile si vous disposez d’un jeu de données que vous souhaitez journaliser une seule fois, puis réutiliser comme référence dans vos prochains runs.
Joindre des tableaux d’artifacts
Vous pouvez joindre des tableaux que vous avez construits localement ou que vous avez récupérés depuis d’autres artifacts à l’aide dewandb.JoinedTable(table_1, table_2, join_key).
Pour joindre deux tableaux que vous avez déjà journalisés dans le contexte d’un artifact, récupérez-les depuis l’artifact, puis joignez-les dans un nouveau tableau.
Par exemple, le code suivant montre comment lire un tableau de chansons originales nommé
'original_songs' et un autre tableau contenant des versions synthétisées de ces mêmes chansons, nommé 'synth_songs'. Le code joint les deux tableaux sur "song_id" et téléverse le tableau obtenu sous la forme d’un nouveau tableau W&B :