W&B を使用する理由

- 統合されたダッシュボード: モデルのメトリクスと予測をすべて一元管理できます。
- 軽量: Hugging Face と統合する際にコードを変更する必要はありません。
- 利用しやすさ: 個人および学術チームは無料で利用できます。
- 安全性: すべての project はデフォルトで非公開です。
- 実績: OpenAI、Toyota、Lyft などの機械学習チームで使用されています。
インストール、インポート、ログイン
このセクションでは、チュートリアルの実行に必要な環境をセットアップします。Hugging Face と W&B のライブラリをインストールし、このチュートリアルで使用する GLUE データセットとトレーニングスクリプトをダウンロードします。- Hugging Face Transformers: 自然言語モデルとデータセット。
- W&B: 実験のトラッキングと可視化。
- GLUE データセット: 言語理解のベンチマークデータセット。
- GLUE スクリプト: シーケンス分類向けのモデルのトレーニングスクリプト。
APIキーを追加する
APIキーで認証すると、このノートブックが W&B アカウントにリンクされ、run が project にログされます。登録後、次のセルを実行し、リンクをクリックして APIキーを取得し、このノートブックを認証してください。WANDB_WATCH=all を設定すると、勾配とパラメーターの両方をログできます。オプションの全一覧については、Hugging Face インテグレーションガイドを参照してください。
モデルのトレーニング
環境の設定と認証が完了したら、トレーニング run を開始できます。ダウンロードしたトレーニングスクリプトrun_glue.py を実行して、トレーニングが自動的に W&B ダッシュボードで追跡されることを確認してください。このスクリプトは、Microsoft Research Paraphrase Corpus (意味的に等価かどうかを示す人によるアノテーションが付いた文のペア) を使って BERT をファインチューンします。
ダッシュボードで結果を可視化する
トレーニングが始まると、メトリクスをリアルタイムで監視できます。前のセルで出力されたリンクをクリックするか、wandb.ai にアクセスして、結果がリアルタイムで更新される様子を確認してください。ブラウザーで run を表示するためのリンクは、すべての依存関係が読み込まれた後に表示されます。次の出力を探してください: “wandb: View run at [run 固有の URL]”モデル性能を可視化する
実験全体を確認し、検出結果をズームインして、高次元データを可視化します。
アーキテクチャの比較
BERT と DistilBERTを比較する例です。自動生成される折れ線グラフで、アーキテクチャの違いがトレーニング全体を通じて評価精度にどのように影響するかを確認できます。
主要な情報をデフォルトで記録する
このセクションでは、W&B が自動的に取得する内容を説明します。これにより、追加の設定を行わなくてもダッシュボードでどのデータを利用できるかを把握できます。W&B は実験ごとに新しい run を保存します。デフォルトで保存される情報は次のとおりです。- Hyperparameters: モデルの設定を Config に保存します。
- モデルのメトリクス: ストリーミングされるメトリクスの時系列データを Log に保存します。
- ターミナルログ: コマンドラインの出力を保存し、タブで参照できるようにします。
- システムメトリクス: GPU と CPU の使用率、メモリ、温度。