これはインタラクティブなノートブックです。ローカルで実行するか、以下のリンクから利用できます。
Leaderboard クイックスタート
このクイックスタートでは、W&B Weave の Leaderboard を使用して、複数のデータセットとスコアリング関数にわたってモデル性能を比較する方法を説明します。最終的には、共通の評価セットで複数のモデルをランク付けする Leaderboard をパブリッシュします。これにより、各メトリクスで最も優れたパフォーマンスを発揮するモデルを特定できます。このガイドは、Weave での評価の実行に慣れていて、結果を並べて比較したい開発者を対象としています。 具体的には、次の作業を行います。- 架空の郵便番号データを含むデータセットを生成します。
- いくつかのスコアリング関数を作成し、ベースラインモデルを評価します。
- これらの手法を使用して、モデルと評価のマトリクスを評価します。
- Weights & Biases の UI で Leaderboard を確認します。
ステップ 1: 架空の郵便番号データのデータセットを生成する
まず、架空の郵便番号データのリストを生成する関数generate_dataset_rows を作成します。この合成データセットによって、Leaderboard で各モデルをスコアリングする際に、常に同じ入力と期待値を基準として使えるようになります。
ステップ 2: スコアリング関数を作成する
次に、3 つのスコアリング関数を作成します。各 Scorer はモデル出力のそれぞれ異なる側面を評価するため、Leaderboard では品質の異なる観点ごとにモデルをランク付けできます。check_concrete_fields: モデル出力が期待される市および州と一致するかどうかを確認します。check_value_fields: モデル出力が、期待される人口および収入の中央値から 10% 以内に収まっているかどうかを確認します。check_subjective_fields: LLM を使用して、モデル出力が期待される “known for” フィールドと一致するかどうかを確認します。
ステップ 3: 評価を作成する
次に、疑似データとスコアリング関数を使って評価を定義します。Evaluation オブジェクトはデータセットと Scorer を組み合わせたものなので、どのモデルでも同じベンチマークで実行できます。