Skip to main content
これはインタラクティブなノートブックです。ローカルで実行するか、以下のリンクから利用できます。

Leaderboard クイックスタート

このクイックスタートでは、W&B Weave の Leaderboard を使用して、複数のデータセットとスコアリング関数にわたってモデル性能を比較する方法を説明します。最終的には、共通の評価セットで複数のモデルをランク付けする Leaderboard をパブリッシュします。これにより、各メトリクスで最も優れたパフォーマンスを発揮するモデルを特定できます。このガイドは、Weave での評価の実行に慣れていて、結果を並べて比較したい開発者を対象としています。 具体的には、次の作業を行います。
  1. 架空の郵便番号データを含むデータセットを生成します。
  2. いくつかのスコアリング関数を作成し、ベースラインモデルを評価します。
  3. これらの手法を使用して、モデルと評価のマトリクスを評価します。
  4. Weights & Biases の UI で Leaderboard を確認します。

ステップ 1: 架空の郵便番号データのデータセットを生成する

まず、架空の郵便番号データのリストを生成する関数 generate_dataset_rows を作成します。この合成データセットによって、Leaderboard で各モデルをスコアリングする際に、常に同じ入力と期待値を基準として使えるようになります。

ステップ 2: スコアリング関数を作成する

次に、3 つのスコアリング関数を作成します。各 Scorer はモデル出力のそれぞれ異なる側面を評価するため、Leaderboard では品質の異なる観点ごとにモデルをランク付けできます。
  1. check_concrete_fields: モデル出力が期待される市および州と一致するかどうかを確認します。
  2. check_value_fields: モデル出力が、期待される人口および収入の中央値から 10% 以内に収まっているかどうかを確認します。
  3. check_subjective_fields: LLM を使用して、モデル出力が期待される “known for” フィールドと一致するかどうかを確認します。

ステップ 3: 評価を作成する

次に、疑似データとスコアリング関数を使って評価を定義します。Evaluation オブジェクトはデータセットと Scorer を組み合わせたものなので、どのモデルでも同じベンチマークで実行できます。

ステップ 4: ベースラインモデルを評価する

次に、静的な応答を返すベースラインモデルを評価します。ベースラインを設定しておくと、Leaderboard 上に比較の基準点ができるため、以降の各モデルが静的な実装に比べてどの程度改善したかを測定できます。

ステップ 5: モデルをさらに作成する

次に、ベースラインと比較するモデルをさらに 2 つ作成します。一方のモデルには追加のプロンプトを与えずに郵便番号だけを渡し、もう一方には構造化されたプロンプトを渡します。これらを Leaderboard で比較すると、プロンプトのコンテキストが回答の品質にどう影響するかを確認できます。

ステップ 6: さらに評価を作成する

次に、モデルと評価を組み合わせたマトリクスで評価を実行します。すべてのモデルを複数のデータセット (地域や年が異なるもの) で実行すると、Leaderboard が複数の条件でモデルをランク付けするのに必要なデータが揃います。

ステップ 7: Leaderboard を確認する

評価結果をパブリッシュしたので、これらを Leaderboard にまとめて並べて比較できるようになりました。 新しい Leaderboard を作成するには、UI の Leaderboard タブに移動し、Create Leaderboard をクリックします。 Python から直接 Leaderboard を生成することもできます。
これで、定義した 3 つの評価とスコアリングメトリクスに基づいて各モデルをランク付けする Leaderboard が Weave にパブリッシュされました。Weights & Biases の UI では、モデルごとのスコアの確認や個々の評価 run の詳細な分析に加え、今後のモデルの反復処理を同じベースラインと比較することもできます。
最終更新日 2026年9月30日