Skip to main content
これはインタラクティブなノートブックです。ローカルで実行するか、以下のリンクから利用できます。
このノートブックでは、最小構成のエンドツーエンドの例を通じて、W&B Weave の評価を紹介します。Weave Model を定義して小規模なデータセットで実行し、カスタムのスコアリング関数で出力をスコア付けしたうえで、その結果を Weave で確認します。Weave を初めて使用する開発者を対象としており、より高度な評価ワークフローに取り組む前に、実際に手を動かしながらすばやく始められる内容になっています。

前提条件

Weave の評価を実行する前に、以下の前提条件を満たしてください。
  1. W&B Weave SDK をインストールし、APIキーでログインします。
  2. OpenAI SDK をインストールし、APIキーでログインします。
  3. Weights & Biases の project を初期化します。

最初の評価を実行する

環境の設定が完了したので、評価を定義して実行してみましょう。 次のコードサンプルは、Weave の Model API と Evaluation API を使用して LLM を評価する方法を示しています。まず、weave.Model をサブクラス化して Weave モデルを定義します。このとき、モデル名とプロンプトの形式を指定し、predict メソッドを @weave.op でトラッキングします。predict メソッドは OpenAI にプロンプトを送信し、Pydantic スキーマ (FruitExtract) を使用して応答を構造化された出力にパースします。次に、入力文と期待されるターゲットで構成される小規模な評価データセットを作成します。続いて、モデルの出力をターゲットラベルと比較するカスタムのスコアリング関数を定義します (この関数も @weave.op でトラッキングします)。最後に、すべてを weave.Evaluation でラップしてデータセットと scorer を指定し、evaluate() を呼び出して評価パイプラインを非同期で実行します。
評価が完了すると、Weave はモデル、データセット、およびサンプルごとのスコアを project にログします。これにより、Weights & Biases UI で結果を確認できます。

その他のサンプル

基本的な評価を実行できたら、次のチュートリアルでより高度なワークフローを確認してみましょう。
最終更新日 2026年9月30日