Skip to main content
Open In Colab Weave は Verdict Python ライブラリ を通じて行われるすべての Call を自動的にトラッキングし、ログするように設計されています。 AI 評価パイプラインを扱う場合、デバッグが重要です。パイプラインのステップが失敗したり、出力が想定外になったり、ネストされた操作が混乱を招いたりする場合、問題の特定は困難です。Verdict アプリケーションは通常、複数のパイプラインステップ、judges、および変換で構成されるため、評価ワークフローの内部動作を理解することが役立ちます。 Weave は Verdict アプリケーションのトレースを自動的に取得することで、このプロセスを効率化します。これにより、パイプラインのパフォーマンスを監視および分析して、AI 評価ワークフローをデバッグおよび最適化できます。

はじめに

Verdict パイプラインで Weave トレースを有効にするには、スクリプトの冒頭で weave.init(project=...) を呼び出します。project 引数を使用して、特定の W&B チームに team-name/project-name の形式でログするか、project-name を渡してデフォルトのチームまたは entity にログします。

Call メタデータのトラッキング

Verdict パイプラインの Call にカスタムメタデータを付与するには、weave.attributes コンテキストマネージャーを使用します。このコンテキストマネージャーを使うと、パイプラインの run や評価バッチなど、特定のコードブロックにタグを付けられます。これにより、後から Weights & Biases UI で関連するトレースをフィルタリングしたり、グループ化したりできます。
Weave は、Verdict パイプラインの Call のトレースに紐づけてメタデータを自動的にトラッキングします。メタデータは Weave の Web インターフェースで確認できます。

トレース

AI 評価パイプラインのトレースを一元管理されたデータベースに保存しておくと、開発と本番運用の両方で役立ちます。これらのトレースは評価ワークフローのデバッグや改善に役立つだけでなく、有用なデータセットとしても活用できます。 Weave は Verdict アプリケーションのトレースを自動的に取得し、Verdict ライブラリを通じて行われるすべての Call をトラッキングしてログします。対象には次のものが含まれます。
  • Pipeline の実行ステップ
  • JudgeUnit による評価
  • Layer による変換
  • プーリング処理
  • カスタムユニットとカスタム変換
トレースは Weave の Web インターフェースで確認できます。Web インターフェースには、パイプライン実行の階層構造が表示されます。

パイプライン トレースの例

以下の例は、Weave がネストされたパイプライン操作をトレースする方法を示しており、マルチステージの Verdict パイプラインの各ステップがどのように取得されるかを確認できます:
これにより、詳細なトレースが表示されます:
  • メインの Pipeline 実行。
  • Layer 内の各 JudgeUnit 評価。
  • MeanPoolUnit の集約ステップ。
  • 各操作のタイミング情報。

設定

weave.init() を呼び出すと、Weave は Verdict パイプラインのトレースを自動的に有効にします。このインテグレーションは Pipeline.__init__() メソッドをパッチして VerdictTracer を注入し、すべてのトレースデータを Weave に転送することで動作します。 追加の設定は必要ありません。Weave は自動的に以下の操作を行います。
  • すべてのパイプライン操作を取得します。
  • 実行タイミングをトラッキングします。
  • 入力と出力をログします。
  • トレース階層を維持します。
  • 同時パイプライン実行を処理します。

カスタムトレーサーと Weave

アプリケーションですでにカスタムの Verdict トレーサーを使用している場合でも、Weave の VerdictTracer はそれらと併用できるため、どちらかのインテグレーションを選ぶ必要はありません。

モデルと評価

複数のパイプラインコンポーネントで構成される AI システムの整理と評価は、容易ではありません。weave.Model を使用すると、プロンプト、パイプラインの設定、評価パラメーターなどの実験の詳細を取得して整理できるため、イテレーションごとの比較が容易になります。 次の例では、Verdict パイプラインを weave.Model でラップする方法を示します。
このコードで作成したモデルは Weights & Biases UI で可視化でき、パイプラインの構造と評価結果の両方を確認できます。

評価

評価では、評価パイプライン自体のパフォーマンスを測定できます。weave.Evaluation クラスを使用すると、特定のタスクやデータセットに対する Verdict パイプラインのパフォーマンスを取得できます。
これにより、さまざまなテストケースにおける Verdict パイプラインのパフォーマンスを示す評価トレースが作成されます。

ベストプラクティス

以下のセクションでは、Verdict パイプラインで Weave を使用する際のパフォーマンスのモニタリングとエラーの処理に関するベストプラクティスを説明します。

パフォーマンスモニタリング

Weave はすべてのパイプライン操作のタイミング情報を自動的に取得するので、run 全体のパフォーマンスボトルネックを特定するために使用できます:

エラー処理

Weave はパイプラインの実行中に発生した例外を自動的に取得します。そのため、アプリケーション側で例外を処理した場合でも、失敗はトレースに記録されます。
Weave を Verdict と統合すると、AI 評価パイプラインを可視化できるため、評価ワークフローのデバッグや最適化、理解が容易になります。
最終更新日 2026年9月30日