コア機能
Weave は以下のコア機能を提供します:- 可視性:エージェントセッションやマルチターン会話、またはアプリケーションコード内の個々の関数の Call と出力。
- 体系的な評価:厳選されたテストケースに対するパフォーマンスの測定。
- バージョントラッキング:プロンプト、モデル、データの変更内容を把握するためのトラッキング。
- 実験:異なるプロンプトやモデルの比較。
- フィードバックの収集:人間の判断やアノテーションの取得。
- 本番でのモニタリング:LLM の安全性と品質のためのガードレールと Scorer を使用したモニタリング。
ワークフローを選択する
Weave は、2 つの異なるワークフローを通じてこの機能を提供します。- エージェントの自動トレース
- アプリケーションの任意の LLM Call と関数にインストルメンテーションを追加して、入力、出力、コードをトレースする
エージェントをトレースする
Weave’s agent tracing workflows are also available in CoreWeave Agent Lens, the successor to Weights & Biases Weave. Both services already receive your agent tracing data, so there is nothing to migrate. See What is Agent Lens for more information.
invoke_agent や execute_tool などの GenAI エージェント規約に従うスパンは、Agents ビューで会話、ターン、ツール呼び出しとしてレンダリングされます。独自のエージェントからこれらのスパンを出力する方法については、custom agents quickstart を参照してください。
エージェントを構築する場合は、エージェントインテグレーションのクイックスタート から組み込みインテグレーションを選択するか、custom agents quickstart に従って手動でインストルメンテーションを行ってください。Weave SDK がエージェントをどのようにモデル化するかについては、Trace your agents を参照してください。
Claude Code や OpenAI Agent SDK などのサポートされるサードパーティのエージェントハーネスを使用している場合、Weave は追加のコードなしで自動的にインストルメントします。サポートされるすべてのフレームワークについては、インテグレーション を参照してください。
関数のインストルメントとトレース
個々の関数の Call、アプリケーションコード、カスタムロジックをトレースするには、Weave Op と Call を使用します。任意の関数に 1 行追加するだけで、入力、出力、コスト、トークン数、レイテンシーをトラッキングできます。また、次のこともできます。- LLM アプリケーション内のデータの流れをエンドツーエンドでトラッキングします。
- LLM のフィードバックを生成するために使用されたソースドキュメントを確認します。
- 特定のプロンプトや回答の生成過程を詳しく調べます。
エージェントのトレースとアプリケーションのインストルメンテーションの使い分け
観測したい対象に応じて、使用するワークフローを選択します。- エージェントを構築または実行する場合は、エージェントのトレースを使用します。 サポートされるエージェントハーネスやエージェント SDK を使用している場合、または自分でインストルメントできるカスタムエージェントを構築した場合に適しています。
- アプリケーションコードをトレースする場合は、アプリケーションのインストルメンテーションを使用します。 RAG パイプライン、要約エンドポイント、カスタムビジネスロジックなど、会話ではなく個別の Call を中心に構成されたアプリケーションに適しています。
weave.op の Call は Traces ページに表示されます。同じ Weave プロジェクトで両方の方法を使用できますが、生成されるトレースは別々です。
どこから始めるか迷っていて、システムにエージェントが含まれる場合は、エージェントインテグレーションのクイックスタートを使用して、エージェントのトレースから始めてください。それ以外の場合は、Op tracing クイックスタートから始めてください。
評価
エージェントまたは LLM アプリケーションのパフォーマンスを評価を使用してベンチマークおよび監視し、品質と信頼性を反復的に改善します。- どのモデルとプロンプトのバージョンがどのようなパフォーマンスをもたらしたかをトラッキングします。
- 1つ以上のスコアリング関数を使用して応答を評価するためのメトリクスを定義します。
- 複数のメトリクスにわたって2つ以上の異なる評価を比較します。特定サンプルのパフォーマンスを対比します。
すべてをバージョン管理
Weave はプロンプト、データセット、モデルの設定のバージョンをトラッキングします。問題が発生したときは、何が変わったのかを正確に確認できます。うまく動作したときは、それを再現できます。 バージョン管理について詳しく見るプロンプトとモデルで実験する
APIキーを使って、プレイグラウンドでさまざまな商用モデルのプロンプトをテストし、応答を比較しましょう。 Weave プレイグラウンド で実験するフィードバックを収集する
本番での使用から人間のフィードバック、アノテーション、修正を取得します。このデータを使用して、より良いテストケースを構築し、アプリケーションを改善します。 フィードバックを収集する本番環境を監視する
評価で使用しているのと同じ Scorer で、本番トラフィックをスコアリングします。ガードレールを設定すると、問題がユーザーに届く前に検出できます。 ガードレールとモニターを設定するWeave を使い始める
Weave は Python と TypeScript 向けの SDK を提供しています。どちらの SDK も、トレース、評価、データセット、および Weave の主要機能をサポートしています。クラスベースの Models や Scorer など、一部の高度な機能は Weave TypeScript SDK では利用できません。 Weave を使い始めるには、次の手順に従います。- https://id.coreweave.com/signup で CoreWeave Forge アカウントを作成し、https://forge.coreweave.com/settings#apikeys から APIキーを取得します。
- Weave をインストールします。
- スクリプトで Weave をインポートし、project を初期化します。
<your-team>を CoreWeave Forge のチーム名に、<your-project>を Weights & Biases のプロジェクト名に置き換えます。