Skip to main content
W&B Weave は、信頼性の高いエージェントと LLM アプリケーションを構築するための可観測性と評価のプラットフォームです。Weave を使用すると、AI アプリケーションの動作を理解し、性能を測定し、継続的かつ体系的に改善できます。 LLM アプリケーションの構築は、従来のソフトウェア開発とは根本的に異なります。LLM の出力は非決定的であり、デバッグが難しくなります。品質は主観的で、コンテキストに依存します。プロンプトのわずかな変更が、予期しない動作の変化を引き起こすことがあります。従来のテスト手法では十分に対応できません。

コア機能

Weave は以下のコア機能を提供します:
  • 可視性:エージェントセッションやマルチターン会話、またはアプリケーションコード内の個々の関数の Call と出力。
  • 体系的な評価:厳選されたテストケースに対するパフォーマンスの測定。
  • バージョントラッキング:プロンプト、モデル、データの変更内容を把握するためのトラッキング。
  • 実験:異なるプロンプトやモデルの比較。
  • フィードバックの収集:人間の判断やアノテーションの取得。
  • 本番でのモニタリング:LLM の安全性と品質のためのガードレールと Scorer を使用したモニタリング。

ワークフローを選択する

Weave は、2 つの異なるワークフローを通じてこの機能を提供します。
  • エージェントの自動トレース
  • アプリケーションの任意の LLM Call と関数にインストルメンテーションを追加して、入力、出力、コードをトレースする

エージェントをトレースする

Weave’s agent tracing workflows are also available in CoreWeave Agent Lens, the successor to Weights & Biases Weave. Both services already receive your agent tracing data, so there is nothing to migrate. See What is Agent Lens for more information.
Weave は、エージェント会話の完全なライフサイクル (セッション、LLM Call、ツール実行を含む) に対する可観測性を提供します。 エージェントのトレースは OpenTelemetry (OTel) と GenAI semantic conventions に基づいて構築されています。エージェントがすでに OTel でインストルメントされている場合、コードを再インストルメントすることなく既存のスパンを Weave に送信できます。Weave は任意の OTel スパンを受け入れ、その属性を保存してクエリできるようにします。invoke_agent や execute_tool などの GenAI エージェント規約に従うスパンは、Agents ビューで会話、ターン、ツール呼び出しとしてレンダリングされます。独自のエージェントからこれらのスパンを出力する方法については、custom agents quickstart を参照してください。 エージェントを構築する場合は、エージェントインテグレーションのクイックスタート から組み込みインテグレーションを選択するか、custom agents quickstart に従って手動でインストルメンテーションを行ってください。Weave SDK がエージェントをどのようにモデル化するかについては、Trace your agents を参照してください。 Claude Code や OpenAI Agent SDK などのサポートされるサードパーティのエージェントハーネスを使用している場合、Weave は追加のコードなしで自動的にインストルメントします。サポートされるすべてのフレームワークについては、インテグレーション を参照してください。

関数のインストルメントとトレース

個々の関数の Call、アプリケーションコード、カスタムロジックをトレースするには、Weave Op と Call を使用します。任意の関数に 1 行追加するだけで、入力、出力、コスト、トークン数、レイテンシーをトラッキングできます。また、次のこともできます。
  • LLM アプリケーション内のデータの流れをエンドツーエンドでトラッキングします。
  • LLM のフィードバックを生成するために使用されたソースドキュメントを確認します。
  • 特定のプロンプトや回答の生成過程を詳しく調べます。
個々の関数をトレースするには、Weave の Op tracing クイックスタートに従うか、Weave の Op と Callの使用方法を確認してください。 Weave SDK は、多くの異なるフレームワークや LLM プロバイダに自動的にパッチを適用し、コード内の LLM Call からトレースを自動的に取得します。サポートされるすべてのプロバイダーとフレームワークについては、インテグレーションを参照してください。

エージェントのトレースとアプリケーションのインストルメンテーションの使い分け

観測したい対象に応じて、使用するワークフローを選択します。
  • エージェントを構築または実行する場合は、エージェントのトレースを使用します。 サポートされるエージェントハーネスやエージェント SDK を使用している場合、または自分でインストルメントできるカスタムエージェントを構築した場合に適しています。
  • アプリケーションコードをトレースする場合は、アプリケーションのインストルメンテーションを使用します。 RAG パイプライン、要約エンドポイント、カスタムビジネスロジックなど、会話ではなく個別の Call を中心に構成されたアプリケーションに適しています。
それぞれの方法で記録されたトレースは、UI の異なる場所に表示されます。エージェントのトレースは Agents ページに、weave.op の Call は Traces ページに表示されます。同じ Weave プロジェクトで両方の方法を使用できますが、生成されるトレースは別々です。 どこから始めるか迷っていて、システムにエージェントが含まれる場合は、エージェントインテグレーションのクイックスタートを使用して、エージェントのトレースから始めてください。それ以外の場合は、Op tracing クイックスタートから始めてください。

評価

エージェントまたは LLM アプリケーションのパフォーマンスを評価を使用してベンチマークおよび監視し、品質と信頼性を反復的に改善します。
  • どのモデルとプロンプトのバージョンがどのようなパフォーマンスをもたらしたかをトラッキングします。
  • 1つ以上のスコアリング関数を使用して応答を評価するためのメトリクスを定義します。
  • 複数のメトリクスにわたって2つ以上の異なる評価を比較します。特定サンプルのパフォーマンスを対比します。
評価パイプラインを構築する

すべてをバージョン管理

Weave はプロンプト、データセット、モデルの設定のバージョンをトラッキングします。問題が発生したときは、何が変わったのかを正確に確認できます。うまく動作したときは、それを再現できます。 バージョン管理について詳しく見る

プロンプトとモデルで実験する

APIキーを使って、プレイグラウンドでさまざまな商用モデルのプロンプトをテストし、応答を比較しましょう。 Weave プレイグラウンド で実験する

フィードバックを収集する

本番での使用から人間のフィードバック、アノテーション、修正を取得します。このデータを使用して、より良いテストケースを構築し、アプリケーションを改善します。 フィードバックを収集する

本番環境を監視する

評価で使用しているのと同じ Scorer で、本番トラフィックをスコアリングします。ガードレールを設定すると、問題がユーザーに届く前に検出できます。 ガードレールとモニターを設定する

Weave を使い始める

Weave は Python と TypeScript 向けの SDK を提供しています。どちらの SDK も、トレース、評価、データセット、および Weave の主要機能をサポートしています。クラスベースの Models や Scorer など、一部の高度な機能は Weave TypeScript SDK では利用できません。 Weave を使い始めるには、次の手順に従います。
  1. https://id.coreweave.com/signup で CoreWeave Forge アカウントを作成し、https://forge.coreweave.com/settings#apikeys から APIキーを取得します。
  2. Weave をインストールします。
  1. スクリプトで Weave をインポートし、project を初期化します。<your-team> を CoreWeave Forge のチーム名に、<your-project> を Weights & Biases のプロジェクト名に置き換えます。
これで Weave を使用する準備が整いました。
最終更新日 2026年9月30日