Skip to main content
このガイドでは、Serverless Inference と Weave を使用して、Weave の基礎を学ぶ方法を説明します。Serverless Inference を使用すると、独自のインフラストラクチャーの構築や複数のプロバイダーの APIキーの管理を行わずに、稼働中のオープンソースモデルを使用して LLM アプリケーションを構築し、トレースできます。CoreWeave Forge の APIキーで、Serverless Inference がホストするすべてのモデルを利用できます。このガイドを終えると、LLM Call のトレース、モデルの比較、評価の実行ができ、その結果を Weights & Biases UI で確認できます。

学習内容

このガイドでは、以下の方法を説明します。
  • Weave と Serverless Inference を設定します。
  • 自動トレース機能を備えた基本的な LLM アプリケーションを構築します。
  • 複数のモデルを比較します。
  • データセットでモデル性能を評価します。
  • Weights & Biases の UI で結果を確認します。

前提条件

  • CoreWeave Forge アカウント
  • Python 3.10 以降または Node.js 18 以降
  • 必須パッケージがインストールされていること:
    • Python: pip install weave openai
    • TypeScript: npm install weave openai
  • OpenAI APIキーが環境変数として設定されていること。

最初の LLM Call をトレースする

このセクションでは、単一の LLM Call を行い、Weave が自動的にそれをトレースする方法を示します。これにより、より複雑な例に進む前に、セットアップが正しく機能していることを確認できます。 開始するには、以下のコード例をコピー&ペーストしてください。このコード例では、Serverless Inference の Llama 3.1-8B を使用しています。 このコードを実行すると、Weave は次のことを行います:
  • LLM Call を自動的にトレースします。
  • 入力、出力、レイテンシー、トークン使用量をログします。
  • Weights & Biases UI でトレースを表示するためのリンクを提供します。

テキスト要約アプリケーションを構築する

単一の LLM Call をトレースできたので、このセクションでは、Weave が複数の関数にまたがるネストされたオペレーションをどのようにトレースするかを説明します。これにより、実際の複数ステップの LLM アプリケーションがどのように取得され、UI に表示されるかを確認できます。 次に、以下のコードを実行します。これは、Weave がネストされたオペレーションをどのようにトレースするかを示す、基本的な要約アプリケーションです。

複数のモデルを比較する

Weave の一般的な使用例として、同じプロンプトに対する異なるモデルの応答を比較することが挙げられます。Serverless Inference では、複数のモデルにアクセスできます。次のコードを使用して、Llama と DeepSeek のそれぞれの応答のパフォーマンスを比較します。

モデル性能を評価する

このセクションでは、その場限りの比較にとどまらず、データセット全体で体系的な評価を実行し、モデルの品質を系統的に測定して比較する方法を説明します。 Weave に組み込まれている EvaluationLogger を使用して、Q&A タスクでのモデル性能を評価します。これにより、自動集約、トークン使用量の取得、UI の豊富な比較機能を備えた、体系的な評価のトラッキングが可能になります。 前のセクションで使用したスクリプトに、次のコードを追加します:
これらのサンプルを実行すると、LLM Call、ネストした summarization pipeline、モデル比較、および Weave にログされた full 評価をトレースします。これらのサンプルを実行すると、ターミナルにトレースへのリンクが返されます。任意のリンクをクリックして、Weights & Biases UI でトレースを表示します。 Weights & Biases UI では、次の操作が可能です。
  • すべての LLM Call のタイムラインを確認します。
  • 各オペレーションの入力と出力を検査します。
  • トークン使用量と推定コストを表示します (EvaluationLogger により自動的に取得されます) 。
  • レイテンシーとパフォーマンス メトリクスを分析します。
  • Evals タブにアクセスして、集計された評価結果を確認します。
  • Compare 機能を使用して、異なるモデル間でのパフォーマンスを分析します。
  • 特定のサンプルをページ送りして、同じ入力に対して異なるモデルがどのように動作したかを確認します。

利用可能なモデル

利用可能なモデルの全一覧については、Serverless Inference ドキュメントの利用可能なモデルのセクションを参照してください。

次のステップ

基本を押さえたら、以下のリソースで Weave と Serverless Inference についてさらに詳しく学べます:

トラブルシューティング

最終更新日 2026年9月30日