Skip to main content
ここでは、Serverless Inference を Weave で使用して、トレース、評価、比較を行う方法をサンプルで紹介します。各サンプルを順に試しながら、モデルの Call をインストルメントしてその動作を観察する方法、データセットを使ってパフォーマンスを測定する方法、複数のモデルを並べて比較する方法を学びましょう。 以下のセクションでは、基本的なトレースのサンプルと、より高度な評価ワークフローについて順を追って説明します。どちらのサンプルを実行する場合も、事前に前提条件を済ませておいてください。

基本的な例:Weave で Llama 3.1 8B をトレースする

この例では、Llama 3.1 8B モデルにプロンプトを送信し、その Call を Weave でトレースする方法を紹介します。トレースを使用すると、LLM Call の入力と出力をすべて取得し、パフォーマンスを監視して、Weave UI で結果を分析できます。
詳しくは、Weave でのトレース を参照してください。
この例の内容は次のとおりです。
  • @weave.op() でデコレートした、チャット補完リクエストを送信する関数を定義します。
  • Weave がトレースを記録し、W&B の entity と project に関連付けます。
  • Weave が関数を自動的にトレースし、入力、出力、レイテンシー、メタデータをログします。
  • 結果がターミナルに出力され、トレースが Forge の Traces タブに表示されます。
コードを実行したら、次のいずれかの方法で Weave のトレースを確認します。
  • ターミナルに出力されたリンクをクリックします。例: https://wandb.ai/[YOUR-TEAM]/[YOUR-PROJECT]/r/call/01977f8f-839d-7dda-b0c2-27292ef0e04g
  • Forge にアクセスし、Traces タブを選択します。
基本的なトレースが動作することを確認できたら、個々の Call を確認するだけにとどまらない、より高度なワークフローに進みましょう。

応用例: Weave の評価と Leaderboard を使用する

モデルの Call をトレースするだけでなく、パフォーマンスを評価して Leaderboard をパブリッシュすることもできます。この例では、質問応答データセットを使用して 2 つのモデルを比較し、同じプロンプトに対する Llama 3.1 8B と DeepSeek V3.1 のパフォーマンスの違いを示します。
このコードを実行したら、Forge で W&B アカウントにアクセスし、次の操作を行います。
モデル評価を表示
Leaderboard を表示
両方のサンプルを完了すると、トレースされた一連のモデルの Call、パブリッシュされた評価、そしてデータセットでモデルを比較する Leaderboard が揃います。

次のステップ

Serverless Inference についてさらに詳しく知るには、次の操作をお試しください。
  • 利用可能なすべてのメソッドについては、API リファレンスを参照してください。
  • UI でモデルを試してみましょう。
最終更新日 2026年9月30日