Serverless Inference
Serverless Inference は、W&B Weave および OpenAI 互換 API を通じて、オープンソースの基盤モデルへのアクセスを提供します。このガイドでは、API および Weights & Biases UI から Serverless Inference を呼び出す方法と、それらの Call を Weave でトレース、評価、監視する方法について説明します。Serverless Inference を使用すると、次のことができます。- ホスティングプロバイダーへの登録やモデルのセルフホスティングを行わずに、AI アプリケーションやエージェントを開発する。
- Weave プレイグラウンド でサポートされるモデルを試す。
このガイドでは、次の内容について説明します。
前提条件
API または Weights & Biases UI から Serverless Inference サービスにアクセスするには、次のものが必要です。- CoreWeave Forge アカウント。アカウントを作成してください。
- APIキー。User Settings で APIキーを作成してください。
- Weights & Biases の project。
- Python から Inference サービスを使用する場合は、Python 経由で API を使用するための追加の前提条件を参照してください。
Python 経由で API を使用するための追加の前提条件
Python から Inference API を使用するには、まず一般的な前提条件を満たしてください。次に、ローカル環境にopenai ライブラリと weave ライブラリをインストールします。openai ライブラリは、Inference エンドポイントの呼び出しに使用する OpenAI 互換クライアントを提供します。また、weave ライブラリを使用すると、これらの Call をトレースおよび評価できます。
weave ライブラリは、Weave を使用して LLM アプリケーションをトレースする場合にのみ必要です。Weave の導入方法については、Weave クイックスタートを参照してください。Weave で Serverless Inference サービスを使用する例については、API の使用例を参照してください。API 仕様
以下のセクションでは、API 仕様と API の使用例を紹介します。これらを参考にすると、独自のアプリケーションやスクリプトから Inference サービスをプログラムで呼び出せます。エンドポイント
Inference サービスには、次のエンドポイントからアクセスします。利用可能なメソッド
Inference サービスでは、次の API メソッドがサポートされています。チャット補完
利用できる主な API メソッドは/chat/completions です。このメソッドは OpenAI 互換のリクエスト形式をサポートしており、サポートされるモデルにメッセージを送信して補完結果を受け取ることができます。Weave で Serverless Inference サービスを使用する方法については、API の使用例を参照してください。
チャット補完を作成するには、以下が必要です。
- Inference サービスのベース URL
https://api.inference.wandb.ai/v1 - W&B APIキー
<your-api-key> - W&B の entity 名とプロジェクト名
<your-team>/<your-project> - 使用するモデルの ID (以下のいずれか):
meta-llama/Llama-3.1-8B-Instructdeepseek-ai/DeepSeek-V3-0324meta-llama/Llama-3.3-70B-Instructdeepseek-ai/DeepSeek-R1-0528meta-llama/Llama-4-Scout-17B-16E-Instructmicrosoft/Phi-4-mini-instruct
- Bash
- Python
サポートされるモデルの一覧表示
API を使用すると、利用可能なすべてのモデルとその ID をクエリできます。モデルを動的に選択する場合や、お使いの環境で利用可能なモデルを確認する場合に便利です。- Bash
- Python
使用例
以下のセクションでは、Weave で Serverless Inference を使用する方法をいくつかの例で紹介します。まず基本的な例で単一のモデルの Call をトレースし、次に高度な例で複数のモデルを評価・比較します。基本的な例:Weave で Llama 3.1 8B をトレースする
次の Python コードサンプルでは、Serverless Inference API を使用して Llama 3.1 8B モデルにプロンプトを送信し、その Call を Weave でトレースする方法を示します。トレースを使用すると、LLM Call の入力と出力をすべて取得し、パフォーマンスを監視しながら、Weights & Biases UI で結果を分析できます。 この例の内容は次のとおりです。@weave.op()でデコレートされた関数run_chatを定義します。この関数は、OpenAI 互換クライアントを使用してチャット補完リクエストを送信します。- Weave はトレースを記録し、W&B の entity と project (
project="<your-team>/<your-project>") に関連付けます。 - Weave は関数を自動的にトレースし、その入力、出力、レイテンシー、メタデータ (モデル ID など) をログします。
- 結果はターミナルに出力され、トレースは Forge 上の指定した project の Traces タブに表示されます。
https://forge.coreweave.com/wandb/<your-team>/<your-project>/r/call/01977f8f-839d-7dda-b0c2-27292ef0e04g) をクリックするか、次の手順に従います。
- Forge にアクセスします。
- Traces タブを選択して、Weave トレースを表示します。

高度な例: Inference サービスで Weave Evaluations と Leaderboard を使用する
また、Inference サービスで Weave を使用すると、モデルの Call をトレースしたり、パフォーマンスを評価したり、Leaderboard をパブリッシュしたりすることもできます。次の Python コードサンプルでは、質問応答データセットを使用して 2 つのモデルを比較します。 この例を使用するには、一般的な前提条件とPython 経由で API を使用するための追加の前提条件を満たしておく必要があります。- Traces タブにアクセスして、トレースを表示します。
- Evals タブにアクセスして、モデル評価を表示します。
- Leaders タブにアクセスして、生成された Leaderboard を表示します。


UI
以下のセクションでは、Weights & Biases UI からの Inference サービスの使い方について説明します。UI から Inference サービスにアクセスするには、事前に前提条件を満たしておく必要があります。Inference サービスにアクセスする
Inference サービスには、Weights & Biases UI の以下の場所からアクセスできます。直接リンク
https://forge.coreweave.com/inference にアクセスします。Inference タブから
- Forge で CoreWeave Forge アカウントにアクセスします。
- 左サイドバーで Inference を選択します。利用可能なモデルとその情報を示すページが表示されます。

プレイグラウンド タブから
- 左サイドバーで プレイグラウンド を選択します。プレイグラウンド のチャット UI が表示されます。
- LLM ドロップダウンリストで Serverless Inference にカーソルを合わせます。右側に、利用可能な Serverless Inference モデルのドロップダウンが表示されます。
- Serverless Inference モデルのドロップダウンでは、次の操作を行えます。
- 利用可能なモデル名をクリックして、プレイグラウンド でそのモデルを試す。
- プレイグラウンド で 1 つ以上のモデルを比較する。

プレイグラウンドでモデルを試す
いずれかのアクセス方法でモデルを選択したら、プレイグラウンドでそのモデルを試すことができます。プレイグラウンドでは次の操作を行えます。
複数のモデルを比較する
プレイグラウンドでは、複数の Inference モデルを比較できます。Compare ビューには、次の 2 つの場所からアクセスできます。Inference タブから Compare ビューにアクセスする
- 左サイドバーで Inference を選択します。利用可能なモデルとその情報を一覧表示するページが開きます。
- 比較するモデルを選択するには、モデルカード上の任意の場所 (モデル名以外) をクリックします。選択されたモデルカードは、枠線が青色で強調表示されます。
- 比較するモデルごとにステップ 2 を繰り返します。
- 選択したいずれかのカードで、Compare N models in the Playground ボタンをクリックします (
Nは比較するモデルの数です。たとえば、3 つのモデルを選択した場合、ボタンには Compare 3 models in the Playground と表示されます)。Comparison ビューが開きます。

プレイグラウンド タブから Compare ビューにアクセスする
- 左サイドバーから プレイグラウンド を選択します。プレイグラウンド のチャット UI が表示されます。
- LLM ドロップダウンリストで Serverless Inference にカーソルを合わせます。利用可能な Serverless Inference モデルのドロップダウンが右側に表示されます。
- ドロップダウンから Compare を選択します。Inference タブが表示されます。
- 比較するモデルを選択するには、モデルカードの任意の場所 (モデル名以外) をクリックします。選択されたモデルカードは、枠線が青色でハイライトされます。
- 比較するモデルごとにステップ 4 を繰り返します。
- 選択したいずれかのカードで、Compare N models in the プレイグラウンド ボタンをクリックします (
Nは比較するモデルの数です。たとえば、3 つのモデルを選択した場合、ボタンには Compare 3 models in the プレイグラウンド と表示されます)。Comparison ビューが開きます。
請求と使用状況の情報を表示する
組織管理者は、現在の Inference クレジット残高、使用履歴、今後の請求額 (該当する場合) を Weights & Biases UI から直接トラッキングできます。- Weights & Biases UI で、W&B の Billing ページにアクセスします。
- 画面右下に Inference の請求情報カードが表示されます。このカードでは次の操作ができます。
- Inference の請求情報カードにある View usage ボタンをクリックすると、使用状況の推移を確認できます。
- 有料プランをご利用の場合は、今後発生する Inference の料金を確認できます。
利用に関する情報と制限
以下のセクションでは、地理的制限、同時実行制限、料金など、利用に関する重要な情報と制限について説明します。サービスをご利用になる前に、これらの情報を必ずご確認ください。地理的制限
Inference サービスには、サポートされている場所からのみアクセスできます。詳細は、利用規約を参照してください。同時実行制限
公平な利用と安定したパフォーマンスを確保するため、Serverless Inference API ではユーザー単位および project 単位でレート制限を適用しています。これらの制限には、次の目的があります。- 不正利用を防ぎ、API の安定性を保護する。
- すべてのユーザーがアクセスできるようにする。
- インフラストラクチャーの負荷を効率的に管理する。
429 Concurrency limit reached for requests 応答を返します。このエラーを解消するには、同時リクエスト数を減らしてください。