Skip to main content
多くの開発者は、Llama 3、Mixtral、Gemma、Phi などのオープンソースモデルを自身のハードウェアで実行しています。Weave は、OpenAI SDK との互換性があれば、複数のローカルモデルランナーをデフォルトでサポートします。 このガイドでは、ローカルでホストするモデルへの Call を Weave でトレースし、ホスト型の LLM プロバイダの場合と同様に、入力、出力、メタデータを取得する方法を説明します。自身のマシンでオープンソースモデルを実行し、その Call の可観測性を確保したい開発者を対象としています。

@weave.op() でローカルモデルの関数をラップする

ローカルモデルに OpenAI 互換のランナー経由でアクセスしていない場合でも、モデルを呼び出す独自の関数をラップすることでトレースを取得できます。weave.init('<your-project-name>') で Weave を初期化し、LLM への Call を weave.op() でラップすることで、任意の LLM と Weave を統合できます。詳細については、トレースガイドを参照してください。

OpenAI SDK コードをローカルモデルを使用するように更新する

ローカルモデルランナーが OpenAI SDK をサポートする場合、既存の OpenAI クライアントを 2 つの変更でローカルモデルランナーに向けることができます。 主な変更は、openai.OpenAI() の初期化時の base_url パラメーターです。これにより、OpenAI SDK は OpenAI がホストする API ではなく、ローカルサーバーにリクエストを送信するようになります。
ローカルのモデルでは、api_key は任意の string にできますが、必ず上書きする必要があります。そうしないと、OpenAI SDK が環境変数から読み取ってエラーを表示します。

サポートされるローカルモデルランナー

以下のランナーを使用すると、Hugging Face からモデルをコンピューターにダウンロードして実行できます。各ランナーは OpenAI 互換のエンドポイントを公開しており、前述の変更を適用すれば、OpenAI SDK の接続先として指定できます。
  • Nomic GPT4All - 設定の Local Server を通じてサポート (FAQ)
  • LMStudio - Local Server の OpenAI SDK サポートに関するドキュメント
  • Ollama - OpenAI SDK 向けの OpenAI 互換性
  • llama-cpp-python - OpenAI SDK をサポートし、llama.cpp を実行するための Python パッケージ
  • llamafile - Llamafile を実行すると、http://localhost:8080/v1 で OpenAI SDK が自動的にサポートされます
最終更新日 2026年9月30日