@weave.op() でローカルモデルの関数をラップする
ローカルモデルに OpenAI 互換のランナー経由でアクセスしていない場合でも、モデルを呼び出す独自の関数をラップすることでトレースを取得できます。weave.init('<your-project-name>') で Weave を初期化し、LLM への Call を weave.op() でラップすることで、任意の LLM と Weave を統合できます。詳細については、トレースガイドを参照してください。
OpenAI SDK コードをローカルモデルを使用するように更新する
ローカルモデルランナーが OpenAI SDK をサポートする場合、既存の OpenAI クライアントを 2 つの変更でローカルモデルランナーに向けることができます。 主な変更は、openai.OpenAI() の初期化時の base_url パラメーターです。これにより、OpenAI SDK は OpenAI がホストする API ではなく、ローカルサーバーにリクエストを送信するようになります。
api_key は任意の string にできますが、必ず上書きする必要があります。そうしないと、OpenAI SDK が環境変数から読み取ってエラーを表示します。
サポートされるローカルモデルランナー
以下のランナーを使用すると、Hugging Face からモデルをコンピューターにダウンロードして実行できます。各ランナーは OpenAI 互換のエンドポイントを公開しており、前述の変更を適用すれば、OpenAI SDK の接続先として指定できます。- Nomic GPT4All - 設定の Local Server を通じてサポート (FAQ)
- LMStudio - Local Server の OpenAI SDK サポートに関するドキュメント
- Ollama - OpenAI SDK 向けの OpenAI 互換性
- llama-cpp-python - OpenAI SDK をサポートし、
llama.cppを実行するための Python パッケージ - llamafile - Llamafile を実行すると、
http://localhost:8080/v1で OpenAI SDK が自動的にサポートされます