@weave.op()로 로컬 모델 함수 래핑하기
로컬 모델을 OpenAI 호환 러너로 액세스하지 않더라도, 모델을 호출하는 자체 함수를 래핑하면 트레이스를 캡처할 수 있습니다. weave.init('<your-project-name>')로 Weave를 초기화한 다음 LLM Call을 weave.op()로 래핑하면 어떤 LLM이든 Weave와 통합할 수 있습니다. 자세한 내용은 트레이싱 가이드를 참조하세요.
로컬 모델을 사용하도록 OpenAI SDK 코드 업데이트하기
로컬 모델 러너가 OpenAI SDK를 지원한다면, 두 가지만 변경해서 기존 OpenAI 클라이언트가 로컬 모델 러너를 가리키도록 할 수 있습니다. 가장 중요한 변경 사항은openai.OpenAI()를 초기화할 때 지정하는 base_url 매개변수입니다. 이 매개변수를 지정하면 OpenAI SDK가 OpenAI 호스팅 API가 아닌 로컬 서버로 요청을 보냅니다.
api_key에는 아무 문자열이나 지정해도 되지만, 반드시 재정의해야 합니다. 그렇지 않으면 OpenAI SDK가 환경 변수에서 이 값을 읽어 오류가 발생합니다.
지원되는 로컬 모델 러너
다음 러너를 사용하면 Hugging Face의 모델을 컴퓨터에 다운로드하여 실행할 수 있습니다. 각 러너는 OpenAI 호환 엔드포인트를 제공하므로, 앞에서 설명한 대로 설정을 변경하면 OpenAI SDK에서 이 엔드포인트를 사용할 수 있습니다.- Nomic GPT4All - 설정의 Local Server를 통해 지원 (FAQ)
- LMStudio - Local Server에서 OpenAI SDK 지원 (문서)
- Ollama - OpenAI SDK용 OpenAI 호환 기능 제공
- llama-cpp-python - OpenAI SDK를 지원하는
llama.cpp실행용 Python 패키지 - llamafile - Llamafile을 실행하면
http://localhost:8080/v1에서 OpenAI SDK를 자동으로 지원