Skip to main content
많은 개발자가 Llama 3, Mixtral, Gemma, Phi 같은 오픈 소스 모델을 자체 하드웨어에서 실행합니다. Weave는 OpenAI SDK 호환 기능을 제공하는 여러 로컬 모델 러너를 기본으로 지원합니다. 이 가이드에서는 로컬에서 호스팅하는 모델에 대한 Call을 Weave로 트레이스하는 방법을 설명합니다. 이 방법을 사용하면 호스팅형 LLM 공급자와 마찬가지로 입력, 출력, 메타데이터를 캡처할 수 있습니다. 이 가이드는 자신의 머신에서 오픈 소스 모델을 실행하면서 해당 Call에 대한 관측성을 확보하려는 개발자를 위한 것입니다.

@weave.op()로 로컬 모델 함수 래핑하기

로컬 모델을 OpenAI 호환 러너로 액세스하지 않더라도, 모델을 호출하는 자체 함수를 래핑하면 트레이스를 캡처할 수 있습니다. weave.init('<your-project-name>')로 Weave를 초기화한 다음 LLM Call을 weave.op()로 래핑하면 어떤 LLM이든 Weave와 통합할 수 있습니다. 자세한 내용은 트레이싱 가이드를 참조하세요.

로컬 모델을 사용하도록 OpenAI SDK 코드 업데이트하기

로컬 모델 러너가 OpenAI SDK를 지원한다면, 두 가지만 변경해서 기존 OpenAI 클라이언트가 로컬 모델 러너를 가리키도록 할 수 있습니다. 가장 중요한 변경 사항은 openai.OpenAI()를 초기화할 때 지정하는 base_url 매개변수입니다. 이 매개변수를 지정하면 OpenAI SDK가 OpenAI 호스팅 API가 아닌 로컬 서버로 요청을 보냅니다.
로컬 모델의 경우 api_key에는 아무 문자열이나 지정해도 되지만, 반드시 재정의해야 합니다. 그렇지 않으면 OpenAI SDK가 환경 변수에서 이 값을 읽어 오류가 발생합니다.

지원되는 로컬 모델 러너

다음 러너를 사용하면 Hugging Face의 모델을 컴퓨터에 다운로드하여 실행할 수 있습니다. 각 러너는 OpenAI 호환 엔드포인트를 제공하므로, 앞에서 설명한 대로 설정을 변경하면 OpenAI SDK에서 이 엔드포인트를 사용할 수 있습니다.
마지막 수정일 2026년 9월 30일