Skip to main content
이 가이드에서는 Weave를 Serverless Inference와 함께 사용하면서 Weave의 기본 사항을 익히는 방법을 설명합니다. Serverless Inference를 사용하면 자체 인프라를 구성하거나 여러 공급자의 API 키를 관리하지 않고도 실시간으로 제공되는 오픈 소스 모델로 LLM 애플리케이션을 구축하고 트레이스할 수 있습니다. CoreWeave Forge API 키만 있으면 Serverless Inference에서 호스팅하는 모든 모델을 사용할 수 있습니다. 이 가이드를 마치면 LLM Call을 트레이스하고, 모델을 비교하고, 평가를 실행해 그 결과를 Weights & Biases UI에서 검토할 수 있습니다.

학습 내용

이 가이드에서는 다음 방법을 설명합니다.
  • Weave와 Serverless Inference 설정하기
  • 자동 트레이싱 기능을 갖춘 기본 LLM 애플리케이션 구축하기
  • 여러 모델 비교하기
  • 데이터셋에서 모델 성능 평가하기
  • Weights & Biases UI에서 결과 확인하기

사전 요구 사항

  • CoreWeave Forge 계정
  • Python 3.10 이상 또는 Node.js 18 이상
  • 필수 패키지 설치:
    • Python: pip install weave openai
    • TypeScript: npm install weave openai
  • 환경 변수로 설정된 OpenAI API 키

첫 번째 LLM Call 트레이스하기

이 섹션에서는 LLM Call을 한 번 수행하고 Weave가 이를 자동으로 트레이스하도록 하는 방법을 설명합니다. 더 복잡한 예시로 넘어가기 전에 설정이 제대로 작동하는지 확인할 수 있습니다. 먼저 다음 코드 예시를 복사하여 붙여 넣으세요. 이 예시에서는 Serverless Inference의 Llama 3.1-8B를 사용합니다. 이 코드를 실행하면 Weave는 다음을 수행합니다.
  • LLM Call을 자동으로 트레이스합니다.
  • 입력, 출력, 지연 시간, 토큰 사용량을 로깅합니다.
  • Weights & Biases UI에서 트레이스를 확인할 수 있는 링크를 제공합니다.

텍스트 요약 애플리케이션 구축하기

앞에서 단일 LLM Call을 트레이스해 보았습니다. 이 섹션에서는 Weave가 여러 함수에 걸친 중첩된 오퍼레이션을 어떻게 트레이스하는지 살펴보고, 실제 다단계 LLM 애플리케이션이 UI에서 어떻게 캡처되는지 확인합니다. 다음 코드를 실행하세요. 이 코드는 Weave가 중첩된 오퍼레이션을 트레이스하는 방식을 보여 주는 기본 요약 앱입니다.

여러 모델 비교하기

Weave의 대표적인 사용 사례 중 하나는 같은 프롬프트에 대해 여러 모델이 어떻게 응답하는지 비교하는 것입니다. Serverless Inference를 사용하면 여러 모델에 액세스할 수 있습니다. 다음 코드를 사용하여 Llama와 DeepSeek의 응답 성능을 비교해 보세요.

모델 성능 평가하기

이 섹션에서는 임시 비교에서 한 걸음 더 나아가, 데이터셋 전체에 대해 구조화된 평가를 실행하여 모델 품질을 체계적으로 측정하고 비교하는 방법을 설명합니다. Weave에 기본 제공되는 EvaluationLogger를 사용하여 Q&A 작업에서 모델의 성능을 평가하세요. EvaluationLogger는 자동 집계, 토큰 사용량 캡처, UI의 다양한 비교 기능을 갖춘 구조화된 평가 추적을 제공합니다. 이전 섹션에서 사용한 스크립트에 다음 코드를 추가하세요.
이 예시를 실행하면 트레이스된 LLM Call, 중첩된 요약 파이프라인, 모델 비교, 전체 평가가 Weave에 로깅됩니다. 예시를 실행하면 터미널에 트레이스 링크가 반환되며, 링크를 클릭하면 Weights & Biases UI에서 트레이스를 확인할 수 있습니다. Weights & Biases UI에서는 다음 작업을 할 수 있습니다.
  • 모든 LLM Call의 타임라인을 검토합니다.
  • 각 오퍼레이션의 입력과 출력을 살펴봅니다.
  • 토큰 사용량과 예상 비용을 확인합니다(EvaluationLogger가 자동으로 캡처).
  • 지연 시간과 성능 메트릭을 분석합니다.
  • Evals 탭으로 이동하여 집계된 평가 결과를 확인합니다.
  • Compare 기능을 사용하여 여러 모델의 성능을 비교 분석합니다.
  • 개별 예시를 차례로 넘겨 보며 동일한 입력에 대해 각 모델이 어떤 성능을 보였는지 확인합니다.

사용 가능한 모델

사용 가능한 모델의 전체 목록은 Serverless Inference 문서의 사용 가능한 모델 섹션을 참조하세요.

다음 단계

기본 개념을 익혔다면 다음 리소스를 통해 Weave와 Serverless Inference를 더 깊이 있게 활용해 보세요.

문제 해결

마지막 수정일 2026년 9월 30일