Skip to main content
이 예시에서는 Serverless Inference를 Weave와 함께 사용하여 트레이싱, 평가, 비교를 수행하는 방법을 보여줍니다. 예시를 따라 하면서 모델 Call을 계측해 동작을 관찰하고, 데이터셋을 기준으로 성능을 측정하고, 여러 모델을 나란히 비교하는 방법을 익혀 보세요. 다음 섹션에서는 기본 트레이싱 예시와 좀 더 고급 평가 워크플로를 차례로 살펴봅니다. 예시를 실행하기 전에 먼저 사전 요구 사항을 완료하세요.

기본 예시: Llama 3.1 8B를 Weave로 트레이스하기

이 예제는 Llama 3.1 8B 모델에 프롬프트를 전송하고 Weave로 호출을 트레이스하는 방법을 보여줍니다. 트레이싱은 LLM Call의 전체 입력과 출력을 캡처하고, 성능을 모니터링하며, Weave UI에서 결과를 분석할 수 있게 합니다.
Weave의 트레이싱에 대해 자세히 알아보세요.
이 예제에서는:
  • @weave.op()로 데코레이션된 함수를 정의하여 Chat Completion 요청을 만듭니다.
  • Weave는 트레이스를 기록하고 W&B entity 및 프로젝트에 연결합니다.
  • Weave는 함수를 자동으로 트레이스하여 입력, 출력, latency, 메타데이터를 로깅합니다.
  • 결과는 터미널에 출력되고, 트레이스는 Forge의 트레이스 탭에 표시됩니다.
코드 실행 후, 다음 방법 중 하나를 사용하여 Weave에서 트레이스를 확인하세요:
  • 터미널에 출력된 링크를 클릭하세요. 예: https://wandb.ai/[YOUR-TEAM]/[YOUR-PROJECT]/r/call/01977f8f-839d-7dda-b0c2-27292ef0e04g.
  • Forge로 이동하여 트레이스 탭을 선택하세요.
기본 트레이스가 작동하면, 개별 Call을 검사하는 것 이상의 풍부한 워크플로로 진행할 수 있습니다.

고급 예시: Weave Evaluations 및 리더보드 사용

model Call을 트레이싱하는 것 외에도, 성능을 평가하고 리더보드를 게시할 수 있습니다. 이 예제는 질문-답변 데이터셋에서 두 모델을 비교하여 Llama 3.1 8B와 DeepSeek V3.1이 동일한 프롬프트에 대해 어떻게 수행하는지 보여줍니다.
이 코드를 실행한 후, Forge에서 W&B 계정으로 이동하여 다음을 수행하세요:
모델 평가 뷰
리더보드 뷰
두 예제를 모두 완료하면, 트레이스된 모델 Call 세트, 게시된 평가, 그리고 데이터셋의 모델을 비교하는 리더보드가 생성됩니다.

다음 단계

Serverless Inference를 더 알아보려면 다음을 사용해 보세요:
  • 사용 가능한 모든 메서드는 API 레퍼런스를 살펴보세요.
  • UI에서 모델을 사용해 보세요.
마지막 수정일 2026년 9월 30일