Skip to main content
이 문서는 대화형 노트북입니다. 로컬에서 실행하거나 다음 링크를 사용할 수 있습니다.
이 노트북은 최소한의 엔드투엔드 예시를 통해 W&B Weave 평가를 소개합니다. Weave Model을 정의하고 작은 데이터셋으로 실행한 다음, 맞춤형 점수화 함수로 출력을 채점하고 Weave에서 결과를 검토합니다. Weave를 처음 사용하는 개발자가 고급 평가 워크플로를 살펴보기 전에 빠르게 직접 실습해 볼 수 있는 출발점입니다.

사전 요구 사항

Weave 평가를 실행하려면 먼저 다음 사전 요구 사항을 완료하세요.
  1. W&B Weave SDK를 설치하고 API 키로 로그인하세요.
  2. OpenAI SDK를 설치하고 API 키로 로그인하세요.
  3. Weights & Biases 프로젝트를 초기화하세요.

첫 평가 실행하기

환경을 설정한 후, 평가를 정의하고 실행할 준비가 되었습니다. 다음 코드 샘플은 Weave의 Model 및 Evaluation API를 사용하여 LLM을 평가하는 방법을 보여줍니다. 먼저 weave.Model을 서브클래싱하여 Weave 모델을 정의하고, 모델 이름과 프롬프트 형식을 지정한 다음 @weave.op로 predict 메서드를 추적합니다. predict 메서드는 OpenAI에 프롬프트를 보내고 Pydantic 스키마(FruitExtract)를 사용하여 응답을 구조화된 출력으로 파싱합니다. 그런 다음 입력 문장과 예상 대상으로 구성된 작은 평가 데이터셋을 만듭니다. 다음으로 모델의 출력을 대상 레이블과 비교하는 맞춤형 점수화 함수(마찬가지로 @weave.op를 사용하여 추적됨)를 정의합니다. 마지막으로 데이터셋과 Scorer를 지정하여 weave.Evaluation으로 모든 것을 래핑하고 evaluate()를 호출하여 평가 파이프라인을 비동기적으로 실행합니다.
평가가 종료되면 Weave는 모델, 데이터셋, 예제별 점수를 프로젝트에 로깅하므로 Weights & Biases UI에서 결과를 확인할 수 있습니다.

더 많은 예시 찾기

기본 평가를 실행한 후, 다음 튜토리얼에서 더 고급 워크플로를 살펴볼 수 있습니다:
마지막 수정일 2026년 9월 30일