Skip to main content

Weave로 모델 평가하기

W&B Weave는 LLM과 GenAI 애플리케이션 평가를 위해 특별히 설계된 툴킷입니다. Scorer, 평가자, 상세 트레이싱 등 포괄적인 평가 기능을 제공하므로 모델 성능을 파악하고 개선할 수 있습니다. Weave는 W&B Models와 통합되므로 모델 레지스트리에 저장된 모델을 평가할 수 있습니다.
모델 성능 메트릭과 트레이스를 보여주는 Weave 평가 대시보드

모델 평가를 위한 주요 기능

  • Scorer 및 평가자: 정확도, 관련성, 일관성 등을 위한 사전 구축 및 맞춤형 평가 메트릭
  • 평가 데이터셋: 체계적인 평가를 위한 그라운드 트루스가 포함된 구조화된 테스트 세트
  • 모델 버전 관리: 모델의 다양한 버전을 추적하고 비교
  • 상세 트레이싱: 완전한 입력/출력 트레이스로 모델 동작 디버그
  • 비용 추적: 평가 전반에 걸쳐 API 비용 및 토큰 사용량 모니터링

Getting Started: 레지스트리에서 모델 평가하기

W&B Models 레지스트리에서 모델을 다운로드한 후 Weave로 평가하세요.

Weave 평가를 W&B Models와 통합하기

Models and Weave Integration Demo에서는 다음을 위한 완전한 워크플로를 보여줍니다:
  1. 레지스트리에서 모델 로드: W&B Models 레지스트리에 저장된 fine-tuned 모델 다운로드
  2. 평가 파이프라인 생성: 맞춤형 Scorer로 종합적인 평가 구축
  3. W&B에 결과 로깅: 평가 메트릭을 모델 run에 연결
  4. 평가된 모델 버전 관리: 개선된 모델을 레지스트리에 다시 저장
Weave와 W&B Models 모두에 평가 결과 로깅:

Weave 고급 기능

맞춤형 Scorer 및 평가자

사용 사례에 맞춘 정교한 평가 메트릭을 만드세요:

배치 평가

여러 모델 버전 또는 설정을 평가하세요:

다음 단계

table로 모델 평가

W&B Tables를 사용하여:
  • 모델 예측 비교: 동일한 테스트 세트에서 서로 다른 모델의 성능을 나란히 비교하여 확인
  • 예측 변경 추적: 트레이닝 에포크 또는 모델 버전에 걸쳐 예측이 어떻게 변화하는지 모니터링
  • 오류 분석: Filter와 쿼리를 사용하여 일반적으로 잘못 분류된 예시와 오류 패턴 찾기
  • 리치 미디어 시각화: 예측 및 메트릭과 함께 이미지, 오디오, 텍스트 및 기타 미디어 유형 표시
그라운드 트루스 레이블과 함께 모델 출력을 보여주는 예측 table 예시

기본 예시: 평가 결과 로깅하기

고급 table 워크플로

여러 모델 비교

여러 모델의 eval table을 동일한 키에 로깅하여 직접 비교하세요:
트레이닝 에포크 전반에 걸친 모델 예측의 나란한 비교

시간에 따른 예측 추적

트레이닝 에포크별로 table을 로깅하여 개선 추이를 시각화하세요:

W&B UI에서의 대화형 분석

데이터를 로깅한 후 다음을 수행할 수 있습니다:
  1. 결과 필터링: 열 헤더를 클릭하여 예측 정확도, 신뢰도 임계값 또는 특정 클래스로 필터링하세요
  2. table 비교: 여러 table 버전을 선택하여 나란히 비교를 확인하세요
  3. 데이터 쿼리: 쿼리 바를 사용하여 특정 패턴을 찾으세요 (예: "correct" = false AND "confidence" > 0.8)
  4. 그룹화 및 집계: 예측된 클래스로 그룹화하여 클래스별 정확도 메트릭을 확인하세요
W&B Tables에서 평가 결과의 대화형 필터링 및 쿼리

예시: 정보를 보강한 table을 활용한 오류 분석

Last modified on September 30, 2026