이것은 대화형 노트북입니다. 로컬에서 실행하거나 아래 링크를 사용할 수 있습니다:
리더보드 퀵스타트
이 퀵스타트에서는 W&B Weave 리더보드를 사용하여 여러 데이터셋과 점수화 함수에 걸쳐 모델 성능을 비교하는 방법을 안내합니다. 이 가이드를 마치면 공통 평가 집합을 기준으로 여러 모델의 순위를 매기는 리더보드를 게시하게 됩니다. 그런 다음 각 메트릭에서 가장 뛰어난 성능을 보이는 모델을 파악할 수 있습니다. 이 가이드는 Weave 평가 실행에 익숙하고 결과를 나란히 비교하려는 개발자를 대상으로 합니다. 구체적으로 다음 작업을 수행합니다:- 가상의 우편번호 데이터로 데이터셋을 생성합니다.
- 점수화 함수를 작성하고 기준선 모델을 평가합니다.
- 이러한 기법을 사용하여 여러 모델과 평가 구성의 조합을 평가합니다.
- Weights & Biases UI에서 리더보드를 검토합니다.
1단계: 가짜 우편번호 데이터의 데이터셋 생성
먼저generate_dataset_rows 함수를 만들어 가짜 우편번호 데이터의 목록을 생성하세요. 이 합성 데이터셋은 리더보드에 일관된 입력 세트와 각 모델을 평가하기 위한 기대값을 제공합니다.
2단계: 점수화 함수 작성
다음으로 점수화 함수 세 개를 작성하세요. 각 Scorer는 모델 출력의 서로 다른 측면을 평가하므로 리더보드에서 품질의 각 차원별로 모델의 순위를 매길 수 있습니다:check_concrete_fields: 모델 출력이 예상 도시 및 주와 일치하는지 확인합니다.check_value_fields: 모델 출력이 예상 인구 및 중위 소득의 10% 이내인지 확인합니다.check_subjective_fields: LLM을 사용하여 모델 출력이 예상 “known for” 필드와 일치하는지 확인합니다.
3단계: 평가 생성
다음으로, 가상 데이터와 점수화 함수를 사용하여 평가를 정의하세요.Evaluation 객체는 데이터셋과 Scorer를 연결하므로, 동일한 벤치마크로 모든 모델을 평가할 수 있습니다.