시작하기 전에 검증 행이 포함된 데이터셋을 만들고, 비교하려는 모든 파인튜닝 모델 또는 공급자 모델을 추가하세요.
1
데이터셋의 Evaluate 탭 열기
New evaluation을 선택하고 Head to Head를 고른 다음, 평가 내용을 알 수 있는 이름을 지정하세요.
2
레퍼런스 선택
원본 또는 재레이블링된 데이터셋 출력을 기본 참가자로 선택하세요. 후보 모델은 이 기대 동작을 기준으로 점수가 매겨집니다.
3
후보 모델 추가
먼저 데이터셋의 파인튜닝 모델을 추가한 다음, 비교하려는 기본 모델이나 공급자 모델을 추가하세요. 선택기에서 파인튜닝 모델은 기본 모델별로 묶여 표시됩니다.
4
평가자 설정
성능이 충분한 평가 모델을 선택하고, 이 작업에서 어떤 답변이 더 나은지 정의하는 지침을 작성하세요. 검증 행이 충분하다면 200개로 시작하세요.
5
실행 및 검토
평가를 시작하세요. 행이 완료될 때마다 점수가 업데이트됩니다. 개별 행을 열어 평가자의 설명을 확인하고, 실패 표시기로 공급자 오류나 파싱 오류를 검토하세요.
6
배포 여부 결정
점수 50%는 레퍼런스와 동등한 수준이라는 뜻입니다. 승리는 1, 무승부는 0.5, 패배는 0으로 계산됩니다. 최종 점수와 행별 동작이 기준값을 충족할 때만 승격하세요.
API: 평가 생성 (POST /evals)
API: 평가 생성 (POST /evals)
첫 번째 참가자가 기본 참가자입니다. 후보 모델 레퍼런스를 평가하려는 아티팩트 또는 공급자 모델로 바꾸세요.응답에는 평가 ID가 포함됩니다. 평가가 안정화될 때까지
GET /evals/{evalId}를 폴링하세요. 자세한 내용은 평가 생성을 참조하세요.