Skip to main content
정확한 텍스트 일치로 판단하기에는 기준이 지나치게 엄격한 개방형 작업이라면 head-to-head 평가로 시작하는 것이 가장 좋습니다.
시작하기 전에 검증 행이 포함된 데이터셋을 만들고, 비교하려는 모든 파인튜닝 모델 또는 공급자 모델을 추가하세요.
1

데이터셋의 Evaluate 탭 열기

New evaluation을 선택하고 Head to Head를 고른 다음, 평가 내용을 알 수 있는 이름을 지정하세요.
2

레퍼런스 선택

원본 또는 재레이블링된 데이터셋 출력을 기본 참가자로 선택하세요. 후보 모델은 이 기대 동작을 기준으로 점수가 매겨집니다.
3

후보 모델 추가

먼저 데이터셋의 파인튜닝 모델을 추가한 다음, 비교하려는 기본 모델이나 공급자 모델을 추가하세요. 선택기에서 파인튜닝 모델은 기본 모델별로 묶여 표시됩니다.
4

평가자 설정

성능이 충분한 평가 모델을 선택하고, 이 작업에서 어떤 답변이 더 나은지 정의하는 지침을 작성하세요. 검증 행이 충분하다면 200개로 시작하세요.
5

실행 및 검토

평가를 시작하세요. 행이 완료될 때마다 점수가 업데이트됩니다. 개별 행을 열어 평가자의 설명을 확인하고, 실패 표시기로 공급자 오류나 파싱 오류를 검토하세요.
6

배포 여부 결정

점수 50%는 레퍼런스와 동등한 수준이라는 뜻입니다. 승리는 1, 무승부는 0.5, 패배는 0으로 계산됩니다. 최종 점수와 행별 동작이 기준값을 충족할 때만 승격하세요.
실패한 케이스는 최대 3회까지 자동으로 재시도됩니다. run이 안정화된 후 Retry failed cases를 사용하면 실패한 케이스만 다시 큐에 넣고 완료된 결과는 그대로 유지됩니다.
첫 번째 참가자가 기본 참가자입니다. 후보 모델 레퍼런스를 평가하려는 아티팩트 또는 공급자 모델로 바꾸세요.
응답에는 평가 ID가 포함됩니다. 평가가 안정화될 때까지 GET /evals/{evalId}를 폴링하세요. 자세한 내용은 평가 생성을 참조하세요.
마지막 수정일 2026년 9월 29일