첫 번째 평가 실행하기
head-to-head 평가자를 사용해 파인튜닝된 모델을 레퍼런스 출력과 비교해 보세요.
평가 유형
Head to Head
Head to Head
평가 모델이 각 후보 응답을 primary 출력과 비교합니다. 텍스트가 정확히 일치하는지로 판단하기에는 기준이 너무 엄격한 개방형 생성 작업에 사용하세요. 점수 =
(wins + 0.5 × ties) / completed rows이며, 50%는 primary와 동등한 수준임을 의미합니다.Exact Match
Exact Match
정규화된 assistant 출력을 결정론적으로 비교합니다. 의미가 같다면 출력도 동일해야 하는 구조화된 답변이나 이산형 답변에 사용하세요.
Categorization
Categorization
불리언 필드를 조회하여 정밀도, 재현율, F1 및 혼동 행렬을 보고합니다. 읽을 수 없는 후보 출력은 정밀도와 재현율을 모두 떨어뜨리며, 읽을 수 없는 레퍼런스 출력은 건너뜁니다.
참가자 선택
head-to-head 평가에서는 원본 출력, 재레이블링 run, 튜닝된 모델, 공급자 모델(직접 연결)을 참가자로 사용할 수 있습니다. 첫 번째 참가자가 primary 참가자가 됩니다. 해당 데이터셋으로 만든 파인튜닝 모델은 목록 상단 근처에 기본 모델별로 그룹화되어 표시됩니다. 정확 일치(exact-match) 평가와 분류(categorization) 평가에는 별도의 레퍼런스가 필요하며, 모델 또는 공급자 후보를 사용할 수 있습니다.실시간 결과 조회
요청한 모든 행이 확정될 때까지 결과는 잠정적입니다. UI에는 다음 항목이 표시됩니다.- 전체 행 대비 완료된 행 수
- head-to-head 참가자별 승, 무, 패 및 점수
- 실패한 행과 오류 메시지 요약(즉시 표시)
- 데이터셋 워크벤치의 행별 판정 결과
재시도 및 실패
각 케이스는 최대 세 번까지 자동으로 시도됩니다. 이 한도에 도달하면 평가는 더 이상 재시도하지 않으며, 실패한 행이 남은 상태로 완료될 수 있습니다. 평가가 종료된 후 Retry failed cases를 사용하면 실패한 케이스만 포함된 새 배치가 생성됩니다. 이미 완료된 결과는 그대로 유지됩니다.API: 실패한 케이스 재시도 (POST /evals/{evalId}/retry)
API: 실패한 케이스 재시도 (POST /evals/{evalId}/retry)
평가가 종료될 때까지 기다린 다음, 실패한 케이스만 포함된 재시도 배치를 제출하세요. 완료된 결과는 보존됩니다.생성 요청은 Evaluations Quick Start를 참조하세요. 이 오퍼레이션에 대한 자세한 내용은 실패한 평가 케이스 재시도를 참조하세요.