Skip to main content
평가를 통해 후보 모델이 프로젝트에서 중요하게 여기는 동작을 그대로 유지하는지 확인할 수 있습니다. 평가는 고정된 검증 행을 사용하며, 항목과 참가자마다 하나의 영구적인 결과를 저장합니다.

첫 번째 평가 실행하기

head-to-head 평가자를 사용해 파인튜닝된 모델을 레퍼런스 출력과 비교해 보세요.

평가 유형

평가 모델이 각 후보 응답을 primary 출력과 비교합니다. 텍스트가 정확히 일치하는지로 판단하기에는 기준이 너무 엄격한 개방형 생성 작업에 사용하세요. 점수 = (wins + 0.5 × ties) / completed rows이며, 50%는 primary와 동등한 수준임을 의미합니다.
정규화된 assistant 출력을 결정론적으로 비교합니다. 의미가 같다면 출력도 동일해야 하는 구조화된 답변이나 이산형 답변에 사용하세요.
불리언 필드를 조회하여 정밀도, 재현율, F1 및 혼동 행렬을 보고합니다. 읽을 수 없는 후보 출력은 정밀도와 재현율을 모두 떨어뜨리며, 읽을 수 없는 레퍼런스 출력은 건너뜁니다.

참가자 선택

head-to-head 평가에서는 원본 출력, 재레이블링 run, 튜닝된 모델, 공급자 모델(직접 연결)을 참가자로 사용할 수 있습니다. 첫 번째 참가자가 primary 참가자가 됩니다. 해당 데이터셋으로 만든 파인튜닝 모델은 목록 상단 근처에 기본 모델별로 그룹화되어 표시됩니다. 정확 일치(exact-match) 평가와 분류(categorization) 평가에는 별도의 레퍼런스가 필요하며, 모델 또는 공급자 후보를 사용할 수 있습니다.

실시간 결과 조회

요청한 모든 행이 확정될 때까지 결과는 잠정적입니다. UI에는 다음 항목이 표시됩니다.
  • 전체 행 대비 완료된 행 수
  • head-to-head 참가자별 승, 무, 패 및 점수
  • 실패한 행과 오류 메시지 요약(즉시 표시)
  • 데이터셋 워크벤치의 행별 판정 결과
참가자를 추가하거나 설정을 변경하면 영향을 받는 작업만 다시 조정됩니다. 변경되지 않은 완료 사례와 재사용할 수 있는 모델 출력은 그대로 유지됩니다.

재시도 및 실패

각 케이스는 최대 세 번까지 자동으로 시도됩니다. 이 한도에 도달하면 평가는 더 이상 재시도하지 않으며, 실패한 행이 남은 상태로 완료될 수 있습니다. 평가가 종료된 후 Retry failed cases를 사용하면 실패한 케이스만 포함된 새 배치가 생성됩니다. 이미 완료된 결과는 그대로 유지됩니다.
공급자 모델과 파인튜닝된 모델을 비교할 때는 동일한 라우팅 매개변수를 사용하세요. 이미 프로젝트 대상으로 지정된 모델에는 일치하는 프로젝트 버전 중 가장 높은 버전의 매개변수 오버라이드가 자동으로 적용됩니다.
평가가 종료될 때까지 기다린 다음, 실패한 케이스만 포함된 재시도 배치를 제출하세요. 완료된 결과는 보존됩니다.
생성 요청은 Evaluations Quick Start를 참조하세요. 이 오퍼레이션에 대한 자세한 내용은 실패한 평가 케이스 재시도를 참조하세요.
마지막 수정일 2026년 9월 30일