Skip to main content
Eval Tables를 사용하여 여러 run의 입력, 출력 및 점수를 비교하세요. W&B는 서로 대응하는 예시를 정렬하고 선택한 run의 집계 점수와 점수 차이를 계산합니다.
워크스페이스 수준의 summary 메트릭, 선형 플롯, 고정된 run 또는 기준 run으로 run을 비교하려면 run 고정 및 비교를 참조하세요. Eval Tables는 로깅된 table 내에서 정렬된 예시와 Eval Table별 점수를 비교합니다.
run을 비교하려면:
  1. 프로젝트 Workspace로 이동하세요.
  2. Eval Tables 패널까지 스크롤하세요.
  3. + 버튼을 선택하세요.
  4. 추가할 run을 선택하세요.
W&B는 선택한 run에서 역할과 이름이 같은 열을 그룹화합니다. 예를 들어 두 run이 동일한 input_columns를 사용하면 W&B는 해당 열을 Inputs 섹션에 함께 표시합니다. 마찬가지로 W&B는 공통 output_columns와 score_columns를 Outputs 및 Scores 섹션에 그룹화합니다. 다음 스크린샷은 summer-butterfly-9와 gentle-flower-8 run을 비교하는 Eval Table을 보여줍니다:
Eval Table 뷰

참조 run 설정

여러 run을 비교할 때 W&B는 기본적으로 맨 왼쪽 run을 참조 run으로 지정합니다. 참조 run은 점수 차이를 계산하는 베이스라인입니다. 다른 참조 run을 선택하려면 해당 run에 마우스를 올리고 메뉴를 연 다음 Set as reference를 선택하세요.

집계 점수 보기

W&B는 선택한 각 run의 각 점수 열에 대한 집계 값을 계산합니다. 계산 방식은 점수의 데이터 유형에 따라 달라집니다: 다음 스크린샷은 정답 여부와 신뢰도 점수의 집계 값을 강조하여 보여줍니다:
Eval Table 뷰

점수 차이 비교

각 점수 열에 대해 W&B는 참조 run과 선택된 다른 각 run 간의 차이를 계산합니다. W&B는 각 차이를 다음과 같이 계산합니다:
예를 들어, summer-butterfly-9가 참조 run이고 gentle-flower-8이 비교 run이라고 가정해 보겠습니다. W&B는 신뢰도 차이를 다음과 같이 계산합니다: 차이가 양수이면 비교 run의 값이 참조 run보다 높다는 의미입니다. 차이가 음수이면 값이 더 낮다는 의미입니다. 다음 스크린샷은 점수 차이를 강조하여 보여줍니다:
Eval Table 뷰
마지막 수정일 2026년 9월 30일