워크스페이스 수준의 summary 메트릭, 선형 플롯, 고정된 run 또는 기준 run으로 run을 비교하려면 run 고정 및 비교를 참조하세요. Eval Tables는 로깅된 table 내에서 정렬된 예시와 Eval Table별 점수를 비교합니다.
- 프로젝트 Workspace로 이동하세요.
- Eval Tables 패널까지 스크롤하세요.
- + 버튼을 선택하세요.
- 추가할 run을 선택하세요.
input_columns를 사용하면 W&B는 해당 열을 Inputs 섹션에 함께 표시합니다. 마찬가지로 W&B는 공통 output_columns와 score_columns를 Outputs 및 Scores 섹션에 그룹화합니다.
다음 스크린샷은 summer-butterfly-9와 gentle-flower-8 run을 비교하는 Eval Table을 보여줍니다:

참조 run 설정
여러 run을 비교할 때 W&B는 기본적으로 맨 왼쪽 run을 참조 run으로 지정합니다. 참조 run은 점수 차이를 계산하는 베이스라인입니다. 다른 참조 run을 선택하려면 해당 run에 마우스를 올리고 메뉴를 연 다음 Set as reference를 선택하세요.집계 점수 보기
W&B는 선택한 각 run의 각 점수 열에 대한 집계 값을 계산합니다. 계산 방식은 점수의 데이터 유형에 따라 달라집니다:
다음 스크린샷은 정답 여부와 신뢰도 점수의 집계 값을 강조하여 보여줍니다:

점수 차이 비교
각 점수 열에 대해 W&B는 참조 run과 선택된 다른 각 run 간의 차이를 계산합니다. W&B는 각 차이를 다음과 같이 계산합니다:summer-butterfly-9가 참조 run이고 gentle-flower-8이 비교 run이라고 가정해 보겠습니다. W&B는 신뢰도 차이를 다음과 같이 계산합니다:
차이가 양수이면 비교 run의 값이 참조 run보다 높다는 의미입니다. 차이가 음수이면 값이 더 낮다는 의미입니다.
다음 스크린샷은 점수 차이를 강조하여 보여줍니다:
