Skip to main content
Evaluation Playground를 사용하면 기존 모델에 액세스하고 평가 데이터셋과 LLM 평가자를 사용하여 성능을 비교할 수 있습니다. 코드를 설정하지 않고도 모델을 실험하고 비교할 수 있습니다. 또한 플레이그라운드에서 개발한 모델, Scorer 및 데이터셋을 나중에 개발 및 배포를 위해 저장할 수 있습니다. 예를 들어, Evaluation Playground를 열고 이전에 저장한 두 모델을 추가한 다음 새로 만들거나 이전에 저장한 질문-답변 스타일 평가 데이터셋을 기반으로 성능을 평가할 수 있습니다. 그런 다음 인터페이스에서 새 모델을 추가하고 system 프롬프트를 추가한 후 세 모델 모두에 대해 새 평가를 실행하여 서로 어떻게 수행하는지 확인할 수 있습니다.
Evaluation Playground Interface

플레이그라운드에서 평가 설정

다음 섹션에서는 Evaluation Playground를 열고, 평가의 시작점을 선택하고, 데이터셋, 모델, Scorer를 설정하는 방법을 설명합니다. Evaluation Playground에서 평가를 설정하려면:
  1. Weights & Biases UI를 연 다음 평가를 수행할 프로젝트를 여세요. Traces 페이지가 열립니다.
  2. Traces 페이지에서 왼쪽 메뉴의 Playground 아이콘을 클릭한 다음 Playground 페이지에서 Evaluate 탭을 선택하세요. Evaluate 페이지에서는 다음 중 하나를 선택할 수 있습니다:
    • Load a demo example: MoonshotAI Kimi K2 모델을 예상 출력에 대해 평가하고 LLM 평가자를 사용하여 정확성을 확인하는 사전 정의된 설정을 불러옵니다. 이 설정을 사용하여 인터페이스를 실험해 볼 수 있습니다.
    • Start from scratch: 직접 구축할 수 있도록 빈 설정을 불러옵니다.
  3. Start from scratch를 선택했다면 Title 및 Description 필드에 평가를 잘 나타내는 제목과 설명을 추가하세요.
다음 섹션의 지침에 따라 데이터셋, 모델, Scorer를 설정하세요.

데이터셋 추가

Datasets는 예시 사용자 입력과 모델의 예상 응답을 정리한 컬렉션입니다. 평가 중에 플레이그라운드는 각 테스트 입력을 모델에 제공하고 출력을 수집한 다음, 정확성과 같은 선택한 메트릭에 따라 출력을 점수화합니다. UI에서 데이터셋을 생성하거나, 프로젝트에 이미 저장된 기존 데이터셋을 추가하거나, 새 데이터셋을 업로드할 수 있습니다. 다음 형식으로 데이터셋을 업로드할 수 있습니다:
  • .csv
  • .tsv
  • .json
  • .jsonl
데이터셋을 Weave에 포맷팅하고 저장하는 방법에 대한 자세한 내용은 Datasets 문서를 참조하세요. Dataset 섹션에서 데이터셋을 추가하려면:
  1. 드롭다운 메뉴를 클릭한 다음 다음 중 하나를 선택하세요:
    • Start from scratch를 선택하여 UI에서 새 데이터셋을 생성합니다.
    • Upload a file을 선택하여 로컬 머신에서 데이터셋을 업로드합니다.
    • 프로젝트에 이미 저장된 기존 데이터셋을 선택합니다.
  2. Optional: Save를 클릭하여 나중에 사용하기 위해 프로젝트에 데이터셋을 저장합니다.
옵션을 선택한 후, 데이터셋이 UI의 오른쪽 패널에 표시되며, 클릭하여 각 필드를 필요에 따라 편집할 수 있습니다. Add row를 클릭하여 데이터셋에 새 행을 추가할 수도 있습니다.
새 데이터셋만 UI를 사용하여 편집할 수 있습니다.또한 데이터셋의 열 이름을 user_input과 expected_output으로 지정하는 것이 중요합니다. 이렇게 하면 Scorer가 데이터에 액세스할 수 있습니다.

모델 추가

Weave에서 모델은 AI 모델(예: GPT)과, 평가 중 해당 모델의 동작 방식을 정의하는 환경(여기서는 system 프롬프트)을 결합한 것입니다. 프로젝트에 있는 기존 모델을 선택하거나 새 모델을 만들어 평가할 수 있으며, 여러 모델을 한 번에 추가하면 동일한 데이터셋과 Scorer로 동시에 평가할 수 있습니다. 플레이그라운드 기능으로 만든 모델만 사용할 수 있습니다. Evaluation Playground의 Models 섹션에서 모델을 추가하려면 다음 단계를 따르세요.
  1. Add Model을 클릭한 다음 드롭다운 메뉴에서 New Model 또는 기존 모델을 선택하세요.
  2. New Model을 선택했다면 다음 필드를 설정하세요.
    • Name: 새 모델을 잘 설명하는 이름을 입력하세요.
    • LLM Model: 새 모델을 구축할 기반 파운데이션 모델(예: OpenAI의 GPT-4)을 선택하세요. 이미 액세스를 설정한 파운데이션 모델 목록에서 선택하거나, Add AI provider를 선택한 후 모델을 선택하여 파운데이션 모델에 대한 액세스를 추가할 수 있습니다. 공급자를 추가하면 해당 공급자의 액세스 자격 증명을 입력하라는 메시지가 표시됩니다. Weave에서 모델에 액세스하는 데 필요한 API 키, 엔드포인트 및 기타 설정 정보를 확인하는 방법은 해당 공급자의 문서를 참조하세요.
    • System Prompt: 모델이 어떻게 동작해야 하는지 지침을 입력하세요(예: You are a helpful assistant specializing in Python programming.). 데이터셋의 user_input은 후속 메시지로 전송되므로 system 프롬프트에 포함하지 않아도 됩니다.
    기존 모델을 선택하면 모델 이름 옆에 해당 모델의 버전을 선택할 수 있는 필드가 새로 표시되며, 그 외에 추가로 설정할 필드는 없습니다. 평가 전후에 기존 모델을 수정하려면 Prompt Playground를 사용하세요.
  3. 선택 사항: 나중에 다시 사용하려면 Save를 클릭하여 모델을 프로젝트에 저장하세요.
  4. 선택 사항: 여러 모델을 동시에 평가하려면 Add Model을 다시 클릭하고 필요한 만큼 다른 모델을 추가하세요.

Scorer 추가

Scorer는 LLM 평가자를 사용하여 AI 모델 출력의 품질을 측정하고 평가합니다. 프로젝트에서 기존 Scorer를 선택하거나 새로 생성하여 모델을 평가할 수 있습니다. Evaluation Playground에서 Scorer를 추가하려면:
  1. Add Scorer를 클릭한 다음 다음 필드를 설정하세요:
    • Name: Scorer에 설명이 담긴 이름을 지정하세요.
    • Type: 점수를 불리언 또는 숫자 중 어떤 형식으로 출력할지 선택하세요. 불리언 Scorer는 모델 출력이 설정한 평가 매개변수를 충족했는지에 따라 이진 값인 True 또는 False를 반환합니다. 숫자 Scorer는 0과 1 사이의 점수를 출력하여 모델 출력이 평가 매개변수를 얼마나 잘 충족했는지 전반적으로 평가합니다.
    • LLM-as-a-judge-model: Scorer의 평가자로 사용할 파운데이션 모델을 선택하세요. Models 섹션의 LLM Model 필드와 마찬가지로, 이미 액세스를 설정한 파운데이션 모델 중에서 선택하거나 파운데이션 모델에 대한 액세스를 새로 설정할 수 있습니다.
    • Scoring Prompt: 출력 점수화를 위한 LLM 평가자 매개변수를 제공하세요. 예를 들어, 환각을 확인하려면 다음과 유사한 점수화 프롬프트를 입력하세요:
      데이터셋과 응답의 필드를 {user_input}, {expected_output}, {output}과 같은 점수화 프롬프트의 변수로 사용할 수 있습니다. 사용 가능한 변수 목록을 보려면 UI에서 Insert variable을 클릭하세요.
  2. 선택: Save를 클릭하여 나중에 사용할 수 있도록 Scorer를 프로젝트에 저장하세요.

평가 실행

데이터셋, 모델, Scorer를 설정했으면 평가를 실행하고 결과를 생성할 준비가 되었습니다.
  • Evaluation Playground에서 평가를 실행하려면 Run eval을 클릭하세요.
Weave는 추가한 각 모델에 대해 개별 평가를 실행하고 데이터셋을 사용한 각 요청의 메트릭을 수집합니다. Weave는 나중에 검토할 수 있도록 각 평가를 Evals 섹션에 저장합니다.

Review 평가 results

평가가 완료되면 각 모델이 데이터셋과 Scorer에 대해 어떻게 수행했는지 비교하기 위해 결과를 검토할 수 있습니다. 평가가 완료되면 플레이그라운드는 모델에 대한 각 request에서 수집된 메트릭을 표시하는 report를 엽니다.
Evals hero
Dataset results 탭은 input, 예상 출력, 모델의 실제 출력, latency, 토큰 사용량 및 점수화 결과를 표시합니다. Row column의 ID를 클릭하여 특정 request 세트에 대한 메트릭의 상세 뷰를 열 수 있습니다. 또한 탭 바로 아래의 display format 버튼을 사용하여 report의 셀 표시 형식을 변경할 수 있습니다. Summary 탭은 각 모델이 데이터를 시각적으로 표현하여 어떻게 수행했는지에 대한 개요를 제공합니다. 평가를 열고 비교하는 방법에 대한 자세한 내용은 평가를 참조하세요.
마지막 수정일 2026년 9월 30일