> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Evaluation Playground를 사용하여 모델 성능 비교

> Weave의 Evaluation Playground에서 맞춤형 데이터셋과 LLM 평가자를 사용하여 코드 없이 모델 성능을 비교하고 평가하세요.

Evaluation Playground를 사용하면 기존 모델에 액세스하고 평가 데이터셋과 LLM 평가자를 사용하여 성능을 비교할 수 있습니다. 코드를 설정하지 않고도 모델을 실험하고 비교할 수 있습니다. 또한 플레이그라운드에서 개발한 모델, Scorer 및 데이터셋을 나중에 개발 및 배포를 위해 저장할 수 있습니다.

예를 들어, Evaluation Playground를 열고 이전에 저장한 두 모델을 추가한 다음 새로 만들거나 이전에 저장한 질문-답변 스타일 평가 데이터셋을 기반으로 성능을 평가할 수 있습니다. 그런 다음 인터페이스에서 새 모델을 추가하고 system 프롬프트를 추가한 후 세 모델 모두에 대해 새 평가를 실행하여 서로 어떻게 수행하는지 확인할 수 있습니다.

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/weave/_media/eval-playground-ui.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=fc0c528d2ef2ad18a685a735312b3a7c" alt="Evaluation Playground Interface" width="1448" height="943" data-path="products/wandb/weave/_media/eval-playground-ui.png" />
</Frame>

<h2 id="set-up-an-evaluation-in-the-playground">
  플레이그라운드에서 평가 설정
</h2>

다음 섹션에서는 Evaluation Playground를 열고, 평가의 시작점을 선택하고, 데이터셋, 모델, Scorer를 설정하는 방법을 설명합니다.

Evaluation Playground에서 평가를 설정하려면:

1. [Weights & Biases UI](https://forge.coreweave.com/wandb/wandb/quickstart_playground/weave/playground)를 연 다음 평가를 수행할 프로젝트를 여세요. Traces 페이지가 열립니다.
2. Traces 페이지에서 왼쪽 메뉴의 **Playground** 아이콘을 클릭한 다음 Playground 페이지에서 **Evaluate** 탭을 선택하세요. Evaluate 페이지에서는 다음 중 하나를 선택할 수 있습니다:
   * **Load a demo example**: MoonshotAI Kimi K2 모델을 예상 출력에 대해 평가하고 LLM 평가자를 사용하여 정확성을 확인하는 사전 정의된 설정을 불러옵니다. 이 설정을 사용하여 인터페이스를 실험해 볼 수 있습니다.
   * **Start from scratch**: 직접 구축할 수 있도록 빈 설정을 불러옵니다.
3. **Start from scratch**를 선택했다면 **Title** 및 **Description** 필드에 평가를 잘 나타내는 제목과 설명을 추가하세요.

다음 섹션의 지침에 따라 데이터셋, 모델, Scorer를 설정하세요.

<h3 id="add-a-dataset">
  데이터셋 추가
</h3>

[Datasets](/ko/products/wandb/weave/guides/core-types/datasets)는 예시 사용자 입력과 모델의 예상 응답을 정리한 컬렉션입니다. 평가 중에 플레이그라운드는 각 테스트 입력을 모델에 제공하고 출력을 수집한 다음, 정확성과 같은 선택한 메트릭에 따라 출력을 점수화합니다. UI에서 데이터셋을 생성하거나, 프로젝트에 이미 저장된 기존 데이터셋을 추가하거나, 새 데이터셋을 업로드할 수 있습니다.

다음 형식으로 데이터셋을 업로드할 수 있습니다:

* `.csv`
* `.tsv`
* `.json`
* `.jsonl`

데이터셋을 Weave에 포맷팅하고 저장하는 방법에 대한 자세한 내용은 Datasets 문서를 참조하세요.

**Dataset** 섹션에서 데이터셋을 추가하려면:

1. 드롭다운 메뉴를 클릭한 다음 다음 중 하나를 선택하세요:
   * **Start from scratch**를 선택하여 UI에서 새 데이터셋을 생성합니다.
   * **Upload a file**을 선택하여 로컬 머신에서 데이터셋을 업로드합니다.
   * 프로젝트에 이미 저장된 기존 데이터셋을 선택합니다.
2. Optional: **Save**를 클릭하여 나중에 사용하기 위해 프로젝트에 데이터셋을 저장합니다.

옵션을 선택한 후, 데이터셋이 UI의 오른쪽 패널에 표시되며, 클릭하여 각 필드를 필요에 따라 편집할 수 있습니다. **Add row**를 클릭하여 데이터셋에 새 행을 추가할 수도 있습니다.

<Note>
  새 데이터셋만 UI를 사용하여 편집할 수 있습니다.

  또한 데이터셋의 열 이름을 `user_input`과 `expected_output`으로 지정하는 것이 중요합니다. 이렇게 하면 Scorer가 데이터에 액세스할 수 있습니다.
</Note>

<h3 id="add-a-model">
  모델 추가
</h3>

Weave에서 [모델](/ko/products/wandb/weave/guides/core-types/models)은 AI 모델(예: GPT)과, 평가 중 해당 모델의 동작 방식을 정의하는 환경(여기서는 system 프롬프트)을 결합한 것입니다. 프로젝트에 있는 기존 모델을 선택하거나 새 모델을 만들어 평가할 수 있으며, 여러 모델을 한 번에 추가하면 동일한 데이터셋과 Scorer로 동시에 평가할 수 있습니다. **플레이그라운드 기능으로 만든 모델만 사용할 수 있습니다.**

Evaluation Playground의 **Models** 섹션에서 모델을 추가하려면 다음 단계를 따르세요.

1. **Add Model**을 클릭한 다음 드롭다운 메뉴에서 **New Model** 또는 기존 모델을 선택하세요.

2. **New Model**을 선택했다면 다음 필드를 설정하세요.

   * **Name**: 새 모델을 잘 설명하는 이름을 입력하세요.
   * **LLM Model**: 새 모델을 구축할 기반 파운데이션 모델(예: OpenAI의 GPT-4)을 선택하세요. 이미 액세스를 설정한 파운데이션 모델 목록에서 선택하거나, **Add AI provider**를 선택한 후 모델을 선택하여 파운데이션 모델에 대한 액세스를 추가할 수 있습니다. 공급자를 추가하면 해당 공급자의 액세스 자격 증명을 입력하라는 메시지가 표시됩니다. Weave에서 모델에 액세스하는 데 필요한 API 키, 엔드포인트 및 기타 설정 정보를 확인하는 방법은 해당 공급자의 문서를 참조하세요.
   * **System Prompt**: 모델이 어떻게 동작해야 하는지 지침을 입력하세요(예: `You are a helpful assistant specializing in Python programming.`). 데이터셋의 `user_input`은 후속 메시지로 전송되므로 system 프롬프트에 포함하지 않아도 됩니다.

   기존 모델을 선택하면 모델 이름 옆에 해당 모델의 버전을 선택할 수 있는 필드가 새로 표시되며, 그 외에 추가로 설정할 필드는 없습니다. 평가 전후에 기존 모델을 수정하려면 [Prompt Playground](/ko/products/wandb/weave/guides/tools/playground)를 사용하세요.

3. 선택 사항: 나중에 다시 사용하려면 **Save**를 클릭하여 모델을 프로젝트에 저장하세요.

4. 선택 사항: 여러 모델을 동시에 평가하려면 **Add Model**을 다시 클릭하고 필요한 만큼 다른 모델을 추가하세요.

<h3 id="add-scorers">
  Scorer 추가
</h3>

[Scorer](/ko/products/wandb/weave/guides/evaluation/scorers)는 LLM 평가자를 사용하여 AI 모델 출력의 품질을 측정하고 평가합니다. 프로젝트에서 기존 Scorer를 선택하거나 새로 생성하여 모델을 평가할 수 있습니다.

Evaluation Playground에서 Scorer를 추가하려면:

1. **Add Scorer**를 클릭한 다음 다음 필드를 설정하세요:
   * **Name**: Scorer에 설명이 담긴 이름을 지정하세요.
   * **Type**: 점수를 불리언 또는 숫자 중 어떤 형식으로 출력할지 선택하세요. 불리언 Scorer는 모델 출력이 설정한 평가 매개변수를 충족했는지에 따라 이진 값인 `True` 또는 `False`를 반환합니다. 숫자 Scorer는 `0`과 `1` 사이의 점수를 출력하여 모델 출력이 평가 매개변수를 얼마나 잘 충족했는지 전반적으로 평가합니다.
   * **LLM-as-a-judge-model**: Scorer의 평가자로 사용할 파운데이션 모델을 선택하세요. **Models** 섹션의 LLM Model 필드와 마찬가지로, 이미 액세스를 설정한 파운데이션 모델 중에서 선택하거나 파운데이션 모델에 대한 액세스를 새로 설정할 수 있습니다.
   * **Scoring Prompt**: 출력 점수화를 위한 LLM 평가자 매개변수를 제공하세요. 예를 들어, 환각을 확인하려면 다음과 유사한 점수화 프롬프트를 입력하세요:

     ```text theme={"system"}
     Given the following context and answer, determine if the answer contains any information not supported by the context.

     User input: {user_input}
     Expected output: {expected_output}
     Model Output: {output}

     Is the model output correct?
     ```

     데이터셋과 응답의 필드를 `{user_input}`, `{expected_output}`, `{output}`과 같은 점수화 프롬프트의 변수로 사용할 수 있습니다. 사용 가능한 변수 목록을 보려면 UI에서 **Insert variable**을 클릭하세요.

2. 선택: **Save**를 클릭하여 나중에 사용할 수 있도록 Scorer를 프로젝트에 저장하세요.

<h2 id="run-the-evaluation">
  평가 실행
</h2>

데이터셋, 모델, Scorer를 설정했으면 평가를 실행하고 결과를 생성할 준비가 되었습니다.

* Evaluation Playground에서 평가를 실행하려면 **Run eval**을 클릭하세요.

Weave는 추가한 각 모델에 대해 개별 평가를 실행하고 데이터셋을 사용한 각 요청의 메트릭을 수집합니다. Weave는 나중에 검토할 수 있도록 각 평가를 **Evals** 섹션에 저장합니다.

<h2 id="review-evaluation-results">
  Review 평가 results
</h2>

평가가 완료되면 각 모델이 데이터셋과 Scorer에 대해 어떻게 수행했는지 비교하기 위해 결과를 검토할 수 있습니다.

평가가 완료되면 플레이그라운드는 모델에 대한 각 request에서 수집된 메트릭을 표시하는 report를 엽니다.

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/weave/_media/weave-evals-hero.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=dce9fd4db3f8c75c49ff394d9eeccc3e" alt="Evals hero" width="3975" height="2160" data-path="products/wandb/weave/_media/weave-evals-hero.png" />
</Frame>

**Dataset results** 탭은 input, 예상 출력, 모델의 실제 출력, latency, 토큰 사용량 및 점수화 결과를 표시합니다. **Row** column의 ID를 클릭하여 특정 request 세트에 대한 메트릭의 상세 뷰를 열 수 있습니다. 또한 탭 바로 아래의 display format 버튼을 사용하여 report의 셀 표시 형식을 변경할 수 있습니다.

**Summary** 탭은 각 모델이 데이터를 시각적으로 표현하여 어떻게 수행했는지에 대한 개요를 제공합니다.

평가를 열고 비교하는 방법에 대한 자세한 내용은 [평가](/ko/products/wandb/weave/guides/core-types/evaluations)를 참조하세요.


## Related topics

- [Serverless Inference](/ko/products/wandb/weave/guides/integrations/inference.md)
