맞춤형 모니터는 프로덕션 트래픽을 모니터링하던 이전 방식입니다. 새로 구현하는 경우에는 Weave for Agents의 Signals를 사용하세요. 자세한 내용은 에이전트 시그널 보기를 참조하세요.
시그널과 맞춤형 모니터
프로덕션 트레이스용으로 미리 구성된 자동 Scorer인 시그널로 프로덕션 모니터링을 빠르게 시작한 다음, 애플리케이션에 특화된 평가 기준이 필요하면 맞춤형 모니터를 추가하세요.Weave에서 모니터 만들기
Weave에서 맞춤형 모니터를 만들려면 다음 단계를 따르세요.- Weights & Biases UI를 연 다음 Weights & Biases 프로젝트를 여세요.
- Weave 사이드바에서 Monitors를 선택한 다음 + New Monitor 버튼을 선택하세요. Create new monitor 모달 대화 상자가 열립니다.
-
Create new monitor 메뉴에서 다음 필드를 설정하세요.
- Name: 문자 또는 숫자로 시작해야 하며 문자, 숫자, 하이픈, 밑줄을 사용할 수 있습니다.
- Description (선택): 모니터의 용도를 설명합니다.
- Active monitor 토글: 모니터를 켜거나 끕니다.
- Calls to monitor:
- Operations: 모니터링할
@weave.op를 하나 이상 선택합니다. 사용 가능한 Op 목록에 Op가 표시되려면 먼저 해당 Op를 사용하는 트레이스를 하나 이상 로깅해야 합니다. - Filter (선택): 점수화 대상이 되는 Call의 범위를 좁힙니다(예:
max_tokens또는top_p기준). - 샘플링 비율: 점수화할 Call의 비율입니다(0%~100%).
- Operations: 모니터링할
- LLM-as-a-judge configuration:
- Scorer name: 문자 또는 숫자로 시작해야 하며 문자, 숫자, 하이픈, 밑줄을 사용할 수 있습니다.
- Score Audio: 사용 가능한 LLM 모델 중 오디오 지원 모델만 표시되도록 필터링하고 Media Scoring JSON Paths 필드를 엽니다.
- Score Images: 사용 가능한 LLM 모델 중 이미지 지원 모델만 표시되도록 필터링하고 Media Scoring JSON Paths 필드를 엽니다.
- Judge model: Op를 점수화할 모델을 선택합니다. 메뉴에는 CoreWeave Forge 계정에 설정한 상용 LLM 모델과 Serverless Inference 모델이 표시됩니다. 오디오 지원 모델은 이름 옆에 Audio Input 레이블이 붙습니다. 선택한 모델에 대해 다음 항목을 설정하세요.
- Configuration name: 이 모델 설정의 이름입니다.
- System prompt: 평가 모델의 역할과 페르소나를 정의합니다. 예: “You are an impartial AI judge.”
- Response format: 평가자가 응답을 출력하는 형식입니다(예:
json_object또는 일반text). - Scoring prompt: Op를 점수화하는 데 사용할 평가 작업입니다. 점수화 프롬프트에서 Op의 프롬프트 변수를 참조할 수 있습니다. 예: “Evaluate whether
{output}is accurate based on{ground_truth}.”
- Media Scoring JSON Paths: 트레이스 데이터에서 미디어를 추출할 JSONPath 표현식(RFC 9535)을 지정합니다. 경로를 지정하지 않으면 user 메시지에 포함된 점수화 가능한 모든 미디어가 대상이 됩니다. 이 필드는 Score Audio 또는 Score Images를 활성화하면 표시됩니다.
- 모니터 필드를 모두 설정했으면 Create monitor를 선택하세요. 모니터가 Weights & Biases 프로젝트에 추가됩니다. 코드에서 트레이스가 생성되기 시작하면 Traces 탭에서 모니터 이름을 선택하고 표시되는 패널에서 점수를 확인할 수 있습니다.
feedback 필드에 자동으로 저장합니다.
예시: 진실성 모니터 만들기
다음은 생성된 문장의 진실성을 평가하는 모니터를 만드는 과정을 처음부터 끝까지 보여 주는 예시입니다. 이 과정을 마치면 Weave 프로젝트의 샘플 op를 점수화하는 활성 모니터가 만들어지고, 점수화된 트레이스를 Weights & Biases UI에서 확인할 수 있습니다.- 문장을 생성하는 함수를 정의합니다. 이 함수는 사실인 문장과 사실이 아닌 문장을 섞어서 생성합니다.
- Python
- TypeScript
- 함수를 한 번 이상 실행하여 프로젝트에 트레이스를 로깅합니다. 그러면 Weights & Biases UI에서 해당 op를 모니터링 대상으로 선택할 수 있습니다.
- Weights & Biases UI에서 프로젝트를 열고 사이드바에서 Monitors를 선택한 다음 New Monitor를 선택합니다.
-
Create new monitor 메뉴에서 각 필드를 다음과 같이 설정합니다.
- Name:
truthfulness-monitor - Description:
Evaluates the truthfulness of generated statements. - Active monitor: on으로 전환합니다.
- Operations:
generate_statement를 선택합니다. - 샘플링 비율: 모든 call을 점수화하려면
100%로 설정합니다. - Scorer name:
truthfulness-scorer - Judge model:
o3-mini-2025-01-31 - System prompt:
You are an impartial AI judge. Your task is to evaluate the truthfulness of statements. - Response format:
json_object - Scoring prompt:
- Name:
- Create monitor를 선택합니다. 모니터가 Weave 프로젝트에 추가됩니다.
- 스크립트에서 진실성이 서로 다른 여러 문장으로 함수를 호출하여 점수화 함수를 테스트합니다.
- Python
- TypeScript
- 여러 문장으로 스크립트를 실행한 후 Weights & Biases UI를 열고 Traces 탭으로 이동합니다. LLMAsAJudgeScorer.score 트레이스 중 하나를 선택하면 결과를 확인할 수 있습니다.
이제 generate_statement의 각 호출을 점수화하고 그 결과를 원본 트레이스와 함께 저장하는 진실성 모니터가 준비되었습니다. 저장된 결과는 Weights & Biases UI에서 바로 분석하고 비교할 수 있습니다.