핵심 기능
Weave는 다음과 같은 핵심 기능을 제공합니다.- 에이전트 세션과 멀티턴 대화는 물론, 애플리케이션 코드의 개별 함수 호출과 출력까지 들여다볼 수 있는 가시성을 제공합니다.
- 엄선된 테스트 케이스를 기준으로 성능을 측정하는 체계적인 평가를 지원합니다.
- 프롬프트, 모델, 데이터의 버전을 추적하여 무엇이 변경되었는지 파악할 수 있습니다.
- 다양한 프롬프트와 모델을 비교하며 실험할 수 있습니다.
- 사람의 판단과 어노테이션을 캡처하는 피드백 수집 기능을 제공합니다.
- 가드레일과 Scorer를 사용해 프로덕션 환경에서 LLM의 안전성과 품질을 모니터링할 수 있습니다.
워크플로 선택
Weave는 다음 두 가지 워크플로를 통해 이 기능을 제공합니다.- 자동 에이전트 트레이싱
- 애플리케이션의 임의의 LLM Call과 함수를 계측하여 입력, 출력, 코드를 트레이스하기
에이전트 트레이싱하기
Weave’s agent tracing workflows are also available in CoreWeave Agent Lens, the successor to Weights & Biases Weave. Both services already receive your agent tracing data, so there is nothing to migrate. See What is Agent Lens for more information.
invoke_agent, execute_tool 등 GenAI 에이전트 규칙을 따르는 span은 Agents 뷰에서 대화, 턴, 도구 Call로 렌더링됩니다. 직접 만든 에이전트에서 이러한 span을 내보내는 방법은 맞춤형 에이전트 퀵스타트를 참조하세요.
에이전트를 구축하는 중이라면 에이전트 인테그레이션 퀵스타트에서 기본 제공 인테그레이션을 선택하거나, 맞춤형 에이전트 퀵스타트를 따라 직접 만든 에이전트를 수동으로 계측하세요. Weave SDK에서 에이전트를 모델링하는 방식은 에이전트 트레이싱하기를 참조하세요.
Claude Code, OpenAI Agent SDK 등 지원되는 서드파티 에이전트 하니스를 사용한다면 추가 코드 없이 Weave가 자동으로 계측합니다. 지원되는 전체 프레임워크 목록은 인테그레이션을 참조하세요.
함수 계측 및 트레이스
개별 함수 호출, 애플리케이션 코드 또는 맞춤형 로직을 트레이스하려면 Weave Op과 Call을 사용하세요. 함수에 코드 한 줄만 추가하면 입력, 출력, 비용, 토큰 수, 지연 시간을 추적할 수 있습니다. 이 밖에도 다음과 같은 작업을 할 수 있습니다.- LLM 애플리케이션 내에서 데이터가 흐르는 과정을 처음부터 끝까지 추적합니다.
- LLM 피드백을 생성하는 데 사용된 소스 문서를 확인합니다.
- 특정 프롬프트를 자세히 살펴보고 답변이 어떻게 생성되는지 확인합니다.
에이전트 트레이싱과 애플리케이션 계측의 사용 시점
관찰하려는 대상에 따라 사용할 워크플로를 선택하세요.- 에이전트를 구축하거나 실행한다면 에이전트 트레이싱을 사용하세요. 지원되는 에이전트 하니스나 에이전트 SDK를 사용하거나, 직접 계측할 수 있는 맞춤형 에이전트를 구축했다면 이 방식이 적합합니다.
- 애플리케이션 코드를 트레이싱한다면 애플리케이션 계측을 사용하세요. RAG 파이프라인, 요약 엔드포인트, 맞춤형 비즈니스 로직처럼 대화가 아닌 개별 Call 단위로 구성된 애플리케이션에 적합합니다.
weave.op Call은 Traces 페이지에 표시됩니다. 같은 Weave 프로젝트에서 두 방식을 함께 사용할 수 있지만, 트레이스는 각각 따로 생성됩니다.
어디서부터 시작할지 잘 모르겠고 시스템에 에이전트가 포함되어 있다면 에이전트 인테그레이션 퀵스타트를 참고해 에이전트 트레이싱부터 시작하세요. 그렇지 않다면 Op 트레이싱 퀵스타트부터 시작하세요.
평가
평가를 통해 에이전트나 LLM 애플리케이션의 성능을 벤치마킹하고 모니터링하면서 품질과 안정성을 반복적으로 개선하세요.- 어떤 모델 및 프롬프트 버전이 어떤 성능을 냈는지 추적하세요.
- 하나 이상의 점수화 함수로 응답을 평가하는 메트릭을 정의하세요.
- 여러 메트릭을 기준으로 둘 이상의 평가를 비교하세요. 특정 샘플의 성능을 서로 대조해 볼 수도 있습니다.
모든 것을 버전 관리하세요
Weave는 프롬프트, 데이터셋, 모델 설정의 버전을 추적합니다. 문제가 생기면 정확히 무엇이 바뀌었는지 확인할 수 있고, 잘 작동하면 그대로 재현할 수 있습니다. 버전 관리 알아보기프롬프트와 모델 실험하기
보유한 API 키를 사용해 플레이그라운드에서 프롬프트를 테스트하고 여러 상용 모델의 응답을 비교해 보세요. Weave 플레이그라운드에서 실험하기피드백 수집
프로덕션 환경에서 사람이 남긴 피드백, 어노테이션, 수정 사항을 캡처하세요. 이 데이터를 활용하면 더 나은 테스트 케이스를 구축하고 애플리케이션을 개선할 수 있습니다. 피드백 수집프로덕션 모니터링
평가에서 사용하는 것과 동일한 Scorer로 프로덕션 트래픽을 채점하세요. 가드레일을 설정하면 문제가 사용자에게 전달되기 전에 미리 잡아낼 수 있습니다. 가드레일 및 모니터 설정Weave 시작하기
Weave는 Python 및 TypeScript용 SDK를 제공합니다. 두 SDK 모두 트레이싱, 평가, 데이터셋을 비롯한 Weave의 핵심 기능을 지원합니다. 단, 클래스 기반 Models 및 Scorer 같은 일부 고급 기능은 Weave TypeScript SDK에서 사용할 수 없습니다. Weave를 시작하려면 다음 단계를 따르세요.- https://id.coreweave.com/signup 에서 CoreWeave Forge 계정을 만들고 https://forge.coreweave.com/settings#apikeys 에서 API 키를 발급받으세요.
- Weave를 설치하세요.
- 스크립트에서 Weave를 임포트하고 프로젝트를 초기화하세요.
<your-team>은 CoreWeave Forge 팀 이름으로,<your-project>는 Weights & Biases 프로젝트 이름으로 바꾸세요.