- W&B Skills는 코딩 에이전트가 코드와 분석 워크플로에서 Weights & Biases를 효과적으로 사용하는 방법을 알려 줍니다.
- Weights & Biases MCP 서버는 AI 어시스턴트를 Weights & Biases 데이터 및 문서에 연결하여, 어시스턴트가 run, 트레이스, 평가, 아티팩트에 관한 자연어 질문에 답할 수 있게 합니다.
- Claude Code
- Codex
- Cursor
- Gemini CLI
- Visual Studio Code (VS Code)
- Mistral LeChat
- Claude Desktop
W&B Skills
W&B Skills는 코딩 에이전트가 Weights & Biases를 효과적으로 사용하는 방법을 익힐 수 있도록 하는 재사용 가능한 지침 모음입니다. W&B API와 모범 사례를 에이전트에게 일일이 안내하는 대신 Skills를 설치하세요. 그러면 에이전트가 실험 추적, 트레이싱, 평가, 모니터링 작업을 스스로 수행할 수 있습니다.기능
Skills는 W&B Python SDK(트레이닝 run, 메트릭, 아티팩트, 스윕)와 Weave SDK(트레이스, 평가, Scorer)를 모두 지원합니다. 헬퍼 라이브러리, 레퍼런스 문서, 데이터 분석 패턴이 포함되어 있어 에이전트가 다음 워크플로를 처리할 수 있습니다.사전 요구 사항
W&B Skills를 사용하려면 다음이 필요합니다.-
npx명령을 실행하기 위한 Node.js -
Forge API 키. forge.coreweave.com/settings#apikeys에서 API 키를 생성한 다음 환경 변수로 설정하세요.
[YOUR-API-KEY]를 본인의 API 키로 바꾸세요. -
선택: Weights & Biases 프로젝트 이름을
WANDB_PROJECT환경 변수로 설정하세요. 이렇게 하면 매번 프로젝트를 지정하지 않아도 에이전트가 올바른 Weights & Biases 프로젝트에서 작업할 수 있습니다.
W&B Skills 설치
모든 프로젝트에서 Skills를 사용하려면 전역 설치를, 특정 프로젝트에서만 Skills를 사용하려면 프로젝트별 설치를 선택하세요. 모든 프로젝트에서 사용할 수 있도록 W&B Skills를 전역으로 설치하려면--global 플래그를 사용하세요.
--global 플래그 없이 설치 명령을 실행하세요.
--agent 플래그를 사용하면 특정 에이전트용 Skills를 설치할 수 있습니다.
--agent 및 --skill 옵션 목록은 Vercel Labs skills CLI 문서를 참조하세요.
설치가 완료되면 에이전트가 W&B Skills에 액세스할 수 있으며, Weights & Biases 관련 작업을 처리할 수 있습니다.
W&B Skills 사용하기
에이전트에게 프로젝트와 관련된 Weights & Biases 작업을 요청하세요. 다음 예시 프롬프트는 에이전트가 W&B Skills로 수행할 수 있는 작업 중 일부를 보여줍니다.- “내 PyTorch 모델의 트레이닝 메트릭을 Weights & Biases에 로깅해 줘.”
- “최근 run 10개의 손실 곡선을 분석해서 성능이 가장 좋은 설정을 파악해 줘.”
- “내 LangChain 에이전트를 트레이스하고 결과를 Weave에 로깅해 줘.”
- “테스트 데이터셋으로 내 에이전트를 평가하고 결과를 요약해 줘.”
- “최근 평가에서 실패 유형을 찾아서 분류해 줘.”
- “run A와 run B의 설정을 비교해서 차이를 보여 줘.”
W&B Skills 사용 팁
Skills는 광범위하고 막연한 질문보다 구체적인 질문에 더 좋은 결과를 제공합니다. 다음 표에서 권장 프롬프트와 지나치게 모호한 프롬프트를 비교해 보세요.Weights & Biases MCP 서버
Model Context Protocol(MCP)은 AI 에이전트가 외부 도구를 호출할 수 있도록 하는 개방형 표준입니다. Weights & Biases MCP 서버를 사용하면 IDE, 코딩 어시스턴트, 채팅 에이전트가 Weights & Biases 데이터와 문서에 직접 액세스할 수 있습니다. 따라서 에이전트가 복사해서 붙여넣는 과정 없이도 run, 트레이스, 평가, 아티팩트에 관한 질문에 답할 수 있습니다. 서버로 할 수 있는 작업에 대한 자세한 내용은 Weights & Biases MCP 서버 기능 섹션을 참조하세요.배포 유형
Weights & Biases MCP 서버는 두 가지 배포 옵션을 제공합니다. 가장 빠르게 설정하려면 호스팅 서버를 사용하고, 더 높은 격리 수준과 유연성이 필요하다면 로컬 버전을 설정하세요. 로컬 버전을 사용하는 경우 클라이언트가 서버에 액세스할 때 다른 URL을 사용해야 합니다.호스팅 서버(권장)
Weights & Biases가 관리하는 MCP 서버로, 클라이언트가 API 키를 사용해 HTTP로 연결합니다. 별도로 설치하거나 유지 관리할 로컬 프로세스가 없습니다.호스팅 서버 사용하기
로컬 설치
STDIO 또는 HTTP를 통해 자체 머신에서 MCP 서버를 실행합니다. 에어갭 환경에서 운영해야 하거나, 특정 릴리스로 버전을 고정하거나, 서버 동작을 맞춤형으로 변경하거나, 서버를 직접 개발 중이거나, STDIO만 지원하는 클라이언트를 사용해야 할 때 적합합니다.로컬에서 MCP 서버 실행하기
사전 요구 사항
클라이언트를 설정하기 전에 다음 사항이 준비되어 있는지 확인하세요.- forge.coreweave.com/settings#apikeys에서 API 키를 생성하세요.
- 키를
WANDB_API_KEY환경 변수로 설정하거나, 클라이언트에 Bearer 토큰으로 전달하세요. - Dedicated Cloud, Self-Managed, 그리고 기본 인스턴스가 아닌 인스턴스에 연결하는 로컬 설치 환경에서는
WANDB_BASE_URL환경 변수를 해당 인스턴스 URL로 설정하세요. - Weights & Biases는
mcpSDK 버전을 1.14.0(릴리스2024-11-05)으로 고정합니다. 클라이언트는mcpSDK 1.14.x로 연결해야 합니다. W&B Dedicated Cloud에서 Streamable HTTP를 사용하려면mcpSDK 1.14.x 릴리스2025-03-26이상이 필요합니다.
호스팅 서버 사용하기
Weights & Biases는 모든 배포 유형에서 관리형 MCP 서버를 제공합니다. 별도로 설치할 필요가 없습니다.Authorization 헤더에 API 키를 넣어 HTTP로 연결하도록 클라이언트를 설정하세요.
연결 URL
URL은 Weights & Biases 배포 유형에 따라 다릅니다.
Dedicated Cloud 또는 Self-Managed를 사용하는 경우
https://mcp.withwandb.com/mcp를 https://[YOUR-INSTANCE]/mcp로 바꾸고 나머지는 그대로 두세요. 아래 클라이언트 설정 예시는 Multi-tenant URL을 기준으로 합니다.
- Claude Code
- Claude Desktop
- Codex
- Cursor
- Gemini CLI
- Mistral LeChat
- OpenAI Responses API
- VS Code
Bearer 토큰을 본인의 API 키로 바꾼 후 Claude Code에 Weights & Biases MCP 서버를 등록하세요.Claude Code를 전역으로 설정하려면
--scope user를 추가하세요. 현재 프로젝트에만 설정하려면 이 옵션을 생략하세요.List my W&B entities.라고 요청하여 연결을 확인하세요. 에이전트가 list_entities_tool을 호출하여 사용자 이름과 소속 팀을 반환하면 정상입니다. 연결에 실패하면 문제 해결을 참조하세요. 자세한 내용은 Claude Code의 MCP 문서를 참조하세요.MCP 서버를 로컬에서 실행
로컬 설치는 호스팅 서버를 대신하는 선택지이며, 어떤 배포 유형에서도 기본 방식이 아닙니다. 호스팅 서버가 현재 설정에 맞지 않을 때 로컬 설치를 사용하세요. 로컬에서 실행하는 일반적인 이유는 다음과 같습니다.- 에어갭 또는 오프라인 환경: 클라이언트가 호스팅된 Weights & Biases 엔드포인트에 연결할 수 없는 경우
- 버전 고정: 호스팅 서버는 main 브랜치를 따르지만, 로컬 설치에서는 특정 릴리스 태그로 버전을 고정할 수 있습니다.
- 맞춤형 서버 동작: 도구 설명 변경, 도구 추가, 기본값이 아닌 응답 토큰 예산 설정 등
- 서버 자체 개발: 서버를 직접 개발하고 있는 경우
- STDIO 전용 클라이언트 또는 로컬 프로세스가 필요한 클라이언트
WANDB_BASE_URL 환경 변수를 인스턴스 URL로 설정하세요.
로컬 사전 요구 사항
서버를 로컬에서 실행하려면 다음 항목이 준비되어 있는지 확인하세요.- Python 3.11 이상
uv또는pipWANDB_API_KEY에 설정된 API 키- Dedicated Cloud 또는 Self-Managed를 사용하는 경우, 인스턴스 URL로 설정된
WANDB_BASE_URL
서버 설치
설치 방법을 선택한 다음 아래 명령을 실행하여 MCP 서버를 설치하세요.- uvx (영구 설치 없이 실행)
- uv
- pip
- GitHub에서 설치
클라이언트 설정하기
서버를 설치했으면 서버를 실행하도록 클라이언트를 설정하세요. 사용하는 MCP 클라이언트를 선택한 다음 아래 설정을 실행하고, 필요한 경우[YOUR-WANDB-API-KEY]를 본인의 API 키로 바꾸세요.
- Claude Code
- Claude Desktop
- Codex
- Cursor
- VS Code
로컬 서버를 Claude Code에 등록하세요. 전역으로 설정하려면
--scope user를 추가하세요.HTTP 전송 방식으로 서버 실행하기
웹 기반 클라이언트를 사용하거나 테스트할 때는 HTTP 전송 방식으로 서버를 실행하세요.환경 변수
다음 환경 변수는 로컬 설치 환경에서 인증, 인스턴스 라우팅, 서버 동작을 제어합니다. 클라이언트의env 블록에 설정하거나 셸에서 export하세요.
전체 명령줄 레퍼런스와 고급 옵션은 wandb-mcp-server README를 참조하세요.
Weights & Biases MCP 서버 기능
MCP 서버를 사용하면 실험 분석, 트레이스 디버깅, 리포트 작성, 레지스트리 및 아티팩트 관리는 물론 Weights & Biases 문서를 바탕으로 한 질문 답변까지 할 수 있습니다. 다음 예시 프롬프트는 에이전트가 Weights & Biases MCP 서버에 연결되어 있을 때 요청할 수 있는 작업의 일부를 보여 줍니다.- “
your-team/your-project에서eval/accuracy기준 상위 5개 run을 보여 줘.” - “지난 한 달 동안 채용 에이전트의 predict 트레이스 지연 시간은 어떻게 변했어?”
- “지난주에 채용 에이전트가 내린 결정을 비교하는 W&B 리포트를 만들어 줘.”
- “
production-model아티팩트에는 어떤 버전이 있고,v2와v3사이에 뭐가 바뀌었어?” - “Weave에서 리더보드는 어떻게 만들어?”
사용 가능한 도구
서버는 용도별로 분류된 여러 도구를 제공합니다. 다음 표에서는 각 도구의 이름, 에이전트가 해당 도구를 사용해야 하는 상황, 그리고 해당 도구를 호출하는 데 사용할 수 있는 구체적인 프롬프트 예시를 확인할 수 있습니다.- 탐색
- Experiments 및 run
- Weave 트레이스
- Reports
- 아티팩트 및 레지스트리
- 문서
프로젝트 이름과 entity 이름을 찾고 스키마를 확인하는 데 도움이 되는 도구입니다.
스키마 우선 트레이스 쿼리
Weave 트레이스를 쿼리할 때는 먼저infer_trace_schema_tool을 호출하여 사용 가능한 필드를 확인한 다음, 필요한 열 목록과 detail_level을 정확히 지정하여 query_weave_traces_tool을 호출하세요.
이 패턴을 사용하면 광범위한 질문에서는 토큰 사용량을 낮게 유지하고, 중요한 트레이스에 대해서만 에이전트가
full로 전환하게 할 수 있습니다.
사용 팁
다음 섹션에서는 Weights & Biases MCP 서버를 더 효과적으로 활용하는 데 도움이 되는 권장 사례와 워크플로를 설명합니다. 먼저 일반적인 권장 사례를 살펴본 다음, 사용 중인 워크로드에 해당하는 섹션에서 더 구체적인 조언과 여러 단계로 이루어진 도구 체인을 확인하세요.일반 모범 사례
사용 사례와 관계없이 다음 사항을 따르세요.- entity와 프로젝트를 지정하세요. MCP 도구를 사용하려면 entity(팀 또는 개인 계정)와 프로젝트 이름을 명시해야 합니다. “in
your-team/your-project”와 같이 모든 질문에 두 가지를 모두 포함하세요. - 구체적으로 질문하세요. “What is my best evaluation?”보다는 “Which eval had the highest F1 score?”처럼 질문하는 것이 좋습니다. 메트릭과 기간을 구체적으로 지정할수록 더 적절한 도구 Call이 생성됩니다.
- 전체 조회 여부를 확인하세요. “What are my best performing runs?”처럼 범위가 넓은 질문을 할 때는 에이전트가 가장 최근 run만이 아니라 사용 가능한 모든 run을 조회했는지 확인하도록 요청하세요.
- W&B Skills와 함께 사용하세요. W&B Skills는 코딩 에이전트에게 Weights & Biases 워크플로를 구성하는 방법을 알려줍니다. Skills는 패턴을, MCP는 데이터 액세스를 제공하므로 둘을 함께 사용하면 효과적입니다.
트레이스 중심 워크플로
Weave 트레이스로 작업할 때는 다음 권장 사항을 따르세요.- 스키마부터 확인하세요.
query_weave_traces_tool보다 먼저infer_trace_schema_tool을 호출하여 에이전트에 유효한 필드와 필터 값을 제공하세요. - 적절한
detail_level을 선택하세요. 탐색에는schema를, 분석에는summary(기본값)를 사용하고,full은 소수의 특정 트레이스를 자세히 살펴볼 때만 사용하세요. resolve_trace_roots_tool을 이어서 호출하세요. 하위 트레이스를 쿼리한 후 결과로 얻은trace_id목록을resolve_trace_roots_tool에 전달하면, 한 번의 일괄 Call로 각 트레이스를 루트 세션에 매핑할 수 있습니다.- 평가에는
summarize_evaluation_tool을 우선 사용하세요. 이 도구는Evaluation.evaluate및predict_and_score계층 구조를 자동으로 집계합니다.query_weave_traces_tool은 원시 트레이스 데이터가 필요할 때만 사용하세요.
run 중심 워크플로의 경우
W&B run을 다룰 때는 다음 권장 사항을 따르세요.- 쿼리하기 전에 먼저 탐색하세요. 익숙하지 않은 run 기반 프로젝트에서는 GraphQL을 작성하기 전에
probe_project_tool을 호출하여 메트릭 키, 설정 키, 태그를 파악하세요. - 시계열 데이터에는
get_run_history_tool을 사용하세요. GraphQL은 샘플링을 하지 않으므로 손실 곡선 같은 시계열 데이터에는get_run_history_tool이 더 빠르고 비용도 적게 듭니다. - 비교는
compare_runs_tool에 맡기세요. 이 도구는 설정 및 메트릭 차이를 정렬된 이력과 함께 단일 Call로 반환하므로 직접 비교할 필요가 없습니다. - 먼저 헬스 체크를 실행하세요. 트레이닝 run이 이상해 보이면 이력을 직접 살펴보기 전에
diagnose_run_tool을 호출하세요.
Dedicated Cloud 및 Self-Managed의 경우
Multi-tenant가 아닌 배포에서는 다음 권장 사항을 따르세요.- 인스턴스의
https://[YOUR-INSTANCE]/mcp에서 제공되는 호스팅 서버를 우선적으로 사용하세요. 이 서버는 Multi-tenant 서버와 동일한 도구를 제공하며, 클라이언트 측에서WANDB_BASE_URL을 설정할 필요가 없습니다. 로컬 설치는 호스팅 서버가 아직 활성화되지 않은 경우에만 사용하세요. - 인스턴스를 대상으로 로컬에서 실행할 때는 클라이언트의
env블록에서WANDB_BASE_URL을 인스턴스 URL로 설정하세요. 이 값이 없으면 서버가api.wandb.ai를 대상으로 동작하므로 데이터가 반환되지 않습니다. - Dedicated Cloud의 요청 속도 제한은 Multi-tenant와 별도로 적용됩니다. 기본값과 변경 요청 방법은 Dedicated Cloud 요청 속도 제한을 참조하세요.
로컬 설치의 경우
자체 머신에서 서버를 실행할 때는 다음 권장 사항을 따르세요.- 데스크톱 클라이언트(Cursor, VS Code, Claude Code, Claude Desktop)에는 STDIO 전송 방식을 사용하는 것이 좋습니다. HTTP 전송 방식은 클라이언트에서 명시적으로 요구하는 경우(예: OpenAI Responses API)에만 사용하세요.
- 도구 Call이 오류 메시지 없이 실패하면 클라이언트의
env블록에MCP_SERVER_LOG_LEVEL=DEBUG를 설정한 후 클라이언트의 MCP 로그를 다시 확인하세요. - GitHub에서 설치하는 경우(
uvx --from git+https://github.com/wandb/wandb-mcp-server wandb_mcp_server)uvx는 기본 브랜치에 고정됩니다. 안정적인 버전이 필요하면 Git URL 끝에@v0.3.2를 붙여 특정 태그로 고정하세요.
권장 워크플로
실제 질문은 대부분 도구 하나만으로는 해결되지 않습니다. 다음 워크플로는 에이전트에게 요청할 수 있는 일반적인 다단계 도구 체인을 보여 줍니다.익숙하지 않은 프로젝트 살펴보기
프로젝트에 로깅된 내용을 살펴보려면 다음 도구를 순서대로 연결해 사용하세요.list_entities_tool로 entity 또는 팀을 찾습니다.query_wandb_entity_projects로 프로젝트를 찾습니다.- run 기반 프로젝트라면
probe_project_tool을, Weave 트레이스 프로젝트라면infer_trace_schema_tool을 사용합니다. - 앞 단계에서 확인한 키를 사용해
query_wandb_tool또는query_weave_traces_tool을 호출하여 필요한 데이터만 조회합니다.
실패한 LLM Call 분류
문제가 있는 트레이스와 이를 생성한 세션을 찾으려면 다음 도구를 순서대로 연결해 사용하세요.- 오류 또는 예외 필드에 대한 필터와
detail_level="summary"를 지정해query_weave_traces_tool을 실행합니다. - 결과로 얻은
trace_id목록에resolve_trace_roots_tool을 실행해 각 실패를 해당 루트 세션에 매핑합니다. - 몇 개의 특정 루트를 골라
detail_level="full"로query_weave_traces_tool을 실행해 자세히 분석합니다. create_wandb_report_tool로 발견 사항을 문서화합니다.
문제가 있는 트레이닝 run 진단하기
의심스러운 트레이닝 run의 헬스 체크를 실행하려면 다음 도구를 순서대로 연결하세요.get_run_history_tool로 손실 곡선과 검증 곡선을 가져옵니다.diagnose_run_tool로 수렴, 과적합, NaN 여부를 자동으로 검사합니다.compare_runs_tool로 정상 동작이 확인된 기준 run과 비교합니다.create_wandb_report_tool로 선 플롯 패널이 포함된 리포트를 만들어 진단 결과를 공유합니다.
평가 요약 및 모델 버전 비교
평가에서 가장 성능이 좋았던 모델 버전을 찾으려면 다음 도구를 차례로 연결해 사용하세요.summarize_evaluation_tool: Scorer별 통과율과 오류 수를 확인합니다.list_artifact_versions_tool: 해당 모델 컬렉션의 버전 목록을 조회합니다.compare_artifact_versions_tool: 후보 버전과 현재 프로덕션 버전을 비교합니다.log_analysis_to_wandb및create_wandb_report_tool: 비교 결과를 게시합니다.