Skip to main content
이 가이드에서는 기존 AI 기능을 출발점으로 특화 모델을 프로덕션에서 실행하기까지의 전체 과정을 안내합니다. OpenAI 클라이언트로 모델을 호출하는 애플리케이션을 이미 운영 중이며, 모델을 교체할 때마다 애플리케이션을 수정하지 않고 모델을 바꾸려는 개발자를 대상으로 합니다. 애플리케이션을 CoreWeave Model Distillation에 연결하고, 실제 트래픽을 데이터셋으로 수집하고, 후보 모델을 파인튜닝하고 평가한 다음, 프로덕션 트래픽을 가장 우수한 모델로 라우팅합니다. 이 과정을 마치면 애플리케이션은 고정된 프록시 모델 이름을 호출하게 되며, 품질, 속도, 비용 간의 균형을 기준으로 선택한 후보 모델이 부여된 비율만큼의 트래픽을 서빙합니다.

1단계: W&B로 로그인하기

Forge에서 Post-training → Model Distillation을 선택하세요. Model Distillation을 열고 W&B API 키로 로그인한 다음, 애플리케이션을 소유한 팀을 선택하세요.
프로덕션 애플리케이션에는 팀 서비스 계정 키를 사용하는 것이 좋습니다. 그러면 애플리케이션의 가용성이 특정 직원 한 명의 계정에 좌우되지 않습니다.

2단계: 현재 모델 공급자 등록

Providers를 열고 현재 모델을 실행 중인 서비스를 연결하세요. 이렇게 하면 데이터를 수집하고 대체 모델을 트레이닝하는 동안에도 Model Distillation이 기존 모델을 계속 서빙할 수 있습니다. 기본 제공되는 wandb-inference 공급자를 사용한다면 이 단계를 건너뛰어도 됩니다. 라우팅되는 애플리케이션 트래픽을 처리하려면 공급자가 OpenAI 호환 Chat Completion 엔드포인트를 제공해야 합니다. /v1과 같은 필수 경로 접두사까지 포함하여 정확한 API 기본 URL을 입력하세요. 프록시가 이 URL 뒤에 /chat/completions를 붙입니다. 단, UI에서 수행하는 재레이블링과 평가에는 이름이 openai인 공급자가 OpenAI의 Responses API를 사용합니다. 공급자를 저장한 후 해당 모델 ID를 아직 사용할 수 없다면 모델 ID를 추가하거나 활성화하세요. 공급자 배포가 현재 리비전에서 Applied 상태가 될 때까지 기다린 후 다음 단계로 진행하세요.

3단계: 프로젝트 생성

Projects에서 Create or import a project를 선택하세요. 새 W&B 프로젝트를 생성하거나 기존 프로젝트를 임포트한 다음, 기능에 ticket-classifier와 같이 변경되지 않는 프록시 모델 이름을 지정하고, 현재 해당 기능을 서빙하는 모델을 선택하세요. 프록시 모델 이름은 애플리케이션에서 사용하는 model 값이 됩니다. 새로운 구현을 트레이닝하고 배포하더라도 이 이름은 바뀌지 않습니다.
API에서는 프로젝트를 태스크(task)라고 부르며, 프록시 모델 이름은 URL의 alias에 해당합니다. project에 W&B 프로젝트 이름을 설정하고, project_mode에서 create 또는 import를 선택한 다음, targets에 현재 모델을 설정하세요.
전체 요청 및 응답은 Model Distillation 프로젝트 생성을 참조하세요.
라우팅은 비동기적으로 게시됩니다. 애플리케이션 트래픽을 보내기 전에 프로젝트의 Routing 페이지를 열고, 현재 라우팅 리비전에서 배포가 Applied 상태가 될 때까지 기다리세요.

4단계: 애플리케이션 연결하기

기존 OpenAI 클라이언트는 그대로 사용하고, 기본 URL과 모델만 변경하세요.
이제 Model Distillation은 평소 애플리케이션 트래픽에서 유용한 예시를 수집합니다. Python, JavaScript, curl 예시는 애플리케이션 연결을 참조하세요.

5단계: 데이터셋 생성

프로젝트에 대표성 있는 트래픽이 쌓이면 데이터셋을 생성하세요. 예시를 검토하고 품질이 낮은 예시는 제거하세요. 새 모델이 현재 모델보다 더 나은 동작을 학습하게 하려면 답변을 개선하세요. Datasets 퀵스타트에 따라 첫 데이터셋을 생성하고 살펴보세요.

6단계: 여러 모델 파인튜닝하기

데이터셋으로 후보 모델을 하나 이상 트레이닝하세요. 여러 후보를 사용해 보면 품질, 속도, 비용 사이에서 적절한 균형점을 찾을 가능성이 높아집니다. 파인튜닝 퀵스타트에 따라 트레이닝 작업을 시작하세요.

7단계: 후보 평가하기

각 후보를 유지하려는 답변과 비교하세요. 최종 후보를 고르기 전에 전체 결과와 개별 예시를 검토하세요. Evaluations 퀵스타트를 참고하여 첫 번째 비교를 실행하세요.

8단계: 최우수 모델 배포

최우수 모델을 프로젝트 라우팅에 추가하세요. 처음에는 트래픽의 일부만 할당하고 점차 비율을 늘려 가면서, 롤백에 대비해 기존 모델을 준비 상태로 유지할 수 있습니다. 애플리케이션은 기존과 동일한 프록시 모델 이름을 계속 호출하고, 새 모델은 부여된 비율만큼의 트래픽을 서빙합니다.

첫 번째 모델 학습 및 배포

각 결정 사항에 대한 자세한 설명과 함께 전체 수동 워크플로를 따라 해 보세요.
마지막 수정일 2026년 9월 30일