Skip to main content
CoreWeave Model Distillation은 이미 프로덕션 환경에서 LLM 기능을 운영하고 있으며, 더 낮은 비용과 지연 시간으로 동등하거나 더 나은 동작을 제공하는 특화 모델이 필요한 팀을 위해 설계되었습니다.

Model Distillation이 제공하는 기능

  • 애플리케이션은 한 번만 연결: 익숙한 Chat Completion 인터페이스를 그대로 사용하므로, 애플리케이션이 요청을 보내고 응답을 읽는 방식을 바꾸지 않고도 모델을 전환할 수 있습니다.
  • 실제 사용 데이터로 학습: 애플리케이션에서 이미 생성되는 예시를 자동으로 수집하므로, 고객에게 실제로 중요한 동작을 바탕으로 모델을 개선할 수 있습니다.
  • 더 나은 트레이닝 데이터 구축: 모델이 학습할 예시를 선택해 검토하고, 품질이 낮은 예시는 제거하며, 필요하면 답변을 개선할 수 있습니다.
  • 작업에 맞는 모델 트레이닝: 훨씬 큰 모델에 버금가는 동작을 보이면서도 비용과 지연 시간은 줄인 특화 모델을 만들 수 있습니다.
  • 배포 전 품질 비교: 동일한 예시로 모델을 테스트해 각 모델이 어디에서 앞서고 어디에서 실패하는지 확인하고, 근거에 기반해 배포를 결정할 수 있습니다.
  • 안전한 배포: 트래픽 일부로 새 모델을 테스트하고 비중을 점진적으로 늘리면서, 언제든 롤백할 수 있도록 이전 모델을 대기 상태로 유지할 수 있습니다.

일반적인 고객 여정

  1. AI 기능 하나를 Model Distillation에 연결합니다.
  2. 평소 제품을 사용하는 과정에서 예시를 수집합니다.
  3. 학습할 가치가 있는 예시와 답변을 선별합니다.
  4. 여러 후보 모델을 트레이닝합니다.
  5. 현재 사용 중인 모델과 비교합니다.
  6. 가장 우수한 모델을 점진적으로 배포하고 결과를 모니터링합니다.
이 과정 내내 현재 모델을 계속 사용할 수 있으므로, 한꺼번에 전환하는 위험한 마이그레이션을 거칠 필요가 없습니다.
전체 절차를 확인하려면 에이전트에게 퀵스타트를 안내하세요. UI 작업은 공개 Management API를 사용하고, 애플리케이션 트래픽은 Inference proxy API를 사용합니다. 실제 작업을 다루는 각 가이드에는 API 아래에 이에 해당하는 요청이 포함되어 있습니다.
마지막 수정일 2026년 9월 30일