Model Distillation이 제공하는 기능
- 애플리케이션은 한 번만 연결: 익숙한 Chat Completion 인터페이스를 그대로 사용하므로, 애플리케이션이 요청을 보내고 응답을 읽는 방식을 바꾸지 않고도 모델을 전환할 수 있습니다.
- 실제 사용 데이터로 학습: 애플리케이션에서 이미 생성되는 예시를 자동으로 수집하므로, 고객에게 실제로 중요한 동작을 바탕으로 모델을 개선할 수 있습니다.
- 더 나은 트레이닝 데이터 구축: 모델이 학습할 예시를 선택해 검토하고, 품질이 낮은 예시는 제거하며, 필요하면 답변을 개선할 수 있습니다.
- 작업에 맞는 모델 트레이닝: 훨씬 큰 모델에 버금가는 동작을 보이면서도 비용과 지연 시간은 줄인 특화 모델을 만들 수 있습니다.
- 배포 전 품질 비교: 동일한 예시로 모델을 테스트해 각 모델이 어디에서 앞서고 어디에서 실패하는지 확인하고, 근거에 기반해 배포를 결정할 수 있습니다.
- 안전한 배포: 트래픽 일부로 새 모델을 테스트하고 비중을 점진적으로 늘리면서, 언제든 롤백할 수 있도록 이전 모델을 대기 상태로 유지할 수 있습니다.
일반적인 고객 여정
- AI 기능 하나를 Model Distillation에 연결합니다.
- 평소 제품을 사용하는 과정에서 예시를 수집합니다.
- 학습할 가치가 있는 예시와 답변을 선별합니다.
- 여러 후보 모델을 트레이닝합니다.
- 현재 사용 중인 모델과 비교합니다.
- 가장 우수한 모델을 점진적으로 배포하고 결과를 모니터링합니다.
API: 에이전트 워크플로
API: 에이전트 워크플로
전체 절차를 확인하려면 에이전트에게 퀵스타트를 안내하세요. UI 작업은 공개 Management API를 사용하고, 애플리케이션 트래픽은 Inference proxy API를 사용합니다. 실제 작업을 다루는 각 가이드에는 API 아래에 이에 해당하는 요청이 포함되어 있습니다.