Skip to main content
Serverless RL과 Serverless SFT를 사용하면 관리형 서버리스 인프라에서 LLM을 Post-training하고 파인튜닝할 수 있습니다. Forge가 CoreWeave에서 트레이닝 인프라를 대신 프로비저닝하며, 환경 설정 방식은 사용자가 자유롭게 정할 수 있습니다. 수십 개의 GPU까지 자동 확장되는 관리형 트레이닝 클러스터를 바로 사용할 수 있습니다. Serverless Training은 현재 공개 프리뷰 단계입니다. Serverless Training은 두 가지 방법으로 제공됩니다.
  • Serverless RL: 강화 학습으로 모델을 Post-training하여 새로운 동작을 학습시키고, 멀티턴 에이전트형 작업에서 안정성, 속도, 비용을 개선합니다. 에이전트의 출력에 점수를 매기는 보상 함수를 직접 정의하세요. Serverless RL은 워크플로를 추론 단계와 트레이닝 단계로 나눈 뒤 여러 작업에 걸쳐 멀티플렉싱하여 GPU 사용량을 높이고 트레이닝 시간과 비용을 줄입니다.
  • Serverless SFT: 선별한 입력 및 출력 예시로 지도 학습을 수행하여 모델을 파인튜닝합니다. SFT는 증류, 출력 스타일 및 형식 학습, 또는 RL 적용 전 모델 워밍업에 활용하세요.
두 방법 모두 기본 모델을 사용자의 작업에 특화하는 저랭크 어댑터(LoRA)를 트레이닝합니다. Forge는 트레이닝한 LoRA를 Weights & Biases 계정에 아티팩트로 저장하며, 백업용으로 로컬이나 서드 파티에 저장할 수도 있습니다. Serverless Inference가 트레이닝한 모든 체크포인트를 자동으로 호스팅하므로, 트레이닝 step이 끝나는 즉시 트레이닝된 모델에 요청을 보낼 수 있습니다.

각 방법을 사용해야 하는 경우

Serverless RL은 결과를 평가할 수는 있지만 이상적인 답을 미리 작성하기 어려운 작업에 적합합니다. 예를 들면 다음과 같습니다.
  • 음성 에이전트
  • 딥 리서치 어시스턴트
  • 온프레미스 모델
  • 콘텐츠 마케팅 분석 에이전트
Serverless SFT는 원하는 동작의 예시를 이미 가지고 있거나 만들 수 있는 작업에 적합합니다.
  • 증류(Distillation): 더 크고 성능이 뛰어난 모델의 지식을 더 작고 빠른 모델로 이전합니다.
  • 출력 스타일 및 형식 학습: 모델이 특정 응답 형식, 어조 또는 구조를 따르도록 학습시킵니다.
  • RL 전 워밍업: 강화 학습으로 모델을 개선하기 전에 지도 학습 예시를 먼저 제공합니다.

Serverless Training을 사용하는 이유

  • 트레이닝 비용 절감: Serverless Training은 공유 인프라를 여러 사용자가 함께 사용하도록 멀티플렉싱하고, 작업마다 설정 과정을 거칠 필요가 없으며, 트레이닝하지 않을 때는 GPU 비용이 0으로 줄어듭니다. 따라서 트레이닝 비용을 크게 절감할 수 있습니다.
  • 트레이닝 시간 단축: Serverless Training은 추론 요청을 여러 GPU에 분산하고 필요한 즉시 트레이닝 인프라를 프로비저닝합니다. 따라서 작업이 더 빨리 완료되고 반복 주기도 빨라집니다.
  • 자동 배포: Serverless Training은 트레이닝한 모든 체크포인트를 자동으로 배포하므로 호스팅 인프라를 직접 설정할 필요가 없습니다. 트레이닝된 모델에 로컬, 스테이징 또는 프로덕션 환경에서 바로 액세스하고 테스트할 수 있습니다.

Serverless Training이 Forge 서비스를 활용하는 방식

Serverless Training은 다음 Forge 컴포넌트로 구성됩니다.
  • Serverless Inference: 트레이닝된 모든 체크포인트를 포함해 모델을 실행합니다.
  • Weights & Biases: LoRA 어댑터를 트레이닝하는 동안 성능 메트릭을 추적합니다.
  • Artifacts: LoRA 어댑터를 저장하고 버전을 관리합니다.
  • Weave(선택): 트레이닝 루프의 각 단계에서 모델이 어떻게 응답하는지 보여줍니다.
공개 데모 워크스페이스에서 다음 내용을 살펴보세요.
Serverless RL과 Serverless SFT는 공개 프리뷰 단계입니다. 프리뷰 기간에는 추론 사용량과 아티팩트 저장소에 대해서만 요금이 청구되며, 어댑터 트레이닝은 무료입니다. 자세한 내용은 사용 정보 및 제한을 참조하세요.

다음 단계

  1. 사용 가능한 모델을 확인하세요.
  2. Serverless SFT 사용하기 또는 Serverless RL 사용하기 가이드를 따라 진행하세요. 두 가이드 모두 사전 요구 사항인 Forge 계정, API 키, 프로젝트를 준비하는 단계부터 시작합니다.
  3. Serverless Training API 레퍼런스에서 엔드포인트를 찾아보세요.
마지막 수정일 2026년 9월 30일