Skip to main content
Serverless Inference에서는 일부 기본 모델에 커스텀 LoRA를 적용하여 사용할 수 있습니다. 이 튜토리얼에서는 TRL 라이브러리로 지도 Post-training을 수행하여 파인튜닝된 LoRA를 만들고, 이를 Serverless Inference API 또는 플레이그라운드에서 사용할 수 있도록 W&B에 아티팩트로 업로드하는 과정을 안내합니다. 예시에서는 쿼리/응답 쌍으로 구성된 데이터셋으로 모델이 카우보이처럼 응답하도록 파인튜닝하지만, 같은 워크플로를 다른 캐릭터나 작업에도 그대로 적용할 수 있습니다. 이 튜토리얼은 추론 인프라를 직접 관리하지 않고 기본 모델의 동작을 사용자 지정하려는 개발자를 대상으로 합니다. 서버리스 강화 학습을 제공하는 Serverless RL로도 LoRA를 생성할 수 있습니다. 이 튜토리얼은 세 부분으로 구성됩니다. 먼저 Post-training 데이터셋을 준비하고, LoRA를 생성하고 업로드하는 Post-training 스크립트를 실행한 다음, 완성된 LoRA를 플레이그라운드나 코드에서 사용해 봅니다.

Post-training 데이터셋

이 섹션에서는 모델 파인튜닝에 사용하는 예시 데이터셋을 제공합니다. 다음 데이터셋은 메시지 목록 형식으로 구성된 50개의 쿼리-응답 쌍으로 이루어져 있습니다. 예를 들면 다음과 같습니다.
User: “What is your favorite color?”
Assistant: “Well, pardner, my favorite color’s the blazin’ orange of a desert sunset.”
예시 파일은 한 줄에 JSON 객체 하나씩으로 구성되어 있습니다. 다음 데이터를 작업 디렉터리에 cowboy_examples.jsonl로 저장하세요.
cowboy_examples.jsonl
이 데이터셋을 저장하면 Post-training을 실행할 수 있습니다.

Post-training

이 섹션에서는 데이터셋으로 LoRA 어댑터를 생성해 W&B에 업로드하는 트레이닝 스크립트를 실행하는 과정을 안내합니다. 이 스크립트는 JSONL 파일의 예시로 LoRA 어댑터를 트레이닝한 후, Serverless Inference API나 플레이그라운드에서 사용할 수 있도록 W&B에 아티팩트로 업로드합니다. 스크립트의 주요 동작은 다음과 같습니다.
  1. W&B에 로그인합니다. W&B Models의 Hugging Face Transformers 인테그레이션이 트레이닝 진행 상황과 메트릭을 자동으로 기록합니다.
  2. Hugging Face에서 기본 모델(OpenPipe/Qwen3-14B-Instruct)을 불러옵니다.
  3. rank, alpha 등의 하이퍼파라미터로 LoRA를 설정합니다. 이 하이퍼파라미터는 파일 상단에 상수로 정의되어 있습니다.
  4. 파일의 예시를 데이터셋으로 불러온 다음 SFTTrainer를 실행합니다. 기본적으로 모든 예시를 사용합니다.
  5. LoRA를 저장하고 Serverless Inference에서 사용할 수 있도록 W&B에 아티팩트로 업로드합니다.
스크립트가 종료되면 마지막에 출력된 URL을 브라우저에서 열어 저장된 아티팩트를 확인하세요. URL은 다음과 같은 형태입니다. Artifact URL: https://wandb.ai/[YOUR-ENTITY]/create-lora-tutorial/artifacts/lora/OpenPipe_Qwen3-14B-Instruct_cowboy/v0 다음 프로그램을 create_lora.py로 저장하고 ENTITY 값을 본인의 W&B entity로 변경하세요. 이 스크립트는 인라인 스크립트 메타데이터로 의존성을 선언하므로, 별도의 가상 환경을 관리할 필요 없이 uv로 바로 실행할 수 있습니다.
create_lora.py
uv로 스크립트를 실행하세요:
실행 시간은 하드웨어에 따라 다릅니다. 트레이닝 속도를 높이려면 --max-examples=10 인수를 추가하세요. 단, 예시 수가 적을수록 LLM이 캐릭터에 맞게 응답하는 능력이 떨어집니다. 스크립트가 종료되면 트레이닝된 LoRA 어댑터가 W&B 아티팩트로 저장되며, 이 어댑터를 Serverless Inference에서 바로 사용할 수 있습니다.

LoRA 사용하기

이 섹션에서는 생성한 LoRA를 플레이그라운드에서 대화형으로 사용해 보거나 코드로 사용해 보는 방법을 설명합니다. W&B Weave 플레이그라운드에서 LoRA를 사용해 볼 수 있습니다. 아티팩트 URL을 연 다음 Try in 플레이그라운드를 클릭하세요.
Artifacts UI의 LoRA
그런 다음 채팅 인터페이스 하단에 프롬프트를 입력하세요.
플레이그라운드 UI의 LoRA
코드에서 LoRA를 사용하는 방법은 Serverless LoRA Inference 사용하기 가이드의 단계별 안내를 참조하세요.

다음 단계

이제 LoRA가 제대로 작동하므로, 트레이닝 방식에 따라 결과가 어떻게 달라지는지 더 실험해 볼 수 있습니다.
  • 더 적은 예시로 LoRA를 트레이닝해도 원하는 효과가 나타나는지 확인해 보세요.
  • 데이터셋의 응답을 바꿔 해적이나 닌자 같은 다른 캐릭터를 표현해 보세요.
마지막 수정일 2026년 9월 30일