Skip to main content
Serverless Inference では、一部のベースモデルでカスタム LoRA アダプターを使用できます。このチュートリアルでは、TRL ライブラリを使用した教師ありポストトレーニングによりファインチューニング済みの LoRA アダプターを作成し、Serverless Inference API または プレイグラウンド で使用できるように W&B にアーティファクトとしてアップロードする手順を説明します。例ではクエリと応答のペアからなるデータセットを使用して、カウボーイのように応答するモデルにファインチューンしますが、同じワークフローを任意のキャラクターやタスクに適用できます。 このチュートリアルは、独自の推論インフラストラクチャーを管理せずにベースモデルの動作をカスタマイズしたい開発者を対象としています。 Serverless RL を使用して LoRA アダプターを作成することもできます。Serverless RL はサーバーレス強化学習を提供します。 チュートリアルは、ポストトレーニングデータセットの準備、LoRA アダプターを生成してアップロードするポストトレーニングスクリプトの実行、プレイグラウンド またはコードから結果の LoRA アダプターを試すという 3 つのパートで構成されています。

Post-training データセット

このセクションでは、モデルをファインチューンするために使用するサンプルデータセットについて説明します。 次のデータセットには、メッセージのリストとしてフォーマットされたクエリと応答のペアが 50 個含まれています。例:
ユーザー: “What is your favorite color?”
アシスタント: “Well, pardner, my favorite color’s the blazin’ orange of a desert sunset.”
サンプル file には 1 行に 1 つの JSON オブジェクトが含まれています。次のデータを作業ディレクトリに cowboy_examples.jsonl として保存してください。
cowboy_examples.jsonl
このデータセットを保存すると、ポストトレーニングの run を実行する準備完了になります。

Post-training

このセクションでは、データセットから LoRA アダプターを生成し、W&B にアップロードするトレーニングスクリプトの実行方法について説明します。 スクリプトは JSONL ファイルの例に基づいて LoRA アダプターをトレーニングし、Serverless Inference API または プレイグラウンド で使用できるように W&B にアーティファクトとしてアップロードします。 高レベルでは、このスクリプトは次のことを行います:
  1. W&B にログインします。W&B Models の Hugging Face Transformers integration は、トレーニングの進捗とメトリクスを自動的に記録します。
  2. Hugging Face からベースモデル (OpenPipe/Qwen3-14B-Instruct) を読み込みます。
  3. スクリプトがファイルの先頭近くで定数として定義している rank や alpha などのハイパーパラメーターを使用して LoRA アダプターを設定します。
  4. ファイルから例をデータセットに読み込み、SFTTrainer を実行します。デフォルトでは、スクリプトはすべての例を使用します。
  5. LoRA アダプターを保存し、Serverless Inference で使用できるように W&B に アーティファクト としてアップロードします。
スクリプトが終了したら、ブラウザーで最後に表示された URL を開いて、永続化されたアーティファクトを確認します。次のようになります: Artifact URL: https://wandb.ai/[YOUR-ENTITY]/create-lora-tutorial/artifacts/lora/OpenPipe_Qwen3-14B-Instruct_cowboy/v0 次のプログラムを create_lora.py として保存し、ENTITY の値を W&B の entity に更新してください。スクリプトは inline script metadata を使用して依存関係を宣言しているため、別個の仮想環境を管理せずに uv で直接実行できます。
create_lora.py
uv を使用してスクリプトを実行します:
実行時間はハードウェアに依存します。トレーニングを高速化するには、--max-examples=10 引数を追加しますが、例が少ないと LLM がキャラクターに応答する性能が低下します。 スクリプトが終了すると、トレーニング済みの LoRA アダプターが W&B アーティファクトとして保存され、Serverless Inference で使用する準備が完了します。

LoRA アダプターを使用する

このセクションでは、作成した LoRA アダプターを、プレイグラウンドでインタラクティブに試す方法、またはプログラムで使用する方法を説明します。 W&B Weave のプレイグラウンドで LoRA アダプターを試すことができます。アーティファクトの URL を開いたら、プレイグラウンドで試す をクリックしてください。
LoRA in Artifacts UI
次に、チャットインターフェースの下部にプロンプトを入力します。
LoRA in プレイグラウンド UI
コードから LoRA アダプターを使用するには、Serverless LoRA Inference の使用 ガイドを参照して、ステップバイステップの手順を確認してください。

次のステップ

LoRA アダプターが動作するようになったので、トレーニングの選択が結果にどのように影響するかをさらに実験して確認できます。
  • 少ないサンプルで LoRA アダプターをトレーニングし、望ましい効果が得られるかどうかを確認します。
  • データセット内の応答を変更して、海賊や忍者などの別のキャラクターを表示してみましょう。
最終更新日 2026年9月30日