Skip to main content
このページでは、W&B Serverless Inferenceで独自のカスタムLoRA アダプターを提供する方法について説明します。サポートされるベースモデルのファインチューニングしたモデルをインフラストラクチャーを管理せずにデプロイしたい開発者やML実践者を対象としています。 LoRA アダプター (Low-Rank Adaptation) を使用すると、完全な新しいモデルではなく軽量なアドオンをトレーニングおよび保存するだけで、大規模言語モデルをカスタマイズできます。これにより、カスタマイズのサイズとコストが削減されます。 LoRA アダプターをトレーニングするまたはアップロードして、ベースモデルに新しい機能を追加できます。たとえば、カスタマーサポート、クリエイティブライティング、または特定の技術分野に特化させることができます。これにより、モデル全体を再トレーニングまたは再デプロイせずに、モデルの動作を適応させることができます。

LoRA アダプターに Serverless Inference を使用する理由

LoRA アダプター向けの Serverless Inference には、次の利点があります。
  • 一度アップロードすれば、サーバーを管理せずにデプロイできます。
  • アーティファクトのバージョン管理により、稼働中のバージョンをトラッキングできます。
  • モデルの重み全体ではなく、小さな LoRA アダプターのファイルを差し替えることでモデルを更新できます。

ワークフロー

大まかには、custom LoRA アダプターをサーブするには 3 つのステップがあります:
  1. LoRA アダプターの重みを W&B アーティファクトとしてアップロードします。
  2. アーティファクトの URI を API のモデル名として指定します。
  3. W&B は推論のために重みを動的にロードします。
以下の例は、Serverless Inference を使用して custom LoRA アダプターモデルを呼び出す方法を示しています。以下のセクションでは、ここで参照されている LoRA アダプターをアップロードまたはトレーニングする方法について説明します。
この Getting Started ノートブック を参照して、LoRA アダプターを作成し、W&B にアーティファクトとしてアップロードする方法のインタラクティブなデモンストレーションをご覧ください。

前提条件

以下が必要です。

LoRA アダプターを追加して使用する

W&B アカウントに LoRA アダプターを追加して使用を開始するには、2 つの方法があります。LoRA アダプターをトレーニングした場所に応じてタブを選択してください。
独自の custom LoRA アダプターのディレクトリを W&B アーティファクトとしてアップロードします。別の環境 (ローカル環境、cloud provider、パートナーサービス) で LoRA アダプターをトレーニングした場合は、この方法を使用してください。この Python コードは、ローカルに保存された LoRA アダプターの重みを、バージョン管理されたアーティファクトとして W&B にアップロードします。必須のメタデータ (ベースモデル と storage region) を含む lora タイプのアーティファクトを作成し、ローカルディレクトリから LoRA アダプターのファイルを追加して、推論で使用できるように W&B のプロジェクトにログします。

主な要件

独自の LoRA アダプターを Inference で使用するには、以下を確認してください。
  • LoRA アダプターは、サポートされる ベースモデルセクションに記載されているモデルのいずれかを使用してトレーニングされている必要があります。
  • LoRA アダプターが、W&B アカウント内に lora タイプのアーティファクトとして PEFT 形式で保存されている必要があります。
  • レイテンシーを低く抑えるため、LoRA アダプターは storage_region="coreweave-us" に保存されている必要があります。
  • アップロード時には、トレーニングに使用した ベースモデル の名 (例:meta-llama/Llama-3.1-8B-Instruct) を含めてください。これにより、W&B が正しいモデルとともに読み込みます。
どちらの方法を使用した場合でも、LoRA アダプターをアーティファクトとして project に追加した後は、その URI をモデル名として渡すことで、任意の推論 Call から参照できます。

サポートされるベースモデル

LoRA アダプターは、次のいずれかのベースモデルに対してトレーニングされている必要があります。推論時に W&B がアダプターを正しいベースモデルと組み合わせられるように、wandb.base_model を設定する際は正確なモデル ID の文字列を使用してください。

料金

常時稼働するサーバーや専用クラウド GPU インスタンスではなく、ストレージと実行した推論に対してのみ料金が発生します。料金は次の 2 つの要素で構成されます。
  • ストレージ: LoRA アダプターの重みを保存するストレージに対して課金されます。
  • 推論の使用量: LoRA アダプターのアーティファクトを使用する Call は、標準のモデル推論と同じ料金で課金されます。
最終更新日 2026年9月30日