Skip to main content
Cette page explique comment servir vos propres adaptateurs LoRA personnalisés sur W&B Serverless Inference. Elle s’adresse aux développeurs et aux professionnels du ML qui souhaitent déployer des variantes affinées de modèles de base pris en charge sans avoir à gérer d’infrastructure. LoRA (Low-Rank Adaptation) vous permet de personnaliser de grands modèles de langage en n’entraînant et en ne stockant qu’un module complémentaire léger, plutôt qu’un nouveau modèle complet. La personnalisation s’en trouve allégée et moins coûteuse. Vous pouvez entraîner ou téléverser un LoRA pour doter un modèle de base de nouvelles capacités, par exemple pour le spécialiser dans l’assistance client, l’écriture créative ou un domaine technique précis. Vous adaptez ainsi le comportement du modèle sans avoir à le réentraîner ni à le redéployer entièrement.

Pourquoi utiliser Serverless Inference pour les LoRA

Serverless Inference pour les LoRA offre les avantages suivants :
  • Téléversez une seule fois, puis déployez sans avoir à gérer de serveurs.
  • Suivez la version en production grâce à la gestion des versions des artifacts.
  • Mettez à jour vos modèles en remplaçant de petits fichiers LoRA plutôt que l’intégralité des poids du modèle.

Flux de travail

Dans les grandes lignes, la mise à disposition d’un LoRA personnalisé se déroule en trois étapes :
  1. Téléversez vos poids LoRA sous forme d’artifact W&B.
  2. Indiquez l’URI de l’artifact comme nom de modèle dans l’API.
  3. W&B charge dynamiquement vos poids pour l’inférence.
L’exemple suivant montre comment appeler votre modèle LoRA personnalisé avec Serverless Inference. Les sections suivantes expliquent comment téléverser ou entraîner le LoRA utilisé ici.
Consultez ce notebook de prise en main pour une démonstration interactive de la création d’un LoRA et de son téléversement dans W&B en tant qu’artifact.

Prérequis

Vous devez disposer des éléments suivants :
  • Une clé API W&B.
  • Un projet W&B.
  • Python 3.8 ou version ultérieure avec les packages openai et wandb : pip install wandb openai.

Ajouter et utiliser des LoRA

Vous pouvez ajouter des LoRA à votre compte W&B et commencer à les utiliser de deux manières. Choisissez l’onglet correspondant à l’endroit où votre LoRA a été entraîné :
Téléversez votre propre répertoire de LoRA personnalisé en tant qu’artifact W&B. Utilisez cette méthode si vous avez entraîné votre LoRA ailleurs (environnement local, fournisseur de cloud ou service partenaire).Ce code Python téléverse vers W&B vos poids LoRA stockés localement, sous la forme d’un artifact versionné. Il crée un artifact de type lora avec les métadonnées requises (modèle de base et région de stockage), y ajoute vos fichiers LoRA depuis un répertoire local, puis le journalise dans votre projet W&B pour que vous puissiez l’utiliser en inférence.

Exigences principales

Pour utiliser vos propres LoRA avec Inference, vérifiez les points suivants :
  • Le LoRA doit avoir été entraîné à partir de l’un des modèles répertoriés dans la section Modèles de base pris en charge.
  • Le LoRA doit être enregistré au format PEFT en tant qu’artifact de type lora dans votre compte W&B.
  • Le LoRA doit être stocké dans storage_region="coreweave-us" afin de garantir une faible latence.
  • Lors du téléversement, indiquez le nom du modèle de base sur lequel vous l’avez entraîné (par exemple, meta-llama/Llama-3.1-8B-Instruct). W&B pourra ainsi le charger avec le bon modèle.
Une fois votre LoRA ajouté à votre projet en tant qu’artifact, quelle que soit la méthode utilisée, vous pouvez le référencer dans n’importe quel appel d’inférence en transmettant son URI comme nom de modèle :

Modèles de base pris en charge

Votre LoRA doit avoir été entraîné à partir de l’un des modèles de base suivants. Lorsque vous définissez wandb.base_model, utilisez la chaîne exacte de l’ID du modèle afin que W&B puisse associer votre adaptateur au bon modèle de base lors de l’inférence.

Tarification

Vous ne payez que le stockage et l’inférence que vous exécutez, et non des serveurs actifs en permanence ou des instances GPU dédiées. La tarification comprend deux composants :
  • Stockage : le stockage de vos poids LoRA vous est facturé.
  • Utilisation de l’inférence : les appels qui utilisent des artifacts LoRA sont facturés aux mêmes tarifs que l’inférence de modèle standard.
Dernière modification le 30 septembre 2026