Pourquoi utiliser Serverless Inference pour les LoRA
Serverless Inference pour les LoRA offre les avantages suivants :- Téléversez une seule fois, puis déployez sans avoir à gérer de serveurs.
- Suivez la version en production grâce à la gestion des versions des artifacts.
- Mettez à jour vos modèles en remplaçant de petits fichiers LoRA plutôt que l’intégralité des poids du modèle.
Flux de travail
Dans les grandes lignes, la mise à disposition d’un LoRA personnalisé se déroule en trois étapes :- Téléversez vos poids LoRA sous forme d’artifact W&B.
- Indiquez l’URI de l’artifact comme nom de modèle dans l’API.
- W&B charge dynamiquement vos poids pour l’inférence.
Prérequis
Vous devez disposer des éléments suivants :- Une clé API W&B.
- Un projet W&B.
- Python 3.8 ou version ultérieure avec les packages
openaietwandb:pip install wandb openai.
Ajouter et utiliser des LoRA
Vous pouvez ajouter des LoRA à votre compte W&B et commencer à les utiliser de deux manières. Choisissez l’onglet correspondant à l’endroit où votre LoRA a été entraîné :- Téléverser un LoRA entraîné ailleurs
- Entraîner un nouveau LoRA avec W&B
Téléversez votre propre répertoire de LoRA personnalisé en tant qu’artifact W&B. Utilisez cette méthode si vous avez entraîné votre LoRA ailleurs (environnement local, fournisseur de cloud ou service partenaire).Ce code Python téléverse vers W&B vos poids LoRA stockés localement, sous la forme d’un artifact versionné. Il crée un artifact de type
lora avec les métadonnées requises (modèle de base et région de stockage), y ajoute vos fichiers LoRA depuis un répertoire local, puis le journalise dans votre projet W&B pour que vous puissiez l’utiliser en inférence.Exigences principales
Pour utiliser vos propres LoRA avec Inference, vérifiez les points suivants :- Le LoRA doit avoir été entraîné à partir de l’un des modèles répertoriés dans la section Modèles de base pris en charge.
- Le LoRA doit être enregistré au format PEFT en tant qu’artifact de type
loradans votre compte W&B. - Le LoRA doit être stocké dans
storage_region="coreweave-us"afin de garantir une faible latence. - Lors du téléversement, indiquez le nom du modèle de base sur lequel vous l’avez entraîné (par exemple,
meta-llama/Llama-3.1-8B-Instruct). W&B pourra ainsi le charger avec le bon modèle.
Modèles de base pris en charge
Votre LoRA doit avoir été entraîné à partir de l’un des modèles de base suivants. Lorsque vous définissezwandb.base_model, utilisez la chaîne exacte de l’ID du modèle afin que W&B puisse associer votre adaptateur au bon modèle de base lors de l’inférence.
Tarification
Vous ne payez que le stockage et l’inférence que vous exécutez, et non des serveurs actifs en permanence ou des instances GPU dédiées. La tarification comprend deux composants :- Stockage : le stockage de vos poids LoRA vous est facturé.
- Utilisation de l’inférence : les appels qui utilisent des artifacts LoRA sont facturés aux mêmes tarifs que l’inférence de modèle standard.