Skip to main content
Serverless Inference vous permet d’utiliser un LoRA personnalisé avec certains modèles de base. Ce tutoriel vous guide dans la création d’un LoRA affiné par post-entraînement supervisé avec la bibliothèque TRL, puis dans son téléversement vers W&B sous forme d’artifact, afin de l’utiliser avec l’API Serverless Inference ou dans le Playground. L’exemple s’appuie sur un jeu de données de paires requête/réponse pour effectuer le fine-tuning d’un modèle afin qu’il réponde comme un cow-boy, mais vous pouvez adapter ce même flux de travail à n’importe quel personnage ou tâche. Ce tutoriel s’adresse aux développeurs qui souhaitent personnaliser le comportement d’un modèle de base sans avoir à gérer leur propre infrastructure d’inférence. Vous pouvez également créer un LoRA avec Serverless RL, qui propose l’apprentissage par renforcement en mode serverless. Le tutoriel comporte trois parties : préparer un jeu de données de post-entraînement, exécuter le script de post-entraînement qui génère et téléverse le LoRA, puis essayer le LoRA obtenu dans le Playground ou depuis votre code.

Jeu de données de post-entraînement

Cette section fournit le jeu de données d’exemple utilisé pour effectuer le fine-tuning du modèle. Le jeu de données suivant contient 50 paires de requêtes et de réponses, présentées sous forme de liste de messages, par exemple :
Utilisateur : « Quelle est ta couleur préférée ? »
Assistant : « Eh bien, l’ami, ma couleur préférée, c’est l’orange flamboyant d’un coucher de soleil dans le désert. »
Le fichier d’exemple contient un objet JSON par ligne. Enregistrez les données suivantes dans votre répertoire de travail sous le nom cowboy_examples.jsonl.
cowboy_examples.jsonl
Une fois ce jeu de données enregistré, vous pouvez lancer le post-entraînement.

Post-entraînement

Cette section vous guide dans l’exécution du script d’entraînement qui produit un adaptateur LoRA à partir de votre jeu de données et le téléverse vers W&B. Le script entraîne un adaptateur LoRA sur les exemples du fichier JSONL et le téléverse vers W&B sous forme d’artifact, afin que vous puissiez l’utiliser avec l’API Serverless Inference ou le Playground. Dans les grandes lignes, ce script effectue les opérations suivantes :
  1. Il se connecte à W&B. L’intégration Hugging Face Transformers de W&B Models enregistre automatiquement la progression de l’entraînement et les métriques.
  2. Il charge le modèle de base (OpenPipe/Qwen3-14B-Instruct) depuis Hugging Face.
  3. Il configure le LoRA à l’aide d’hyperparamètres, tels que le rank et l’alpha, que le script définit sous forme de constantes en haut du fichier.
  4. Il charge les exemples du fichier dans un jeu de données, puis exécute SFTTrainer. Par défaut, le script utilise tous les exemples.
  5. Il enregistre le LoRA et le téléverse vers W&B sous forme d’artifact afin de l’utiliser avec Serverless Inference.
Une fois le script terminé, ouvrez dans votre navigateur la dernière URL affichée pour consulter l’artifact enregistré. Elle se présente ainsi : Artifact URL: https://wandb.ai/[YOUR-ENTITY]/create-lora-tutorial/artifacts/lora/OpenPipe_Qwen3-14B-Instruct_cowboy/v0 Enregistrez le programme suivant sous le nom create_lora.py et remplacez la valeur ENTITY par votre entity W&B. Le script utilise des métadonnées de script intégrées pour déclarer ses dépendances : vous pouvez donc l’exécuter directement avec uv sans avoir à gérer un environnement virtuel distinct.
create_lora.py
Exécutez le script avec uv :
Le temps d’exécution dépend du matériel. Pour accélérer l’entraînement, ajoutez l’argument --max-examples=10. Notez toutefois qu’avec moins d’exemples, le LLM parvient moins bien à rester dans son personnage. Une fois le script terminé, vous disposez d’un adaptateur LoRA entraîné, stocké sous forme d’artifact W&B et prêt à être utilisé avec Serverless Inference.

Utiliser le LoRA

Cette section explique comment essayer le LoRA que vous avez créé, soit de manière interactive dans le Playground, soit par programmation. Vous pouvez essayer votre LoRA dans le Playground de W&B Weave. Une fois l’URL de l’artifact ouverte, cliquez sur Try in playground.
LoRA dans l’interface Artifacts
Saisissez ensuite votre prompt en bas de l’interface de chat.
LoRA dans l’interface du Playground
Pour utiliser votre LoRA depuis votre code, consultez le guide Utiliser l’inférence LoRA Serverless, qui fournit des instructions pas à pas.

Étapes suivantes

Maintenant que vous disposez d’un LoRA fonctionnel, vous pouvez poursuivre vos expériences pour observer l’influence des choix d’entraînement sur le résultat :
  • Entraînez le LoRA avec moins d’exemples pour vérifier s’il produit toujours l’effet souhaité.
  • Modifiez les réponses du jeu de données pour mettre en scène un autre personnage, par exemple un pirate ou un ninja.
Dernière modification le 30 septembre 2026