Skip to main content
Utilisez Serverless RL pour effectuer le post-entraînement d’un LLM par apprentissage par renforcement. Vous définissez une fonction de récompense qui évalue les sorties de votre agent. Serverless RL collecte des lots de trajectoires, met à jour un adaptateur de faible rang (LoRA) afin de favoriser les comportements les mieux notés, stocke l’adaptateur sous forme d’artifact dans votre compte Weights & Biases et héberge chaque point de contrôle sur Serverless Inference. Serverless RL est actuellement en préversion publique. Vous pouvez utiliser Serverless RL via le framework ART d’OpenPipe ou directement avec l’API Serverless Training.

Prérequis

Avant de commencer, assurez-vous de disposer des éléments suivants :
  • Un compte Forge. Si vous n’en avez pas, inscrivez-vous.
  • Une clé API. Dans Forge, cliquez sur l’icône de votre profil, sélectionnez Settings, puis cliquez sur Create new API key. Copiez la clé dès qu’elle s’affiche, car vous ne pourrez plus la consulter par la suite. Les exemples de cette page la lisent dans la variable d’environnement WANDB_API_KEY ; le guide de démarrage rapide d’ART indique où ART s’attend à la trouver.
  • Un projet dans Weights & Biases pour enregistrer les métriques d’entraînement et stocker l’adaptateur entraîné. Voir Projects.
  • Une fonction de récompense qui évalue les sorties de votre agent. Serverless RL entraîne le modèle à maximiser ce que cette fonction récompense : c’est donc elle qui définit la tâche. Le guide de démarrage rapide d’ART explique comment en écrire une.
  • Le framework ART, si vous l’utilisez au lieu d’appeler directement l’API. Suivez les étapes d’installation du guide de démarrage rapide d’ART.
Consultez également la page Informations d’utilisation et limites pour connaître les coûts et les restrictions, puis choisissez un modèle de base parmi les modèles disponibles.

Entraîner un agent

ART encapsule l’API Serverless Training et gère pour vous les rollouts, les récompenses et les points de contrôle. C’est la méthode recommandée pour débuter. Suivez le démarrage rapide d’ART ou ouvrez le notebook d’exemple, qui entraîne de bout en bout un agent à jouer à 2048.

Utiliser vos modèles entraînés

Une fois entraîné, un modèle est automatiquement disponible pour l’inférence. Cette section explique comment construire le point de terminaison d’un modèle entraîné et lui envoyer des requêtes, afin d’intégrer ce modèle à votre application ou à vos flux de travail d’évaluation. Les mêmes étapes s’appliquent aux modèles entraînés avec Serverless SFT. Pour envoyer des requêtes à votre modèle entraîné, vous avez besoin des éléments suivants :
  • Votre clé API. Créez-en une dans Forge, sous Settings.
  • L’URL de base de l’API Serverless Training : https://forge.coreweave.com/api/training/v1/.
  • Le point de terminaison de votre modèle.
Le point de terminaison du modèle respecte le schéma suivant :
Le schéma se compose des éléments suivants :
  • Votre entity, c’est-à-dire le nom de votre équipe.
  • Le nom du projet associé à votre modèle.
  • Le nom de votre modèle entraîné.
  • L’étape d’entraînement du modèle que vous souhaitez déployer. Il s’agit généralement de l’étape à laquelle le modèle a obtenu les meilleurs résultats lors de vos évaluations.
Par exemple, si votre équipe s’appelle email-specialists, votre projet mail-search et votre modèle entraîné agent-001, et que vous souhaitez le déployer à l’étape 25, le point de terminaison se présente ainsi :
Une fois votre point de terminaison obtenu, vous pouvez l’intégrer à vos flux de travail d’inférence habituels. Les exemples suivants montrent comment envoyer des requêtes d’inférence à votre modèle entraîné à l’aide d’une requête cURL ou du SDK d’OpenAI pour Python. Choisissez l’exemple adapté à votre environnement.

cURL

SDK d’OpenAI

Pour économiser de l’espace de stockage, supprimez les points de contrôle dont vous n’avez plus besoin. Voir Informations d’utilisation et limites.
Dernière modification le 30 septembre 2026