- Serverless RL : effectuez le post-entraînement de modèles par apprentissage par renforcement afin qu’ils acquièrent de nouveaux comportements et gagnent en fiabilité, en rapidité et en coût sur des tâches agentiques sur plusieurs tours de conversation. Vous définissez une fonction de récompense qui note les sorties de votre agent. Serverless RL divise le flux de travail en phases d’inférence et d’entraînement, puis les multiplexe entre les jobs afin d’augmenter l’utilisation des GPU et de réduire la durée et le coût de vos entraînements.
- Serverless SFT : effectuez le fine-tuning de modèles par apprentissage supervisé sur des exemples d’entrées et de sorties soigneusement sélectionnés. Utilisez le SFT pour la distillation, pour apprendre à un modèle un style et un format de sortie, ou pour préparer un modèle avant de lui appliquer le RL.
Quand utiliser chaque méthode
Serverless RL convient aux tâches pour lesquelles vous pouvez évaluer un résultat sans pouvoir rédiger à l’avance la réponse idéale, par exemple :- Agents vocaux
- Assistants de recherche approfondie
- Modèles sur site
- Agents d’analyse de marketing de contenu
- Distillation : transférer les connaissances d’un modèle plus grand et plus performant vers un modèle plus petit et plus rapide.
- Apprentissage du style et du format de sortie : entraîner un modèle à respecter un format de réponse, un ton ou une structure spécifiques.
- Préchauffage avant le RL : fournir à un modèle des exemples supervisés avant de l’affiner par apprentissage par renforcement.
Pourquoi choisir Serverless Training
- Coûts d’entraînement réduits : Serverless Training mutualise l’infrastructure entre de nombreux utilisateurs, vous épargne la configuration de chaque job et ramène vos coûts GPU à zéro lorsque vous n’entraînez pas de modèle. Vos coûts d’entraînement baissent ainsi considérablement.
- Entraînement plus rapide : Serverless Training répartit les requêtes d’inférence sur de nombreux GPU et provisionne l’infrastructure d’entraînement dès que vous en avez besoin. Vos jobs se terminent plus tôt et vous itérez plus rapidement.
- Déploiement automatique : Serverless Training déploie chaque point de contrôle que vous entraînez, sans que vous ayez à configurer d’infrastructure d’hébergement. Vous pouvez accéder à vos modèles entraînés et les tester immédiatement dans vos environnements local, de staging ou de production.
Comment Serverless Training utilise les services Forge
Serverless Training combine les composants Forge suivants :- Serverless Inference : exécute vos modèles, y compris chaque point de contrôle entraîné.
- Weights & Biases : suit les métriques de performances pendant l’entraînement d’un adaptateur LoRA.
- Artifacts : stocke et versionne les adaptateurs LoRA.
- Weave (facultatif) : montre comment le modèle répond à chaque étape de la boucle d’entraînement.
- Entraîner un modèle Qwen avec OpenPipe RULER et des Scorers Weave.
- Suivre la progression de l’entraînement et créer des graphiques personnalisés dans Weights & Biases.
- Évaluer les résultats finaux sur un leaderboard Weave.
Serverless RL et Serverless SFT sont en préversion publique. Pendant la préversion, seuls l’utilisation de l’inférence et le stockage des artifacts vous sont facturés ; l’entraînement des adaptateurs est gratuit. Voir Informations d’utilisation et limites.
Étapes suivantes
- Consultez les modèles disponibles.
- Suivez le guide Utiliser Serverless SFT ou Utiliser Serverless RL. Chacun commence par ses prérequis : un compte Forge, une clé API et un projet.
- Recherchez les points de terminaison dans la référence de l’API Serverless Training.