Skip to main content
Ce guide présente le parcours complet, d’une fonctionnalité d’IA existante jusqu’à un modèle spécialisé exécuté en production. Il s’adresse aux développeurs qui disposent déjà d’une application appelant un modèle via un client OpenAI et qui souhaitent remplacer ce modèle sans avoir à modifier l’application à chaque fois. Vous allez connecter votre application à CoreWeave Model Distillation, collecter le trafic réel dans un dataset, effectuer le fine-tuning de modèles candidats et les évaluer, puis acheminer le trafic de production vers le meilleur d’entre eux. À l’issue de ce guide, votre application appellera un nom de modèle proxy stable, et le candidat que vous aurez retenu pour son équilibre entre qualité, vitesse et coût traitera la part du trafic que vous lui aurez attribuée.

Étape 1 : Se connecter avec W&B

Dans Forge, choisissez Post-Training → Model Distillation. Ouvrez Model Distillation, connectez-vous avec votre clé API W&B, puis choisissez l’équipe propriétaire de l’application.
Pour une application en production, nous vous recommandons d’utiliser une clé de compte de service d’équipe. Ainsi, la disponibilité de votre application ne dépend pas du compte d’un seul employé.

Étape 2 : enregistrer le fournisseur de votre modèle actuel

Ouvrez Providers et connectez le service qui exécute votre modèle actuel. Model Distillation peut ainsi continuer à servir ce même modèle pendant que vous collectez des données et entraînez des modèles de remplacement. Si vous utilisez le fournisseur intégré wandb-inference, vous pouvez ignorer cette étape. Le fournisseur doit exposer un point de terminaison Chat Completions compatible avec OpenAI pour le trafic applicatif acheminé. Saisissez l’URL de base exacte de l’API, y compris tout préfixe de chemin requis, comme /v1. Le proxy y ajoute /chat/completions. Pour le réétiquetage et les évaluations dans l’interface, le fournisseur nommé openai utilise en revanche l’API Responses d’OpenAI. Après avoir enregistré le fournisseur, ajoutez ou activez l’ID du modèle s’il n’est pas encore disponible. Avant de continuer, attendez que le déploiement du fournisseur soit à l’état Applied pour la révision actuelle.

Étape 3 : créer un projet

Dans Projects, sélectionnez Create or import a project. Créez un nouveau projet W&B ou importez un projet existant, attribuez à la fonctionnalité un nom de modèle proxy stable, tel que ticket-classifier, puis sélectionnez le modèle qui la sert actuellement. Le nom de modèle proxy devient la valeur model utilisée par votre application. Il reste identique lorsque vous entraînez et déployez de nouvelles implémentations.
Dans l’API, un projet correspond à une tâche, et le nom de modèle proxy correspond à l’alias dans l’URL. Indiquez le nom du projet W&B dans project, choisissez create ou import dans project_mode, puis définissez le modèle actuel dans targets :
Pour la requête et la réponse complètes, voir Créer un projet Model Distillation.
L’acheminement est publié de manière asynchrone. Ouvrez la page Routing du projet et attendez que le déploiement soit à l’état Applied pour la révision d’acheminement actuelle avant d’envoyer du trafic applicatif.

Étape 4 : connecter votre application

Conservez votre client OpenAI habituel, mais modifiez son URL de base et son modèle :
Model Distillation collecte désormais des exemples utiles à partir du trafic applicatif habituel. Pour des exemples en Python, en JavaScript et avec curl, consultez Connecter votre application.

Étape 5 : créer un dataset

Une fois que le projet reçoit un trafic représentatif, créez un dataset. Passez en revue les exemples et supprimez ceux de mauvaise qualité. Si vous souhaitez que le nouveau modèle adopte un meilleur comportement que le modèle actuel, améliorez les réponses. Suivez le Démarrage rapide Datasets pour créer et examiner votre premier dataset.

Étape 6 : effectuer le fine-tuning de plusieurs modèles

Entraînez un ou plusieurs modèles candidats à partir du dataset. En essayant plusieurs candidats, vous augmentez vos chances de trouver le bon équilibre entre qualité, vitesse et coût. Suivez le guide de démarrage rapide du fine-tuning pour lancer une tâche d’entraînement.

Étape 7 : Évaluez les candidats

Comparez chaque candidat aux réponses que vous souhaitez conserver. Examinez le résultat global ainsi que chaque exemple avant de retenir le meilleur candidat. Suivez le guide Démarrage rapide des évaluations pour effectuer votre première comparaison.

Étape 8 : déployer le modèle gagnant

Ajoutez le modèle gagnant à l’acheminement du projet. Vous pouvez commencer par lui attribuer une faible part du trafic, l’augmenter progressivement et garder le modèle d’origine prêt en cas de restauration. Votre application continue d’appeler le même nom de modèle proxy, et le nouveau modèle traite désormais la part du trafic que vous lui avez attribuée.

Entraîner et déployer votre premier modèle

Suivez le flux de travail manuel complet, avec plus de détails sur chaque décision.
Dernière modification le 30 septembre 2026