Skip to main content
Model Distillation ajoute une boucle d’amélioration autour d’une fonctionnalité d’IA existante. Votre application continue de traiter les requêtes pendant que l’entraînement et l’évaluation se déroulent séparément, en arrière-plan.

  1. Connecter une fonctionnalité existante

Votre application appelle Model Distillation via l’interface Chat Completions, que vous connaissez déjà. Attribuez à la fonctionnalité un nom de modèle proxy stable : ce nom ne change pas, même lorsque le modèle sous-jacent s’améliore.

  1. Apprendre à partir d’exemples réels

Model Distillation collecte les entrées que reçoit votre application et les réponses pertinentes qu’elle produit déjà. Vous choisissez les exemples qui illustrent le comportement que le nouveau modèle doit apprendre. Si les réponses existantes ne sont pas satisfaisantes, vous pouvez utiliser un modèle plus performant pour générer de meilleures réponses d’entraînement avant de lancer l’entraînement.

  1. Entraîner et comparer les candidats

Entraînez un seul modèle ou lancez un sweep sur plusieurs modèles. Chaque candidat est testé sur les mêmes exemples, ce qui vous permet de vérifier s’il conserve la qualité du modèle que vous utilisez actuellement.

  1. Déployer sans bascule risquée

Redirigez d’abord une petite partie du trafic vers le modèle gagnant, ou déployez-le complètement à l’issue de l’évaluation. Le modèle précédent peut rester disponible pour permettre un retour arrière rapide.

Ce que vous contrôlez

  • quel comportement du produit devient un projet ;
  • à partir de quels exemples et de quelles réponses le modèle apprend ;
  • quels modèles sont entraînés et comparés ;
  • le niveau de qualité qu’un candidat doit atteindre avant d’être déployé ;
  • la part du trafic attribuée au modèle retenu.

Suivre le flux de travail complet

Connectez un projet et menez-le de l’utilisation réelle jusqu’au déploiement d’un modèle.
Un agent peut exécuter la même boucle à l’aide des ressources publiques suivantes :
  1. PUT /tasks/{alias} et POST /chat/completions pour connecter le trafic ;
  2. POST /tasks/{alias}/datasets pour figer les données d’entraînement et de validation ;
  3. POST /tasks/{alias}/finetunes pour chaque candidat ;
  4. POST /evals pour comparer les candidats ;
  5. PUT /tasks/{alias}/versions/{version}/routing pour déployer le modèle retenu.
Pour connaître les schémas exacts, consultez la spécification OpenAPI de gestion et la spécification OpenAPI du proxy d’inférence.
Dernière modification le 30 septembre 2026