Skip to main content
Le proxy d’inférence est le seul composant situé sur le chemin en ligne de votre application. Il expose :
Votre client OpenAI existant fonctionne toujours. La valeur model détermine si la requête passe par l’acheminement du projet ou appelle directement un fournisseur enregistré.

Ce qu’apporte le proxy

Acheminement par projet

Résoudre une version de projet, choisir une cible pondérée, appliquer ses paramètres et maintenir l’affinité des conversations.

Isolation des identifiants d’authentification

Remplacer la clé bearer W&B par l’identifiant d’authentification du fournisseur sélectionné, sans transmettre les en-têtes du client.

Traces exploitables pour l’entraînement

Enregistrer l’intégralité de la requête envoyée et de la réponse, avec l’identité du projet et du fournisseur.

Transport compatible avec OpenAI

Préserver le comportement des réponses de complétion de chat, avec ou sans streaming.

Routes prises en charge

Les requêtes de projet sont tracées automatiquement. Les appels directs aux fournisseurs ne sont pas tracés, sauf si metadata["wandb.project"] sélectionne une destination. Les requêtes de projet sans streaming peuvent également activer la mise en cache des réponses exactes à l’aide de l’en-tête wandb-cache-mode, qui renvoie une réponse antérieure identique au lieu d’appeler le fournisseur.
Consultez Créer une complétion de chat acheminée pour obtenir le schéma complet de la requête et de la réponse.

Comportement de refus par défaut (fail closed)

Le proxy rejette les clés W&B, les entities, les projets, les versions et les fournisseurs inconnus avant d’appeler un point de terminaison arbitraire. Les URL et les identifiants d’authentification des fournisseurs proviennent exclusivement de la matérialisation gérée côté serveur ; les appelants ne peuvent pas les fournir via les en-têtes de requête ou les jetons.
Dernière modification le 30 septembre 2026