Créer une complétion de chat acheminée
Envoyez une requête de complétion de chat standard. model accepte un alias de tâche,
une version précise telle que alias@v2, ou une référence directe à un fournisseur enregistré
comme openai/gpt-5.6-sol. Les requêtes de tâche sont tracées automatiquement.
Autorisations
Clé API W&B dont l’entity personnelle ou par défaut, ou les équipes associées, possèdent la tâche et les fournisseurs sélectionnés.
En-têtes
Activez la mise en cache des réponses exactes pour une requête sans streaming, acheminée par tâche ou envoyée directement à provider/model. L’identité du cache inclut le corps effectif de la requête envoyée au service amont ainsi que les paramètres de chemin et de requête transmis. Les requêtes directes sont également isolées selon l’entity, la configuration du fournisseur, le modèle, l’identité utilisateur transmise et tout projet W&B Inference transmis. readWrite lit et alimente le cache, readOnly lit sans l’alimenter et writeOnly l’alimente sans le lire. Seules les réponses réussies de 8 Mio maximum sont stockées. Les valeurs non valides entraînent une réponse HTTP 400. Si op-cache est également fourni, les deux en-têtes doivent spécifier le même mode. La mise en cache des réponses n’est pas prise en charge pour les requêtes en streaming.
readWrite, readOnly, writeOnly Alias compatible avec OpenPipe pour wandb-cache-mode. Il accepte les mêmes modes, et true équivaut à readWrite. Si les deux en-têtes sont fournis, ils doivent spécifier le même mode.
readWrite, readOnly, writeOnly, true Corps
Alias de tâche, alias@vN ou {provider}/{model-id}.
111 <= x <= 90071992547409911 <= x <= 9007199254740991