Serverless Inférence
Serverless Inférence donne accès à des modèles de fondation open source via W&B Weave et une API compatible OpenAI. Ce guide explique comment appeler Serverless Inférence depuis l’API et l’interface utilisateur de Weights & Biases, et comment tracer, évaluer et surveiller ces appels avec Weave. Avec Serverless Inférence, vous pouvez :- Développer des applications et des agents d’IA sans vous inscrire auprès d’un fournisseur d’hébergement ni héberger vous-même un modèle.
- Essayer les modèles pris en charge dans le Weave Playground.
Ce guide fournit les informations suivantes :
- Prérequis
- Spécification de l’API
- Exemples d’utilisation
- Interface utilisateur
- Informations d’utilisation et limites
- Erreurs de l’API
Prérequis
Avant de pouvoir accéder au service Serverless Inference via l’API ou l’interface utilisateur de Weights & Biases, vous devez disposer des éléments suivants :- Un compte CoreWeave Forge. Inscrivez-vous pour créer un compte.
- Une clé API. Créez une clé API dans les Paramètres utilisateur.
- Un projet Weights & Biases.
- Si vous utilisez le service d’Inférence via Python, consultez Prérequis supplémentaires pour utiliser l’API via Python.
Prérequis supplémentaires pour utiliser l’API avec Python
Pour utiliser l’API d’Inférence avec Python, commencez par satisfaire les prérequis généraux. Installez ensuite les bibliothèquesopenai et weave dans votre environnement local. La bibliothèque openai fournit le client compatible avec OpenAI qui vous permet d’appeler le point de terminaison d’Inférence, tandis que la bibliothèque weave vous permet de tracer et d’évaluer ces appels.
La bibliothèque
weave n’est requise que si vous utilisez Weave pour tracer vos applications LLM. Pour faire vos premiers pas avec Weave, consultez le Démarrage rapide de Weave.Pour découvrir comment utiliser le service Serverless Inference avec Weave, consultez les exemples d’utilisation de l’API.Spécification de l’API
Les sections suivantes fournissent la spécification de l’API ainsi que des exemples d’utilisation, afin que vous puissiez appeler le service d’Inférence par programmation depuis votre propre application ou vos scripts.Point de terminaison
Accédez au service d’Inférence via le point de terminaison suivant :Méthodes disponibles
Le service d’Inférence prend en charge les méthodes d’API suivantes :Complétions de chat
La principale méthode d’API disponible est/chat/completions, qui prend en charge les formats de requête compatibles avec OpenAI pour envoyer des messages à un modèle pris en charge et recevoir une complétion. Pour des exemples montrant comment utiliser le service Serverless Inference avec Weave, consultez les exemples d’utilisation de l’API.
Pour créer une complétion de chat, vous avez besoin des éléments suivants :
- L’URL de base du service d’Inférence
https://api.inference.wandb.ai/v1 - Votre clé API W&B
<your-api-key> - Les noms de votre entity et de votre projet W&B
<your-team>/<your-project> - L’ID du modèle que vous souhaitez utiliser, parmi les suivants :
meta-llama/Llama-3.1-8B-Instructdeepseek-ai/DeepSeek-V3-0324meta-llama/Llama-3.3-70B-Instructdeepseek-ai/DeepSeek-R1-0528meta-llama/Llama-4-Scout-17B-16E-Instructmicrosoft/Phi-4-mini-instruct
- Bash
- Python
Lister les modèles pris en charge
Utilisez l’API pour récupérer la liste de tous les modèles disponibles et leurs ID. Cela vous permet de sélectionner des modèles de manière dynamique ou de vérifier ce qui est disponible dans votre environnement.- Bash
- Python
Exemples d’utilisation
Les sections suivantes fournissent plusieurs exemples illustrant comment utiliser Serverless Inference avec Weave. Commencez par l’exemple de base pour tracer un seul appel de modèle, puis passez à l’exemple avancé pour évaluer et comparer plusieurs modèles.- Exemple de base : tracer Llama 3.1 8B avec Weave
- Exemple avancé : utiliser Weave Evaluations et les leaderboards avec le service d’Inférence
Exemple de base : tracer Llama 3.1 8B avec Weave
L’exemple de code Python suivant montre comment envoyer un prompt au modèle Llama 3.1 8B à l’aide de l’API Serverless Inference, puis tracer l’appel dans Weave. Le traçage vous permet de capturer l’entrée et la sortie complètes de l’appel LLM, de surveiller les performances et d’analyser les résultats dans l’interface de Weights & Biases. Dans cet exemple :- Vous définissez une fonction
run_chat, décorée avec@weave.op(), qui envoie une requête de complétion de chat à l’aide du client compatible avec OpenAI. - Weave enregistre vos traces et les associe à votre entity W&B et à votre projet
project="<your-team>/<your-project>". - Weave trace automatiquement la fonction et journalise ses entrées, ses sorties, sa latence et ses métadonnées (comme l’ID du modèle).
- Le résultat s’affiche dans le terminal, et la trace apparaît dans l’onglet Traces du projet spécifié sur Forge.
https://forge.coreweave.com/wandb/<your-team>/<your-project>/r/call/01977f8f-839d-7dda-b0c2-27292ef0e04g), ou procédez comme suit :
- Accédez à Forge.
- Sélectionnez l’onglet Traces pour afficher vos traces Weave.

Exemple avancé : utiliser Weave Evaluations et les leaderboards avec le service d’Inférence
Vous pouvez également utiliser Weave avec le service d’Inférence pour tracer les appels de modèle, évaluer les performances et publier un leaderboard. L’exemple de code Python suivant compare deux modèles sur un jeu de données de questions-réponses. Pour utiliser cet exemple, vous devez satisfaire aux prérequis généraux ainsi qu’aux prérequis supplémentaires pour utiliser l’API à l’aide de Python.- Accédez à l’onglet Traces pour consulter vos traces.
- Accédez à l’onglet Evals pour consulter les évaluations de vos modèles.
- Accédez à l’onglet Leaders pour consulter le leaderboard généré.


UI
Les sections suivantes expliquent comment utiliser le service d’Inférence depuis l’interface utilisateur de Weights & Biases. Avant d’accéder au service d’Inférence via l’interface utilisateur, assurez-vous de remplir les prérequis.Accéder au service d’Inférence
Vous pouvez accéder au service d’Inférence dans l’interface de Weights & Biases depuis les emplacements suivants :Lien direct
Accédez à https://forge.coreweave.com/inference.Depuis l’onglet Inference
- Accédez à votre compte CoreWeave Forge sur Forge.
- Dans la barre latérale gauche, sélectionnez Inference. Une page s’affiche avec les modèles disponibles et des informations sur chacun d’eux.

Depuis l’onglet Playground
- Dans la barre latérale gauche, sélectionnez Playground. L’interface de chat de Playground s’affiche.
- Dans la liste déroulante des LLM, survolez Serverless Inference. Une liste déroulante des modèles Serverless Inference disponibles s’affiche à droite.
- Depuis la liste déroulante des modèles Serverless Inference, vous pouvez :
- Cliquer sur le nom d’un modèle disponible pour l’essayer dans le Playground.
- Comparer un ou plusieurs modèles dans le Playground.

Tester un modèle dans le Playground
Après avoir sélectionné un modèle à l’aide de l’une des options d’accès, vous pouvez tester ce modèle dans le Playground. Les actions suivantes sont disponibles :- Personnaliser les réglages et les paramètres du modèle
- Ajouter, relancer, modifier et supprimer des messages
- Enregistrer et réutiliser un modèle avec des réglages personnalisés
- Comparer plusieurs modèles

Comparer plusieurs modèles
Vous pouvez comparer plusieurs modèles d’Inférence dans le Playground. La vue Compare est accessible depuis deux emplacements différents :- Accéder à la vue Compare depuis l’onglet Inference
- Accéder à la vue Compare depuis l’onglet Playground
Accéder à la vue Compare depuis l’onglet Inference
- Dans la barre latérale gauche, sélectionnez Inference. Une page présentant les modèles disponibles et leurs informations s’affiche.
- Pour sélectionner des modèles à comparer, cliquez n’importe où sur une carte de modèle (sauf sur le nom du modèle). La bordure de la carte passe en bleu pour indiquer qu’elle est sélectionnée.
- Répétez l’étape 2 pour chaque modèle que vous souhaitez comparer.
- Sur l’une des cartes sélectionnées, cliquez sur le bouton Compare N models in the Playground (
Ncorrespond au nombre de modèles comparés. Par exemple, si vous sélectionnez 3 modèles, le bouton affiche Compare 3 models in the Playground). La vue de comparaison s’ouvre.

Accéder à la vue Compare depuis l’onglet Playground
- Dans la barre latérale gauche, sélectionnez Playground. L’interface de chat du Playground s’affiche.
- Dans la liste déroulante des LLM, survolez Serverless Inference. Une liste déroulante des modèles Serverless Inference disponibles s’affiche à droite.
- Dans cette liste déroulante, sélectionnez Compare. L’onglet Inference s’affiche.
- Pour sélectionner les modèles à comparer, cliquez n’importe où sur la carte d’un modèle (sauf sur son nom). La bordure de la carte s’affiche en bleu pour indiquer qu’elle est sélectionnée.
- Répétez l’étape 4 pour chaque modèle que vous souhaitez comparer.
- Dans l’une des cartes sélectionnées, cliquez sur le bouton Compare N models in the Playground (
Ncorrespond au nombre de modèles que vous comparez. Par exemple, si vous sélectionnez 3 modèles, le bouton affiche Compare 3 models in the Playground). La vue de comparaison s’ouvre.
Consulter les informations de facturation et d’utilisation
Les administrateurs de l’organisation peuvent suivre le solde actuel de crédits d’Inférence, l’historique d’utilisation et la facturation à venir (le cas échéant) directement depuis l’interface de Weights & Biases :- Dans l’interface de Weights & Biases, accédez à la page Billing de W&B.
- La carte d’informations de facturation d’Inférence s’affiche dans le coin inférieur droit. Depuis cette carte, vous pouvez :
- Cliquer sur le bouton Voir l’utilisation de la carte d’informations de facturation d’Inférence pour consulter l’évolution de votre utilisation au fil du temps.
- Consulter vos prochains frais d’inférence, si vous disposez d’un forfait payant.
Informations d’utilisation et limites
Les sections suivantes présentent des informations importantes sur l’utilisation et les limites du service, notamment les restrictions géographiques, les limites de concurrence et la tarification. Prenez connaissance de ces informations avant d’utiliser le service.Restrictions géographiques
Le service d’Inférence n’est accessible que depuis les zones géographiques prises en charge. Pour plus d’informations, voir les Conditions d’utilisation.Limites de concurrence
Afin de garantir une utilisation équitable et des performances stables, l’API Serverless Inference applique des limites de débit au niveau de l’utilisateur et du projet. Ces limites permettent de :- Prévenir les abus et préserver la stabilité de l’API.
- Garantir l’accès à tous les utilisateurs.
- Gérer efficacement la charge de l’infrastructure.
429 Concurrency limit reached for requests. Pour résoudre cette erreur, réduisez le nombre de requêtes simultanées.