Skip to main content

Serverless Inférence

Serverless Inférence donne accès à des modèles de fondation open source via W&B Weave et une API compatible OpenAI. Ce guide explique comment appeler Serverless Inférence depuis l’API et l’interface utilisateur de Weights & Biases, et comment tracer, évaluer et surveiller ces appels avec Weave. Avec Serverless Inférence, vous pouvez :
  • Développer des applications et des agents d’IA sans vous inscrire auprès d’un fournisseur d’hébergement ni héberger vous-même un modèle.
  • Essayer les modèles pris en charge dans le Weave Playground.
Des crédits Serverless Inférence sont inclus pour une durée limitée avec les plans Free, Pro et Académique. La disponibilité peut varier pour Enterprise. Une fois les crédits épuisés :
  • Les comptes Free doivent passer au plan Pro pour continuer à utiliser Inférence.
  • Les utilisateurs du plan Pro sont facturés mensuellement pour les dépassements d’Inférence, selon la tarification propre à chaque modèle.
Pour en savoir plus, consultez la page de tarification et les coûts des modèles Serverless Inférence.
Avec Weave, vous pouvez tracer, évaluer, surveiller et faire évoluer vos applications reposant sur Serverless Inférence. Ce guide fournit les informations suivantes :

Prérequis

Avant de pouvoir accéder au service Serverless Inference via l’API ou l’interface utilisateur de Weights & Biases, vous devez disposer des éléments suivants :
  1. Un compte CoreWeave Forge. Inscrivez-vous pour créer un compte.
  2. Une clé API. Créez une clé API dans les Paramètres utilisateur.
  3. Un projet Weights & Biases.
  4. Si vous utilisez le service d’Inférence via Python, consultez Prérequis supplémentaires pour utiliser l’API via Python.

Prérequis supplémentaires pour utiliser l’API avec Python

Pour utiliser l’API d’Inférence avec Python, commencez par satisfaire les prérequis généraux. Installez ensuite les bibliothèques openai et weave dans votre environnement local. La bibliothèque openai fournit le client compatible avec OpenAI qui vous permet d’appeler le point de terminaison d’Inférence, tandis que la bibliothèque weave vous permet de tracer et d’évaluer ces appels.
La bibliothèque weave n’est requise que si vous utilisez Weave pour tracer vos applications LLM. Pour faire vos premiers pas avec Weave, consultez le Démarrage rapide de Weave.Pour découvrir comment utiliser le service Serverless Inference avec Weave, consultez les exemples d’utilisation de l’API.

Spécification de l’API

Les sections suivantes fournissent la spécification de l’API ainsi que des exemples d’utilisation, afin que vous puissiez appeler le service d’Inférence par programmation depuis votre propre application ou vos scripts.

Point de terminaison

Accédez au service d’Inférence via le point de terminaison suivant :
Pour accéder à ce point de terminaison, vous devez disposer d’un compte CoreWeave Forge doté de crédits alloués au service d’Inférence, d’une clé API valide, ainsi que d’un entity CoreWeave Forge (également appelé « équipe ») et d’un projet. Dans les exemples de code de ce guide, l’entity (équipe) et le projet sont désignés par <your-team>/<your-project>.

Méthodes disponibles

Le service d’Inférence prend en charge les méthodes d’API suivantes :

Complétions de chat

La principale méthode d’API disponible est /chat/completions, qui prend en charge les formats de requête compatibles avec OpenAI pour envoyer des messages à un modèle pris en charge et recevoir une complétion. Pour des exemples montrant comment utiliser le service Serverless Inference avec Weave, consultez les exemples d’utilisation de l’API. Pour créer une complétion de chat, vous avez besoin des éléments suivants :
  • L’URL de base du service d’Inférence https://api.inference.wandb.ai/v1
  • Votre clé API W&B <your-api-key>
  • Les noms de votre entity et de votre projet W&B <your-team>/<your-project>
  • L’ID du modèle que vous souhaitez utiliser, parmi les suivants :
    • meta-llama/Llama-3.1-8B-Instruct
    • deepseek-ai/DeepSeek-V3-0324
    • meta-llama/Llama-3.3-70B-Instruct
    • deepseek-ai/DeepSeek-R1-0528
    • meta-llama/Llama-4-Scout-17B-16E-Instruct
    • microsoft/Phi-4-mini-instruct

Lister les modèles pris en charge

Utilisez l’API pour récupérer la liste de tous les modèles disponibles et leurs ID. Cela vous permet de sélectionner des modèles de manière dynamique ou de vérifier ce qui est disponible dans votre environnement.

Exemples d’utilisation

Les sections suivantes fournissent plusieurs exemples illustrant comment utiliser Serverless Inference avec Weave. Commencez par l’exemple de base pour tracer un seul appel de modèle, puis passez à l’exemple avancé pour évaluer et comparer plusieurs modèles.

Exemple de base : tracer Llama 3.1 8B avec Weave

L’exemple de code Python suivant montre comment envoyer un prompt au modèle Llama 3.1 8B à l’aide de l’API Serverless Inference, puis tracer l’appel dans Weave. Le traçage vous permet de capturer l’entrée et la sortie complètes de l’appel LLM, de surveiller les performances et d’analyser les résultats dans l’interface de Weights & Biases.
En savoir plus sur le traçage dans Weave.
Dans cet exemple :
  • Vous définissez une fonction run_chat, décorée avec @weave.op(), qui envoie une requête de complétion de chat à l’aide du client compatible avec OpenAI.
  • Weave enregistre vos traces et les associe à votre entity W&B et à votre projet project="<your-team>/<your-project>".
  • Weave trace automatiquement la fonction et journalise ses entrées, ses sorties, sa latence et ses métadonnées (comme l’ID du modèle).
  • Le résultat s’affiche dans le terminal, et la trace apparaît dans l’onglet Traces du projet spécifié sur Forge.
Pour utiliser cet exemple, vous devez remplir les prérequis généraux ainsi que les prérequis supplémentaires pour utiliser l’API via Python.
Une fois l’exemple de code exécuté, la réponse du modèle s’affiche dans le terminal et l’appel est journalisé sous forme de trace Weave. Pour afficher la trace dans Weave, cliquez sur le lien affiché dans le terminal (par exemple, https://forge.coreweave.com/wandb/<your-team>/<your-project>/r/call/01977f8f-839d-7dda-b0c2-27292ef0e04g), ou procédez comme suit :
  1. Accédez à Forge.
  2. Sélectionnez l’onglet Traces pour afficher vos traces Weave.
Essayez ensuite l’exemple avancé pour évaluer et comparer plusieurs modèles.
Affichage des traces

Exemple avancé : utiliser Weave Evaluations et les leaderboards avec le service d’Inférence

Vous pouvez également utiliser Weave avec le service d’Inférence pour tracer les appels de modèle, évaluer les performances et publier un leaderboard. L’exemple de code Python suivant compare deux modèles sur un jeu de données de questions-réponses. Pour utiliser cet exemple, vous devez satisfaire aux prérequis généraux ainsi qu’aux prérequis supplémentaires pour utiliser l’API à l’aide de Python.
Après avoir exécuté l’exemple de code précédent, Weave publie dans votre projet Weights & Biases les résultats d’évaluation, les traces ainsi qu’un leaderboard comparant les deux modèles. Pour consulter les résultats publiés, accédez à votre compte CoreWeave Forge sur Forge, puis :
Consulter les évaluations de vos modèles
Consulter vos traces

UI

Les sections suivantes expliquent comment utiliser le service d’Inférence depuis l’interface utilisateur de Weights & Biases. Avant d’accéder au service d’Inférence via l’interface utilisateur, assurez-vous de remplir les prérequis.

Accéder au service d’Inférence

Vous pouvez accéder au service d’Inférence dans l’interface de Weights & Biases depuis les emplacements suivants : Accédez à https://forge.coreweave.com/inference.

Depuis l’onglet Inference

  1. Accédez à votre compte CoreWeave Forge sur Forge.
  2. Dans la barre latérale gauche, sélectionnez Inference. Une page s’affiche avec les modèles disponibles et des informations sur chacun d’eux.
L’onglet Inference

Depuis l’onglet Playground

  1. Dans la barre latérale gauche, sélectionnez Playground. L’interface de chat de Playground s’affiche.
  2. Dans la liste déroulante des LLM, survolez Serverless Inference. Une liste déroulante des modèles Serverless Inference disponibles s’affiche à droite.
  3. Depuis la liste déroulante des modèles Serverless Inference, vous pouvez :
La liste déroulante des modèles d’Inférence dans Playground

Tester un modèle dans le Playground

Après avoir sélectionné un modèle à l’aide de l’une des options d’accès, vous pouvez tester ce modèle dans le Playground. Les actions suivantes sont disponibles :
Utilisation d’un modèle d’Inférence dans le Playground

Comparer plusieurs modèles

Vous pouvez comparer plusieurs modèles d’Inférence dans le Playground. La vue Compare est accessible depuis deux emplacements différents :

Accéder à la vue Compare depuis l’onglet Inference

  1. Dans la barre latérale gauche, sélectionnez Inference. Une page présentant les modèles disponibles et leurs informations s’affiche.
  2. Pour sélectionner des modèles à comparer, cliquez n’importe où sur une carte de modèle (sauf sur le nom du modèle). La bordure de la carte passe en bleu pour indiquer qu’elle est sélectionnée.
  3. Répétez l’étape 2 pour chaque modèle que vous souhaitez comparer.
  4. Sur l’une des cartes sélectionnées, cliquez sur le bouton Compare N models in the Playground (N correspond au nombre de modèles comparés. Par exemple, si vous sélectionnez 3 modèles, le bouton affiche Compare 3 models in the Playground). La vue de comparaison s’ouvre.
Vous pouvez désormais comparer des modèles dans le Playground et utiliser toutes les fonctionnalités décrites dans Tester un modèle dans le Playground.
Sélectionner plusieurs modèles à comparer dans le Playground

Accéder à la vue Compare depuis l’onglet Playground

  1. Dans la barre latérale gauche, sélectionnez Playground. L’interface de chat du Playground s’affiche.
  2. Dans la liste déroulante des LLM, survolez Serverless Inference. Une liste déroulante des modèles Serverless Inference disponibles s’affiche à droite.
  3. Dans cette liste déroulante, sélectionnez Compare. L’onglet Inference s’affiche.
  4. Pour sélectionner les modèles à comparer, cliquez n’importe où sur la carte d’un modèle (sauf sur son nom). La bordure de la carte s’affiche en bleu pour indiquer qu’elle est sélectionnée.
  5. Répétez l’étape 4 pour chaque modèle que vous souhaitez comparer.
  6. Dans l’une des cartes sélectionnées, cliquez sur le bouton Compare N models in the Playground (N correspond au nombre de modèles que vous comparez. Par exemple, si vous sélectionnez 3 modèles, le bouton affiche Compare 3 models in the Playground). La vue de comparaison s’ouvre.
Vous pouvez désormais comparer des modèles dans le Playground et utiliser toutes les fonctionnalités décrites dans Tester un modèle dans le Playground.

Consulter les informations de facturation et d’utilisation

Les administrateurs de l’organisation peuvent suivre le solde actuel de crédits d’Inférence, l’historique d’utilisation et la facturation à venir (le cas échéant) directement depuis l’interface de Weights & Biases :
  1. Dans l’interface de Weights & Biases, accédez à la page Billing de W&B.
  2. La carte d’informations de facturation d’Inférence s’affiche dans le coin inférieur droit. Depuis cette carte, vous pouvez :
    • Cliquer sur le bouton Voir l’utilisation de la carte d’informations de facturation d’Inférence pour consulter l’évolution de votre utilisation au fil du temps.
    • Consulter vos prochains frais d’inférence, si vous disposez d’un forfait payant.

Informations d’utilisation et limites

Les sections suivantes présentent des informations importantes sur l’utilisation et les limites du service, notamment les restrictions géographiques, les limites de concurrence et la tarification. Prenez connaissance de ces informations avant d’utiliser le service.

Restrictions géographiques

Le service d’Inférence n’est accessible que depuis les zones géographiques prises en charge. Pour plus d’informations, voir les Conditions d’utilisation.

Limites de concurrence

Afin de garantir une utilisation équitable et des performances stables, l’API Serverless Inference applique des limites de débit au niveau de l’utilisateur et du projet. Ces limites permettent de :
  • Prévenir les abus et préserver la stabilité de l’API.
  • Garantir l’accès à tous les utilisateurs.
  • Gérer efficacement la charge de l’infrastructure.
En cas de dépassement d’une limite de débit, l’API renvoie une réponse 429 Concurrency limit reached for requests. Pour résoudre cette erreur, réduisez le nombre de requêtes simultanées.

Tarification

Pour en savoir plus sur la tarification des modèles, consultez la page https://wandb.ai/site/pricing/inference.

Erreurs de l’API

Le tableau suivant répertorie les erreurs que l’API d’Inférence peut renvoyer, ainsi que leurs causes et les solutions recommandées.
Dernière modification le 30 septembre 2026