> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Serverless Inference

> Utilisez Serverless Inference avec Weave pour tracer et surveiller les appels de modèles de fondation open source via l’API compatible avec OpenAI.

<h1 id="serverless-inference">
  Serverless Inférence
</h1>

*Serverless Inférence* donne accès à des modèles de fondation open source via W\&B Weave et une API compatible OpenAI. Ce guide explique comment appeler Serverless Inférence depuis l’API et l’interface utilisateur de Weights & Biases, et comment tracer, évaluer et surveiller ces appels avec Weave. Avec Serverless Inférence, vous pouvez :

* Développer des applications et des agents d’IA sans vous inscrire auprès d’un fournisseur d’hébergement ni héberger vous-même un modèle.
* Essayer les modèles pris en charge dans le Weave Playground.

<Warning>
  Des crédits Serverless Inférence sont inclus pour une durée limitée avec les plans Free, Pro et Académique. La disponibilité peut varier pour Enterprise. Une fois les crédits épuisés :

  * Les comptes Free doivent passer au plan Pro pour continuer à utiliser Inférence.
  * Les utilisateurs du plan Pro sont facturés mensuellement pour les dépassements d’Inférence, selon la tarification propre à chaque modèle.

  Pour en savoir plus, consultez la [page de tarification](https://coreweave.com/forge-pricing) et les [coûts des modèles Serverless Inférence](https://wandb.ai/site/pricing/inference).
</Warning>

Avec Weave, vous pouvez tracer, évaluer, surveiller et faire évoluer vos applications reposant sur Serverless Inférence.

| Modèle | ID du modèle (pour l’utilisation de l’API) | Types | Fenêtre de contexte | Paramètres | Description |
| - | - | - | - | - | - |
| DeepSeek R1-0528 | deepseek-ai/DeepSeek-R1-0528 | Texte | 161K | 37B - 680B (actifs - total) | Optimisé pour les tâches de raisonnement précis, notamment le codage complexe, les mathématiques et l’analyse de documents structurés. |
| DeepSeek V3-0324 | deepseek-ai/DeepSeek-V3-0324 | Texte | 161K | 37B - 680B (actifs - total) | Modèle Mixture-of-Experts robuste, conçu pour le traitement du langage à haute complexité et l’analyse approfondie de documents. |
| Llama 3.1 8B | meta-llama/Llama-3.1-8B-Instruct | Texte | 128K | 8B (total) | Modèle conversationnel efficace, optimisé pour des interactions de chatbot multilingues réactives. |
| Llama 3.3 70B | meta-llama/Llama-3.3-70B-Instruct | Texte | 128K | 70B (total) | Modèle multilingue excellant dans les tâches conversationnelles, le suivi d’instructions détaillées et le codage. |
| Llama 4 Scout | meta-llama/Llama-4-Scout-17B-16E-Instruct | Texte, vision | 64K | 17B - 109B (actifs - total) | Modèle multimodal combinant la compréhension du texte et des images, idéal pour les tâches visuelles et l’analyse combinée. |
| Phi 4 Mini | microsoft/Phi-4-mini-instruct | Texte | 128K | 3.8B (actifs - total) | Modèle compact et efficace, idéal pour des réponses rapides dans des environnements aux ressources limitées. |

Ce guide fournit les informations suivantes :

* [Prérequis](#prerequisites)
  * [Prérequis supplémentaires pour utiliser l’API via Python](#additional-prerequisites-for-using-the-api-via-python)
* [Spécification de l’API](#api-specification)
  * [Point de terminaison](#endpoint)
  * [Méthodes disponibles](#available-methods)
    * [Complétions de chat](#chat-completions)
    * [Lister les modèles pris en charge](#list-supported-models)
* [Exemples d’utilisation](#usage-examples)
* [Interface utilisateur](#ui)
  * [Accéder au service d’Inférence](#access-the-inference-service)
  * [Tester un modèle dans le Playground](#try-a-model-in-the-playground)
  * [Comparer plusieurs modèles](#compare-multiple-models)
  * [Consulter les informations de facturation et d’utilisation](#view-billing-and-usage-information)
* [Informations d’utilisation et limites](#usage-information-and-limits)
* [Erreurs de l’API](#api-errors)

<h2 id="prerequisites">
  Prérequis
</h2>

Avant de pouvoir accéder au service Serverless Inference via l’API ou l’interface utilisateur de Weights & Biases, vous devez disposer des éléments suivants :

1. Un compte CoreWeave Forge. [Inscrivez-vous pour créer un compte](https://id.coreweave.com/signup).
2. Une clé API. Créez une clé API dans les [Paramètres utilisateur](https://forge.coreweave.com/settings).
3. Un projet Weights & Biases.
4. Si vous utilisez le service d’Inférence via Python, consultez [Prérequis supplémentaires pour utiliser l’API via Python](#additional-prerequisites-for-using-the-api-via-python).

<h3 id="additional-prerequisites-for-using-the-api-via-python">
  Prérequis supplémentaires pour utiliser l’API avec Python
</h3>

Pour utiliser l’API d’Inférence avec Python, commencez par satisfaire les prérequis généraux. Installez ensuite les bibliothèques `openai` et `weave` dans votre environnement local. La bibliothèque `openai` fournit le client compatible avec OpenAI qui vous permet d’appeler le point de terminaison d’Inférence, tandis que la bibliothèque `weave` vous permet de tracer et d’évaluer ces appels.

```bash theme={"system"}
pip install openai weave
```

<Note>
  La bibliothèque `weave` n’est requise que si vous utilisez Weave pour tracer vos applications LLM. Pour faire vos premiers pas avec Weave, consultez le [Démarrage rapide de Weave](/fr/products/wandb/weave/quickstart).

  Pour découvrir comment utiliser le service Serverless Inference avec Weave, consultez les [exemples d’utilisation de l’API](#usage-examples).
</Note>

<h2 id="api-specification">
  Spécification de l’API
</h2>

Les sections suivantes fournissent la spécification de l’API ainsi que des exemples d’utilisation, afin que vous puissiez appeler le service d’Inférence par programmation depuis votre propre application ou vos scripts.

* [Point de terminaison](#endpoint)
* [Méthodes disponibles](#available-methods)
* [Exemples d’utilisation](#usage-examples)

<h3 id="endpoint">
  Point de terminaison
</h3>

Accédez au service d’Inférence via le point de terminaison suivant :

```plaintext theme={"system"}
https://api.inference.wandb.ai/v1
```

<Warning>
  Pour accéder à ce point de terminaison, vous devez disposer d’un compte CoreWeave Forge doté de crédits alloués au service d’Inférence, d’une clé API valide, ainsi que d’un entity CoreWeave Forge (également appelé « équipe ») et d’un projet. Dans les exemples de code de ce guide, l’entity (équipe) et le projet sont désignés par `<your-team>/<your-project>`.
</Warning>

<h3 id="available-methods">
  Méthodes disponibles
</h3>

Le service d’Inférence prend en charge les méthodes d’API suivantes :

* [Complétions de chat](#chat-completions)
* [Lister les modèles pris en charge](#list-supported-models)

<h4 id="chat-completions">
  Complétions de chat
</h4>

La principale méthode d’API disponible est `/chat/completions`, qui prend en charge les formats de requête compatibles avec OpenAI pour envoyer des messages à un modèle pris en charge et recevoir une complétion. Pour des exemples montrant comment utiliser le service Serverless Inference avec Weave, consultez les [exemples d’utilisation de l’API](#usage-examples).

Pour créer une complétion de chat, vous avez besoin des éléments suivants :

* L’URL de base du service d’Inférence `https://api.inference.wandb.ai/v1`
* Votre clé API W\&B `<your-api-key>`
* Les noms de votre entity et de votre projet W\&B `<your-team>/<your-project>`
* L’ID du modèle que vous souhaitez utiliser, parmi les suivants :
  * `meta-llama/Llama-3.1-8B-Instruct`
  * `deepseek-ai/DeepSeek-V3-0324`
  * `meta-llama/Llama-3.3-70B-Instruct`
  * `deepseek-ai/DeepSeek-R1-0528`
  * `meta-llama/Llama-4-Scout-17B-16E-Instruct`
  * `microsoft/Phi-4-mini-instruct`

<Tabs>
  <Tab title="Bash">
    ```bash theme={"system"}
    curl https://api.inference.wandb.ai/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer <your-api-key>" \
      -H "OpenAI-Project: <your-team>/<your-project>" \
      -d '{
        "model": "<model-id>",
        "messages": [
          { "role": "system", "content": "You are a helpful assistant." },
          { "role": "user", "content": "Tell me a joke." }
        ]
      }'
    ```
  </Tab>

  <Tab title="Python">
    ```python lines theme={"system"}
    import openai

    client = openai.OpenAI(
        # L’URL de base personnalisée pointe vers Serverless Inference
        base_url='https://api.inference.wandb.ai/v1',

        # Créez une clé API sur https://forge.coreweave.com/settings
        # Pour plus de sécurité, il est préférable de la définir dans l’environnement via OPENAI_API_KEY
        api_key="<your-api-key>",

        # L’équipe et le projet sont requis pour le suivi de l’utilisation
        project="<your-team>/<your-project>",
    )

    # Remplacez <model-id> par l’une des valeurs suivantes :
    # meta-llama/Llama-3.1-8B-Instruct
    # deepseek-ai/DeepSeek-V3-0324
    # meta-llama/Llama-3.3-70B-Instruct
    # deepseek-ai/DeepSeek-R1-0528
    # meta-llama/Llama-4-Scout-17B-16E-Instruct
    # microsoft/Phi-4-mini-instruct

    response = client.chat.completions.create(
        model="<model-id>",
        messages=[
            {"role": "system", "content": "<your-system-prompt>"},
            {"role": "user", "content": "<your-prompt>"}
        ],
    )

    print(response.choices[0].message.content)
    ```
  </Tab>
</Tabs>

<h4 id="list-supported-models">
  Lister les modèles pris en charge
</h4>

Utilisez l’API pour récupérer la liste de tous les modèles disponibles et leurs ID. Cela vous permet de sélectionner des modèles de manière dynamique ou de vérifier ce qui est disponible dans votre environnement.

<Tabs>
  <Tab title="Bash">
    ```bash theme={"system"}
    curl https://api.inference.wandb.ai/v1/models \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer <your-api-key>" \
      -H "OpenAI-Project: <your-team>/<your-project>" \
    ```
  </Tab>

  <Tab title="Python">
    ```python lines theme={"system"}
    import openai

    client = openai.OpenAI(
        base_url="https://api.inference.wandb.ai/v1",
        api_key="<your-api-key>",
        project="<your-team>/<your-project>"
    )

    response = client.models.list()

    for model in response.data:
        print(model.id)
    ```
  </Tab>
</Tabs>

<h2 id="usage-examples">
  Exemples d'utilisation
</h2>

Les sections suivantes fournissent plusieurs exemples illustrant comment utiliser Serverless Inference avec Weave. Commencez par l’exemple de base pour tracer un seul appel de modèle, puis passez à l’exemple avancé pour évaluer et comparer plusieurs modèles.

* [Exemple de base : tracer Llama 3.1 8B avec Weave](#basic-example-trace-llama-31-8b-with-weave)
* [Exemple avancé : utiliser Weave Evaluations et les leaderboards avec le service d’Inférence](#advanced-example-use-weave-evaluations-and-leaderboards-with-the-inference-service)

<h3 id="basic-example-trace-llama-31-8b-with-weave">
  Exemple de base : tracer Llama 3.1 8B avec Weave
</h3>

L’exemple de code Python suivant montre comment envoyer un prompt au modèle **Llama 3.1 8B** à l’aide de l’API Serverless Inference, puis tracer l’appel dans Weave. Le traçage vous permet de capturer l’entrée et la sortie complètes de l’appel LLM, de surveiller les performances et d’analyser les résultats dans l’interface de Weights & Biases.

<Tip>
  En savoir plus sur le [traçage dans Weave](/fr/products/wandb/weave/guides/tracking/tracing).
</Tip>

Dans cet exemple :

* Vous définissez une fonction `run_chat`, décorée avec `@weave.op()`, qui envoie une requête de complétion de chat à l’aide du client compatible avec OpenAI.
* Weave enregistre vos traces et les associe à votre entity W\&B et à votre projet `project="<your-team>/<your-project>"`.
* Weave trace automatiquement la fonction et journalise ses entrées, ses sorties, sa latence et ses métadonnées (comme l’ID du modèle).
* Le résultat s’affiche dans le terminal, et la trace apparaît dans l’onglet **Traces** du projet spécifié sur [Forge](https://forge.coreweave.com/wandb).

Pour utiliser cet exemple, vous devez remplir les [prérequis généraux](#prerequisites) ainsi que les [prérequis supplémentaires pour utiliser l’API via Python](#additional-prerequisites-for-using-the-api-via-python).

```python lines theme={"system"}
import weave
import openai

# Définir l’équipe et le projet Weave pour le traçage
weave.init("<your-team>/<your-project>")

client = openai.OpenAI(
    base_url='https://api.inference.wandb.ai/v1',

    # Créer une clé API sur https://forge.coreweave.com/settings
    api_key="<your-api-key>",

    # Requis pour le suivi de l’utilisation de W&B Inference
    project="wandb/inference-demo",
)

# Tracer l’appel de modèle dans Weave
@weave.op()
def run_chat():
    response = client.chat.completions.create(
        model="meta-llama/Llama-3.1-8B-Instruct",
        messages=[
            {"role": "system", "content": "You are a helpful assistant."},
            {"role": "user", "content": "Tell me a joke."}
        ],
    )
    return response.choices[0].message.content

# Exécuter et journaliser l’appel tracé
output = run_chat()
print(output)
```

Une fois l’exemple de code exécuté, la réponse du modèle s’affiche dans le terminal et l’appel est journalisé sous forme de trace Weave. Pour afficher la trace dans Weave, cliquez sur le lien affiché dans le terminal (par exemple, `https://forge.coreweave.com/wandb/<your-team>/<your-project>/r/call/01977f8f-839d-7dda-b0c2-27292ef0e04g`), ou procédez comme suit :

1. Accédez à [Forge](https://forge.coreweave.com/wandb).
2. Sélectionnez l’onglet **Traces** pour afficher vos traces Weave.

Essayez ensuite l’[exemple avancé](#advanced-example-use-weave-evaluations-and-leaderboards-with-the-inference-service) pour évaluer et comparer plusieurs modèles.

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/weave/_media/image.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=e62dbcb98b9c4d5f219a59502d0525ce" alt="Affichage des traces" width="2912" height="1194" data-path="products/wandb/weave/_media/image.png" />
</Frame>

<h3 id="advanced-example-use-weave-evaluations-and-leaderboards-with-the-inference-service">
  Exemple avancé : utiliser Weave Evaluations et les leaderboards avec le service d’Inférence
</h3>

Vous pouvez également utiliser Weave avec le service d’Inférence pour [tracer les appels de modèle](/fr/products/wandb/weave/guides/tracking/tracing), [évaluer les performances](/fr/products/wandb/weave/guides/core-types/evaluations) et [publier un leaderboard](/fr/products/wandb/weave/guides/core-types/leaderboards). L’exemple de code Python suivant compare deux modèles sur un jeu de données de questions-réponses.

Pour utiliser cet exemple, vous devez satisfaire aux [prérequis généraux](#prerequisites) ainsi qu’aux [prérequis supplémentaires pour utiliser l’API à l’aide de Python](#additional-prerequisites-for-using-the-api-via-python).

```python lines theme={"system"}
import os
import asyncio
import openai
import weave
from weave.flow import leaderboard
from weave.trace.ref_util import get_ref

# Définir l’équipe et le projet Weave pour le traçage
weave.init("<your-team>/<your-project>")

dataset = [
    {"input": "What is 2 + 2?", "target": "4"},
    {"input": "Name a primary color.", "target": "red"},
]

@weave.op
def exact_match(target: str, output: str) -> float:
    return float(target.strip().lower() == output.strip().lower())

class WBInferenceModel(weave.Model):
    model: str

    @weave.op
    def predict(self, prompt: str) -> str:
        client = openai.OpenAI(
            base_url="https://api.inference.wandb.ai/v1",
            # Créez une clé API sur https://forge.coreweave.com/settings
            api_key="<your-api-key>",
            # Requis pour le suivi de l’utilisation de W&B Inference
            project="<your-team>/<your-project>",
        )
        resp = client.chat.completions.create(
            model=self.model,
            messages=[{"role": "user", "content": prompt}],
        )
        return resp.choices[0].message.content

llama = WBInferenceModel(model="meta-llama/Llama-3.1-8B-Instruct")
deepseek = WBInferenceModel(model="deepseek-ai/DeepSeek-V3-0324")

def preprocess_model_input(example):
    return {"prompt": example["input"]}

evaluation = weave.Evaluation(
    name="QA",
    dataset=dataset,
    scorers=[exact_match],
    preprocess_model_input=preprocess_model_input,
)

async def run_eval():
    await evaluation.evaluate(llama)
    await evaluation.evaluate(deepseek)

asyncio.run(run_eval())

spec = leaderboard.Leaderboard(
    name="Inference Leaderboard",
    description="Compare models on a QA dataset",
    columns=[
        leaderboard.LeaderboardColumn(
            evaluation_object_ref=get_ref(evaluation).uri(),
            scorer_name="exact_match",
            summary_metric_path="mean",
        )
    ],
)

weave.publish(spec)
```

Après avoir exécuté l’exemple de code précédent, Weave publie dans votre projet Weights & Biases les résultats d’évaluation, les traces ainsi qu’un leaderboard comparant les deux modèles. Pour consulter les résultats publiés, accédez à votre compte CoreWeave Forge sur [Forge](https://forge.coreweave.com/wandb), puis :

* Accédez à l’onglet **Traces** pour [consulter vos traces](/fr/products/wandb/weave/guides/tracking/tracing).
* Accédez à l’onglet **Evals** pour [consulter les évaluations de vos modèles](/fr/products/wandb/weave/guides/core-types/evaluations).
* Accédez à l’onglet **Leaders** pour [consulter le leaderboard généré](/fr/products/wandb/weave/guides/core-types/leaderboards).

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/weave/_media/inference-advanced-evals.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=e061ec7b108e3c11c3f3e7317efbb88a" alt="Consulter les évaluations de vos modèles" width="2912" height="1194" data-path="products/wandb/weave/_media/inference-advanced-evals.png" />
</Frame>

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/weave/_media/inference-advanced-leaderboard.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=684b9ee5f6caa5f29001ef6879a8a3a4" alt="Consulter vos traces" width="2912" height="1194" data-path="products/wandb/weave/_media/inference-advanced-leaderboard.png" />
</Frame>

<h2 id="ui">
  UI
</h2>

Les sections suivantes expliquent comment utiliser le service d’Inférence depuis l’interface utilisateur de Weights & Biases. Avant d’accéder au service d’Inférence via l’interface utilisateur, assurez-vous de remplir les [prérequis](#prerequisites).

<h3 id="access-the-inference-service">
  Accéder au service d’Inférence
</h3>

Vous pouvez accéder au service d’Inférence dans l’interface de Weights & Biases depuis les emplacements suivants :

* [Lien direct](#direct-link)
* [Depuis l’onglet Inference](#from-the-inference-tab)
* [Depuis l’onglet Playground](#from-the-playground-tab)

<h4 id="direct-link">
  Lien direct
</h4>

Accédez à [https://forge.coreweave.com/inference](https://forge.coreweave.com/inference).

<h4 id="from-the-inference-tab">
  Depuis l’onglet Inference
</h4>

1. Accédez à votre compte CoreWeave Forge sur [Forge](https://forge.coreweave.com/wandb).
2. Dans la barre latérale gauche, sélectionnez **Inference**. Une page s’affiche avec les modèles disponibles et des informations sur chacun d’eux.

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/weave/_media/inference-ui.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=e0c2c250b24d34d8a30b051c218f31e1" alt="L’onglet Inference" width="2414" height="1240" data-path="products/wandb/weave/_media/inference-ui.png" />
</Frame>

<h4 id="from-the-playground-tab">
  Depuis l’onglet Playground
</h4>

1. Dans la barre latérale gauche, sélectionnez **Playground**. L’interface de chat de Playground s’affiche.
2. Dans la liste déroulante des LLM, survolez **Serverless Inference**. Une liste déroulante des modèles Serverless Inference disponibles s’affiche à droite.
3. Depuis la liste déroulante des modèles Serverless Inference, vous pouvez :
   * Cliquer sur le nom d’un modèle disponible pour [l’essayer dans le Playground](#try-a-model-in-the-playground).
   * [Comparer un ou plusieurs modèles dans le Playground](#compare-multiple-models).

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/weave/_media/inference-playground.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=fb4a720587be9f394a3412359035a455" alt="La liste déroulante des modèles d’Inférence dans Playground" width="2912" height="1240" data-path="products/wandb/weave/_media/inference-playground.png" />
</Frame>

<h3 id="try-a-model-in-the-playground">
  Tester un modèle dans le Playground
</h3>

Après avoir [sélectionné un modèle à l’aide de l’une des options d’accès](#access-the-inference-service), vous pouvez tester ce modèle dans le Playground. Les actions suivantes sont disponibles :

* [Personnaliser les réglages et les paramètres du modèle](/fr/products/wandb/weave/guides/tools/playground#customize-settings)
* [Ajouter, relancer, modifier et supprimer des messages](/fr/products/wandb/weave/guides/tools/playground#message-controls)
* [Enregistrer et réutiliser un modèle avec des réglages personnalisés](/fr/products/wandb/weave/guides/tools/playground#saved-models)
* [Comparer plusieurs modèles](#compare-multiple-models)

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/weave/_media/inference-playground-single.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=0538245f8e737d2e1673073bce9a138a" alt="Utilisation d’un modèle d’Inférence dans le Playground" width="1706" height="1240" data-path="products/wandb/weave/_media/inference-playground-single.png" />
</Frame>

<h3 id="compare-multiple-models">
  Comparer plusieurs modèles
</h3>

Vous pouvez comparer plusieurs modèles d’Inférence dans le Playground. La vue Compare est accessible depuis deux emplacements différents :

* [Accéder à la vue Compare depuis l’onglet Inference](#access-the-compare-view-from-the-inference-tab)
* [Accéder à la vue Compare depuis l’onglet Playground](#access-the-compare-view-from-the-playground-tab)

<h4 id="access-the-compare-view-from-the-inference-tab">
  Accéder à la vue Compare depuis l’onglet Inference
</h4>

1. Dans la barre latérale gauche, sélectionnez **Inference**. Une page présentant les modèles disponibles et leurs informations s’affiche.
2. Pour sélectionner des modèles à comparer, cliquez n’importe où sur une carte de modèle (sauf sur le nom du modèle). La bordure de la carte passe en bleu pour indiquer qu’elle est sélectionnée.
3. Répétez l’étape 2 pour chaque modèle que vous souhaitez comparer.
4. Sur l’une des cartes sélectionnées, cliquez sur le bouton **Compare N models in the Playground** (`N` correspond au nombre de modèles comparés. Par exemple, si vous sélectionnez 3 modèles, le bouton affiche **Compare 3 models in the Playground**). La vue de comparaison s’ouvre.

Vous pouvez désormais comparer des modèles dans le Playground et utiliser toutes les fonctionnalités décrites dans [Tester un modèle dans le Playground](#try-a-model-in-the-playground).

<Frame>
  <img src="https://mintcdn.com/coreweave-dbfa0e8d/3Dv_sw2eg8feUJlx/products/wandb/weave/_media/inference-playground-compare.png?fit=max&auto=format&n=3Dv_sw2eg8feUJlx&q=85&s=4b1de6f67c713c26d7ac0eeaa3bc84ee" alt="Sélectionner plusieurs modèles à comparer dans le Playground" width="2114" height="1240" data-path="products/wandb/weave/_media/inference-playground-compare.png" />
</Frame>

<h4 id="access-the-compare-view-from-the-playground-tab">
  Accéder à la vue Compare depuis l’onglet Playground
</h4>

1. Dans la barre latérale gauche, sélectionnez **Playground**. L’interface de chat du Playground s’affiche.
2. Dans la liste déroulante des LLM, survolez **Serverless Inference**. Une liste déroulante des modèles Serverless Inference disponibles s’affiche à droite.
3. Dans cette liste déroulante, sélectionnez **Compare**. L’onglet **Inference** s’affiche.
4. Pour sélectionner les modèles à comparer, cliquez n’importe où sur la carte d’un modèle (sauf sur son nom). La bordure de la carte s’affiche en bleu pour indiquer qu’elle est sélectionnée.
5. Répétez l’étape 4 pour chaque modèle que vous souhaitez comparer.
6. Dans l’une des cartes sélectionnées, cliquez sur le bouton **Compare N models in the Playground** (`N` correspond au nombre de modèles que vous comparez. Par exemple, si vous sélectionnez 3 modèles, le bouton affiche **Compare 3 models in the Playground**). La vue de comparaison s’ouvre.

Vous pouvez désormais comparer des modèles dans le Playground et utiliser toutes les fonctionnalités décrites dans [Tester un modèle dans le Playground](#try-a-model-in-the-playground).

<h3 id="view-billing-and-usage-information">
  Consulter les informations de facturation et d’utilisation
</h3>

Les administrateurs de l’organisation peuvent suivre le solde actuel de crédits d’Inférence, l’historique d’utilisation et la facturation à venir (le cas échéant) directement depuis l’interface de Weights & Biases :

1. Dans l’interface de Weights & Biases, accédez à la page **Billing** de W\&B.
2. La carte d’informations de facturation d’Inférence s’affiche dans le coin inférieur droit. Depuis cette carte, vous pouvez :
   * Cliquer sur le bouton **Voir l’utilisation** de la carte d’informations de facturation d’Inférence pour consulter l’évolution de votre utilisation au fil du temps.
   * Consulter vos prochains frais d’inférence, si vous disposez d’un forfait payant.

<Tip>
  Consultez la [page de tarification d’Inférence pour le détail des tarifs par modèle](https://wandb.ai/site/pricing/inference).
</Tip>

<h2 id="usage-information-and-limits">
  Informations d’utilisation et limites
</h2>

Les sections suivantes présentent des informations importantes sur l’utilisation et les limites du service, notamment les restrictions géographiques, les limites de concurrence et la tarification. Prenez connaissance de ces informations avant d’utiliser le service.

<h3 id="geographic-restrictions">
  Restrictions géographiques
</h3>

Le service d’Inférence n’est accessible que depuis les zones géographiques prises en charge. Pour plus d'informations, voir les [Conditions d’utilisation](/policies/terms-of-service/terms-of-use#geographic-restrictions).

<h3 id="concurrency-limits">
  Limites de concurrence
</h3>

Afin de garantir une utilisation équitable et des performances stables, l’API Serverless Inference applique des limites de débit au niveau de l’utilisateur et du projet. Ces limites permettent de :

* Prévenir les abus et préserver la stabilité de l’API.
* Garantir l’accès à tous les utilisateurs.
* Gérer efficacement la charge de l’infrastructure.

En cas de dépassement d’une limite de débit, l’API renvoie une réponse `429 Concurrency limit reached for requests`. Pour résoudre cette erreur, réduisez le nombre de requêtes simultanées.

<h3 id="pricing">
  Tarification
</h3>

Pour en savoir plus sur la tarification des modèles, consultez la page [https://wandb.ai/site/pricing/inference](https://wandb.ai/site/pricing/inference).

<h2 id="api-errors">
  Erreurs de l’API
</h2>

Le tableau suivant répertorie les erreurs que l’API d’Inférence peut renvoyer, ainsi que leurs causes et les solutions recommandées.

| Code d’erreur | Message | Cause | Solution |
| - | - | - | - |
| 401 | Invalid Authentication | Identifiants d’authentification non valides, ou entity ou nom de votre projet Weights & Biases incorrects. | Vérifiez que vous utilisez la bonne clé API, ou que le nom et l’entity de votre projet Weights & Biases sont corrects. |
| 403 | Country, region, or territory not supported | Accès à l’API depuis un emplacement non pris en charge. | Voir [Restrictions géographiques](#geographic-restrictions). |
| 429 | Concurrency limit reached for requests | Trop de requêtes simultanées. | Réduisez le nombre de requêtes simultanées. |
| 429 | You exceeded your current quota, please check your plan and billing details | Crédits épuisés ou plafond mensuel de dépenses atteint. | Achetez des crédits supplémentaires ou augmentez vos limites. |
| 500 | The server had an error while processing your request | Erreur interne du serveur. | Réessayez après quelques instants et contactez l’assistance si le problème persiste. |
| 503 | The engine is currently overloaded, please try again later | Le serveur subit un trafic élevé. | Renvoyez votre requête après un court délai. |


## Related topics

- [Serverless Inférence](/fr/products/inference/serverless.md)
