> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Utiliser Serverless LoRA Inference

> Utilisez votre propre LoRA personnalisé pour servir des modèles affinés sur Serverless Inference.


Cette page explique comment servir vos propres adaptateurs LoRA personnalisés sur W\&B Serverless Inference. Elle s’adresse aux développeurs et aux professionnels du ML qui souhaitent déployer des variantes affinées de modèles de base pris en charge sans avoir à gérer d’infrastructure.

LoRA (Low-Rank Adaptation) vous permet de personnaliser de grands modèles de langage en n’entraînant et en ne stockant qu’un module complémentaire léger, plutôt qu’un nouveau modèle complet. La personnalisation s’en trouve allégée et moins coûteuse.

Vous pouvez entraîner ou téléverser un LoRA pour doter un modèle de base de nouvelles capacités, par exemple pour le spécialiser dans l’assistance client, l’écriture créative ou un domaine technique précis. Vous adaptez ainsi le comportement du modèle sans avoir à le réentraîner ni à le redéployer entièrement.

<h2 id="why-use-serverless-inference-for-loras">
  Pourquoi utiliser Serverless Inference pour les LoRA
</h2>

Serverless Inference pour les LoRA offre les avantages suivants :

* Téléversez une seule fois, puis déployez sans avoir à gérer de serveurs.
* Suivez la version en production grâce à la gestion des versions des artifacts.
* Mettez à jour vos modèles en remplaçant de petits fichiers LoRA plutôt que l’intégralité des poids du modèle.

<h2 id="workflow">
  Flux de travail
</h2>

Dans les grandes lignes, la mise à disposition d’un LoRA personnalisé se déroule en trois étapes :

1. Téléversez vos poids LoRA sous forme d’artifact W\&B.
2. Indiquez l’URI de l’artifact comme nom de modèle dans l’API.
3. W\&B charge dynamiquement vos poids pour l’inférence.

L’exemple suivant montre comment appeler votre modèle LoRA personnalisé avec Serverless Inference. Les sections suivantes expliquent comment téléverser ou entraîner le LoRA utilisé ici.

```python theme={"system"}
from openai import OpenAI

model_name = f"wandb-artifact:///{WB_TEAM}/{WB_PROJECT}/qwen_lora:latest"

client = OpenAI(
    base_url="https://api.inference.wandb.ai/v1",
    api_key=API_KEY,
    project=f"{WB_TEAM}/{WB_PROJECT}",
)

resp = client.chat.completions.create(
    model=model_name,
    messages=[{"role": "user", "content": "Say 'Hello World!'"}],
)
print(resp.choices[0].message.content)
```

Consultez ce [notebook de prise en main](https://wandb.me/lora_nb) pour une démonstration interactive de la création d’un LoRA et de son téléversement dans W\&B en tant qu’artifact.

<h2 id="prerequisites">
  Prérequis
</h2>

Vous devez disposer des éléments suivants :

* Une [clé API W\&B](/fr/products/wandb/integrations/add-wandb-to-any-library#create-an-api-key).
* Un [projet W\&B](/fr/products/wandb/track/project-page).
* Python 3.8 ou version ultérieure avec les packages `openai` et `wandb` : `pip install wandb openai`.

<h2 id="add-and-use-loras">
  Ajouter et utiliser des LoRA
</h2>

Vous pouvez ajouter des LoRA à votre compte W\&B et commencer à les utiliser de deux manières. Choisissez l’onglet correspondant à l’endroit où votre LoRA a été entraîné :

<Tabs>
  <Tab title="Téléverser un LoRA entraîné ailleurs">
    Téléversez votre propre répertoire de LoRA personnalisé en tant qu’artifact W\&B. Utilisez cette méthode si vous avez entraîné votre LoRA ailleurs (environnement local, fournisseur de cloud ou service partenaire).

    Ce code Python téléverse vers W\&B vos poids LoRA stockés localement, sous la forme d’un artifact versionné. Il crée un artifact de type `lora` avec les métadonnées requises (modèle de base et région de stockage), y ajoute vos fichiers LoRA depuis un répertoire local, puis le journalise dans votre projet W\&B pour que vous puissiez l’utiliser en inférence.

    ```python theme={"system"}
    import wandb

    run = wandb.init(entity=WB_TEAM, project=WB_PROJECT)

    artifact = wandb.Artifact(
        "qwen_lora",
        type="lora",
        metadata={"wandb.base_model": "OpenPipe/Qwen3-14B-Instruct"},
        storage_region="coreweave-us",
    )

    artifact.add_dir("[PATH-TO-LORA-WEIGHTS]")
    run.log_artifact(artifact)
    ```

    <h3 id="key-requirements">
      Exigences principales
    </h3>

    Pour utiliser vos propres LoRA avec Inference, vérifiez les points suivants :

    * Le LoRA doit avoir été entraîné à partir de l’un des modèles répertoriés dans la section [Modèles de base pris en charge](#supported-base-models).
    * Le LoRA doit être enregistré au format PEFT en tant qu’artifact de type `lora` dans votre compte W\&B.
    * Le LoRA doit être stocké dans `storage_region="coreweave-us"` afin de garantir une faible latence.
    * Lors du téléversement, indiquez le nom du modèle de base sur lequel vous l’avez entraîné (par exemple, `meta-llama/Llama-3.1-8B-Instruct`). W\&B pourra ainsi le charger avec le bon modèle.
  </Tab>

  <Tab title="Entraîner un nouveau LoRA avec W&B">
    Entraînez un nouveau LoRA avec [Serverless RL](/fr/products/post-training/serverless-training). Votre LoRA devient automatiquement un artifact W\&B, directement utilisable.

    Pour en savoir plus sur l’entraînement de votre propre LoRA, consultez le [guide de démarrage rapide ART d’OpenPipe](https://art.openpipe.ai/getting-started/quick-start).

    Une fois l’entraînement terminé, votre LoRA est automatiquement disponible en tant qu’artifact.
  </Tab>
</Tabs>

Une fois votre LoRA ajouté à votre projet en tant qu’artifact, quelle que soit la méthode utilisée, vous pouvez le référencer dans n’importe quel appel d’inférence en transmettant son URI comme nom de modèle :

```python theme={"system"}
# Une fois l’entraînement terminé, utilisez directement votre artifact
model_name = f"wandb-artifact:///{WB_TEAM}/{WB_PROJECT}/your_trained_lora:latest"
```

<h2 id="supported-base-models">
  Modèles de base pris en charge
</h2>

Votre LoRA doit avoir été entraîné à partir de l’un des modèles de base suivants. Lorsque vous définissez `wandb.base_model`, utilisez la chaîne exacte de l’ID du modèle afin que W\&B puisse associer votre adaptateur au bon modèle de base lors de l’inférence.

| ID du modèle (à utiliser avec l’API) | Rang LoRA maximal |
| - | - |
| `google/gemma-4-26B-A4B-it` | 16 |
| `meta-llama/Llama-3.1-70B-Instruct` | 16 |
| `meta-llama/Llama-3.1-8B-Instruct` | 16 |
| `OpenPipe/Qwen3-14B-Instruct` | 16 |
| `Qwen/Qwen3.8-27B` | 16 |
| `Qwen/Qwen3.6-35B-A3B` | 16 |
| `Qwen/Qwen3.6-27B` | 16 |
| `Qwen/Qwen3-30B-A3B-Instruct-2507` | 16 |

<h2 id="pricing">
  Tarification
</h2>

Vous ne payez que le stockage et l’inférence que vous exécutez, et non des serveurs actifs en permanence ou des instances GPU dédiées. La tarification comprend deux composants :

* [**Stockage**](https://coreweave.com/forge-pricing) : le stockage de vos poids LoRA vous est facturé.
* **Utilisation de l’inférence** : les appels qui utilisent des artifacts LoRA sont facturés aux mêmes tarifs que l’[inférence de modèle standard](/fr/products/inference/serverless/usage-limits#account-tiers-and-default-usage-caps).


## Related topics

- [Créer un LoRA affiné](/fr/products/inference/serverless/tutorials/creating-lora.md)
