> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Modèles disponibles

> Parcourez les modèles de fondation disponibles via Serverless Inference


Serverless Inference donne accès à plusieurs modèles de fondation open source. Chaque modèle a ses propres points forts et cas d’usage.

<h2 id="generally-available-models">
  Modèles en disponibilité générale
</h2>

Les modèles suivants sont en [disponibilité générale](/fr/products/inference/serverless/lifecycle#model-lifecycle-stages) :

| Modèle | ID du modèle (pour les appels API) | Type | Fenêtre de contexte | Paramètres | Description |
| - | - | - | - | - | - |
| DeepSeek V4.1-Flash | `deepseek-ai/DeepSeek-V4.1-Flash` | Texte, Vision | 1049k | 16B-552B (Actifs-Total) | DeepSeek V4.1 Flash est un modèle MoE multimodal conçu pour la programmation, le raisonnement et les charges de travail agentiques nécessitant de longs contextes. |
| DeepSeek V4-Flash-0731 | `deepseek-ai/DeepSeek-V4-Flash-0731` | Texte | 262k | 13B-284B (Actifs-Total) | DeepSeek V4-Flash-0731 est un modèle MoE particulièrement adapté à la programmation, au raisonnement et aux charges de travail agentiques. |
| DeepSeek V4-Pro-0813 | `deepseek-ai/DeepSeek-V4-Pro-0813` | Texte | 1049k | 49B-1.6T (Actifs-Total) | DeepSeek V4-Pro-0813 est un modèle MoE doté de 1.6T paramètres qui excelle dans le raisonnement avancé, la programmation et l’exécution de charges de travail agentiques complexes. |
| DeepSeek V3.1 | `deepseek-ai/DeepSeek-V3.1` | Texte | 161k | 37B-671B (Actifs-Total) | Un modèle hybride de grande taille qui prend en charge les modes avec et sans raisonnement à l’aide de modèles de prompts. |
| Google Gemma 4 31B | `google/gemma-4-31B-it` | Texte, vision | 262k | 31 Md (Total) | Gemma 4 31B Dense est conçu pour le raisonnement avancé, les flux de travail agentiques et les contextes plus longs. Il est entraîné dès l’origine dans plus de 140 langues. |
| Google Gemma 4 26B A4B Instruct | `google/gemma-4-26B-A4B-it` | Texte, vision | 262k | 4B-26B (Actifs-Total) | Gemma 4 26B A4B est un modèle MoE multimodal prenant en charge LoRA et l’appel de fonctions pour les flux de travail agentiques. |
| IBM Granite 4.2 8B | `ibm-granite/granite-4.2-8b` | Texte | 131k | 8B (Total) | Granite 4.2 8B est un modèle entraîné à suivre des instructions, doté de capacités améliorées pour l’appel d’outils, le suivi des instructions et le chat. |
| Meta Llama 3.3 70B | `meta-llama/Llama-3.3-70B-Instruct` | Texte | 128k | 70B (total) | Modèle multilingue qui excelle dans les tâches conversationnelles, le respect d’instructions détaillées et la programmation. |
| Meta Llama 3.1 8B | `meta-llama/Llama-3.1-8B-Instruct` | Texte | 131k | 8B (Total) | Modèle conversationnel efficace, optimisé pour des échanges rapides avec un chatbot multilingue. |
| MiniMax M3 | `MiniMaxAI/MiniMax-M3` | Texte, Vision | 262k | 23B-428B (Actifs-Total) | MiniMax M3 est un modèle MoE multimodal doté de 23 milliards de paramètres actifs, optimisé pour la programmation et les flux de travail agentiques. |
| Moonshot AI Kimi K2.7 Code | `moonshotai/Kimi-K2.7-Code` | Texte, Vision | 262k | 32B-1T (Actifs-Total) | Kimi K2.7 Code est un modèle MoE à 1 000 milliards de paramètres, dont 32 milliards de paramètres actifs, spécialement conçu pour les tâches de programmation agentique et de génie logiciel de longue durée. |
| Moonshot AI Kimi K2.6 | `moonshotai/Kimi-K2.6` | Texte, vision | 262k | 32B-1T (actifs-total) | Kimi K2.6 est un modèle de langage multimodal à mélange d’experts doté de 32 milliards de paramètres actifs, pour un total de 1 000 milliards de paramètres. |
| NVIDIA Nemotron 3.5 Lightning | `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B` | Texte | 262k | 3B-30B (Actifs-Total) | Nemotron 3.5 Lightning est un modèle MoE conçu pour exécuter des tâches agentiques avec rapidité et fiabilité dans des domaines tels que les services financiers, la cybersécurité, les télécommunications et le commerce de détail. |
| NVIDIA Nemotron 3 Ultra | `nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B` | Texte | 262k | 55B-550B (Actifs-Total) | Nemotron 3 Ultra est un puissant modèle MoE conçu pour des agents exécutant des tâches de longue durée en programmation, en recherche approfondie et en automatisation en entreprise. |
| OpenAI GPT OSS 120B | `openai/gpt-oss-120b` | Texte | 131k | 5.1B-117B (Actifs-Total) | Modèle performant à mélange d’experts conçu pour les tâches de raisonnement avancé, les applications agentiques et les usages généralistes. |
| OpenAI GPT OSS 20B | `openai/gpt-oss-20b` | Texte | 131k | 3.6B-20B (Actifs-Total) | Modèle à mélange d’experts à latence réduite, entraîné sur le format de réponse Harmony d'OpenAI et doté de capacités de raisonnement. |
| Qwen3.8 27B | `Qwen/Qwen3.8-27B` | Texte, vision | 262k | 27B (Total) | Qwen3.8-27B est un modèle multimodal dense adapté à la programmation, à la recherche, à la vision et aux tâches de longue durée exécutées par des agents. |
| Qwen3.6 35B A3B | `Qwen/Qwen3.6-35B-A3B` | Texte, vision | 262k | 3B-35B (actifs-total) | Qwen3.6-35B-A3B est un modèle multimodal MoE doté d’une fenêtre de contexte de 262K, optimisé pour les flux de travail de programmation agentique. |
| Z.AI GLM 5.3 Flash | `zai-org/GLM-5.3-Flash` | Texte, Vision | 1049k | 18B-320B (Actifs-Total) | GLM-5.3-Flash est un modèle nativement multimodal qui compte 320 milliards de paramètres au total, dont 18 milliards de paramètres actifs. |
| Z.AI GLM 5.2 | `zai-org/GLM-5.2` | Texte | 1049k | 40B-744B (Actifs-Total) | GLM-5.2 est un modèle de langage à mélange d’experts qui compte 40 milliards de paramètres actifs sur un total de 744 milliards. |

<h2 id="experimental-models">
  Modèles expérimentaux
</h2>

Les modèles suivants sont [expérimentaux](/fr/products/inference/serverless/lifecycle#model-lifecycle-stages) :

*Aucun pour le moment*

<h2 id="deprecated-models">
  Modèles obsolètes
</h2>

Les modèles suivants sont [obsolètes](/fr/products/inference/serverless/lifecycle#model-lifecycle-stages) :

| Modèle | ID du modèle (pour l’utilisation de l’API) | Type | Fenêtre de contexte | Paramètres | Description |
| - | - | - | - | - | - |
| DeepSeek V4-Flash | `deepseek-ai/DeepSeek-V4-Flash` | Texte | 1049k | 13B-284B (actifs-total) | DeepSeek V4-Flash est un modèle MoE doté d’une longueur de contexte de 1M, idéal pour le code, le raisonnement et les charges de travail agentiques. |
| DeepSeek V4-Pro | `deepseek-ai/DeepSeek-V4-Pro` | Texte | 1049k | 49B-1.6T (actifs-total) | DeepSeek V4-Pro est un modèle MoE de 1,6T paramètres, dont 49B actifs, qui excelle en raisonnement avancé, en code et dans les charges de travail agentiques complexes. |
| IBM Granite 4.1 8B | `ibm-granite/granite-4.1-8b` | Texte | 131k | 8B (total) | Granite 4.1 8B est un modèle instruct à contexte long offrant des capacités améliorées d’appel d’outils, de suivi d’instructions et de chat. |
| JetBrains Mellum2 12B A2.5B | `JetBrains/Mellum2-12B-A2.5B-Instruct` | Texte | 131k | 2.5B-12B (actifs-total) | Mellum2-12B-A2.5B-Instruct est un modèle MoE rapide doté d’un contexte de 131K, conçu pour le code, l’utilisation d’outils et les flux de travail d’IA à faible latence. |
| Meta Llama 3.1 70B | `meta-llama/Llama-3.1-70B-Instruct` | Texte | 131k | 70B (total) | Modèle conversationnel efficace, optimisé pour des interactions de chatbot multilingues réactives. |
| OpenPipe Qwen3 14B Instruct | `OpenPipe/Qwen3-14B-Instruct` | Texte | 32.8k | 14.8B (total) | Modèle dense, multilingue et efficace, ajusté aux instructions et optimisé par OpenPipe pour créer des agents par fine-tuning. |
| Qwen3.6 27B | `Qwen/Qwen3.6-27B` | Texte, vision | 262k | 27B (total) | Qwen3.6-27B est un modèle multimodal dense de 27B doté d’un contexte de 262K, conçu pour offrir des performances de pointe en code agentique. |
| Qwen3.5 35B A3B | `Qwen/Qwen3.5-35B-A3B` | Texte, vision | 262k | 3B-35B (actifs-total) | Qwen3.5-35B-A3B est un modèle MoE multimodal à poids ouverts conçu pour une inférence efficace et à haut débit, qu’il s’agisse de chat, de raisonnement ou de tâches agentiques. |
| Qwen3 30B A3B | `Qwen/Qwen3-30B-A3B-Instruct-2507` | Texte | 262k | 3.3B-30.5B (actifs-total) | Qwen3-30B-A3B-Instruct-2507 est un modèle MoE de 30,5B ajusté aux instructions, aux capacités améliorées en raisonnement, en code et en compréhension de contextes longs. |

<h2 id="specify-a-model-for-inference">
  Indiquer un modèle pour l'inférence
</h2>

Pour indiquer un modèle lors d'un appel à l'API, utilisez son `Model ID` figurant dans les tableaux ci-dessus. Par exemple :

```python theme={"system"}
response = client.chat.completions.create(
    model="meta-llama/Llama-3.1-8B-Instruct",
    messages=[...]
)
```

<h2 id="next-steps">
  Étapes suivantes
</h2>

Après avoir choisi un modèle, poursuivez avec l’une des ressources suivantes :

* Consultez les [limites d’utilisation et la tarification](/fr/products/inference/serverless/usage-limits) de chaque modèle.
* Consultez la [référence de l’API](/fr/products/inference/serverless/api-reference) pour savoir comment utiliser ces modèles.
* Essayez les modèles dans le [Playground](/fr/products/inference/serverless/ui-guide).
