> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 利用可能なモデル

> Serverless Inference で利用可能な基盤モデルを確認できます


Serverless Inference では、複数のオープンソースの基盤モデルを利用できます。各モデルには、それぞれ異なる強みと用途があります。

<h2 id="generally-available-models">
  一般提供のモデル
</h2>

以下のモデルは[一般提供](/ja/products/inference/serverless/lifecycle#model-lifecycle-stages)です：

| モデル | モデル ID (API で使用) | タイプ | コンテキストウィンドウ | パラメーター | 説明 |
| - | - | - | - | - | - |
| DeepSeek V4.1-Flash | `deepseek-ai/DeepSeek-V4.1-Flash` | テキスト, 画像 | 1049k | 16B-552B (有効-総数) | DeepSeek V4.1 Flash は、長いコンテキストを扱うコーディング、推論、エージェント型ワークロード向けのマルチモーダル MoE モデルです. |
| DeepSeek V4-Flash-0731 | `deepseek-ai/DeepSeek-V4-Flash-0731` | テキスト | 262k | 13B-284B (有効-総数) | DeepSeek V4-Flash-0731 は、コーディング、推論、エージェントを活用したワークロードに優れた MoE モデルです. |
| DeepSeek V4-Pro-0813 | `deepseek-ai/DeepSeek-V4-Pro-0813` | テキスト | 1049k | 49B-1.6T (有効-総数) | DeepSeek V4-Pro-0813 は、高度な推論、コーディング、複雑なエージェント型ワークロードに優れた、1.6T パラメーターの MoE モデルです。 |
| DeepSeek V3.1 | `deepseek-ai/DeepSeek-V3.1` | テキスト | 161k | 37B-671B (有効-総数) | プロンプトテンプレートを通じて思考モードと非思考モードの両方をサポートする大規模なハイブリッドモデルです. |
| Google Gemma 4 31B | `google/gemma-4-31B-it` | テキスト, 画像 | 262k | 31B (合計) | Gemma 4 31B Dense は、高度な推論、エージェント型ワークフロー、より長いコンテキストに対応するよう設計されており、140以上の言語でネイティブにトレーニングされています。 |
| Google Gemma 4 26B A4B Instruct | `google/gemma-4-26B-A4B-it` | テキスト, 画像 | 262k | 4B-26B (有効-総数) | Gemma 4 26B A4B は、LoRA アダプターをサポートし、エージェント型ワークフロー向けの関数呼び出しに対応するマルチモーダル MoE モデルです. |
| IBM Granite 4.2 8B | `ibm-granite/granite-4.2-8b` | テキスト | 131k | 8B (合計) | Granite 4.2 8B は、ツール呼び出し、指示追従、チャットの機能が強化された指示調整済みモデルです。 |
| Meta Llama 3.3 70B | `meta-llama/Llama-3.3-70B-Instruct` | テキスト | 128k | 70B (合計) | 会話タスク、詳細な指示への対応、コーディングに優れた多言語モデルです。 |
| Meta Llama 3.1 8B | `meta-llama/Llama-3.1-8B-Instruct` | テキスト | 131k | 8B (合計) | 多言語チャットボットとの応答性の高いやり取りに最適化された効率的な対話モデルです。 |
| MiniMax M3 | `MiniMaxAI/MiniMax-M3` | テキスト, 画像 | 262k | 23B-428B (有効-総数) | MiniMax M3 は、有効パラメーター数が 23B のマルチモーダル MoE モデルで、コーディングとエージェント型ワークフローに最適化されています. |
| Moonshot AI Kimi K2.7 Code | `moonshotai/Kimi-K2.7-Code` | テキスト, 画像 | 262k | 32B-1T (有効-合計) | Kimi K2.7 Code は、エージェントによる長期的なコーディングとソフトウェアエンジニアリングに特化して設計された、総パラメーター数 1T、有効パラメーター数 32B の MoE モデルです. |
| Moonshot AI Kimi K2.6 | `moonshotai/Kimi-K2.6` | テキスト, 画像 | 262k | 32B-1T (有効-総数) | Kimi K2.6 は、総パラメーター数が 1 兆で、そのうち 320 億が活性化されるマルチモーダルの Mixture-of-Experts 言語モデルです。 |
| NVIDIA Nemotron 3.5 Lightning | `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B` | テキスト | 262k | 3B-30B (有効-総数) | Nemotron 3.5 Lightning は、金融サービス、サイバーセキュリティ、通信、小売などのユースケースで、エージェントによるタスクを高速かつ確実に実行するために構築された MoE モデルです. |
| NVIDIA Nemotron 3 Ultra | `nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B` | テキスト | 262k | 55B-550B (有効-総数) | Nemotron 3 Ultra は、コーディング、詳細な調査、企業向けオートメーションにおいて長時間稼働するエージェント向けに設計された強力な MoE モデルです。 |
| OpenAI GPT OSS 120B | `openai/gpt-oss-120b` | テキスト | 131k | 5.1B-117B (有効-総数) | 高度な推論、エージェント型、および汎用的なユースケース向けに設計された効率的な混合エキスパートモデルです. |
| OpenAI GPT OSS 20B | `openai/gpt-oss-20b` | テキスト | 131k | 3.6B-20B (有効-総数) | OpenAI's Harmony 応答形式でトレーニングされた、推論機能を備えた低レイテンシーの Mixture-of-Experts モデルです. |
| Qwen3.8 27B | `Qwen/Qwen3.8-27B` | テキスト, 画像 | 262k | 27B (合計) | Qwen3.8-27B は、コーディング、研究、画像理解、長時間実行されるエージェントタスクに適した密なマルチモーダルモデルです。 |
| Qwen3.6 35B A3B | `Qwen/Qwen3.6-35B-A3B` | テキスト, 画像 | 262k | 3B-35B (有効-総数) | Qwen3.6-35B-A3B は、262K のコンテキストを備え、エージェントによるコーディングワークフローに最適化された MoE マルチモーダルモデルです。 |
| Z.AI GLM 5.3 Flash | `zai-org/GLM-5.3-Flash` | テキスト, 画像 | 1049k | 18B-320B (有効-合計) | GLM-5.3-Flash は、総パラメーター数が 320B、有効パラメーター数が 18B の、ネイティブにマルチモーダルに対応したモデルです. |
| Z.AI GLM 5.2 | `zai-org/GLM-5.2` | テキスト | 1049k | 40B-744B (有効-合計) | GLM-5.2 は、有効なパラメーター数が400億、総パラメーター数が7440億の混合エキスパート言語モデルです. |

<h2 id="experimental-models">
  実験的なモデル
</h2>

以下のモデルは[実験的](/ja/products/inference/serverless/lifecycle#model-lifecycle-stages)です：

*現在はありません*

<h2 id="deprecated-models">
  非推奨のモデル
</h2>

以下のモデルは[非推奨](/ja/products/inference/serverless/lifecycle#model-lifecycle-stages)です：

| モデル | モデル ID (API で使用) | タイプ | コンテキストウィンドウ | パラメーター | 説明 |
| - | - | - | - | - | - |
| DeepSeek V4-Flash | `deepseek-ai/DeepSeek-V4-Flash` | テキスト | 1049k | 13B-284B (有効-総数) | DeepSeek V4-Flash は、1M のコンテキスト長を備えた MoE モデルで、コーディング、推論、エージェント型ワークロードに適しています。 |
| DeepSeek V4-Pro | `deepseek-ai/DeepSeek-V4-Pro` | テキスト | 1049k | 49B-1.6T (有効-総数) | DeepSeek V4-Pro は、総パラメーター数 1.6T、有効パラメーター数 49B の MoE モデルで、高度な推論、コーディング、複雑なエージェント型ワークロードに優れています。 |
| IBM Granite 4.1 8B | `ibm-granite/granite-4.1-8b` | テキスト | 131k | 8B (総数) | Granite 4.1 8B は、ツール呼び出し、指示への追従、チャットの機能を強化した、長いコンテキストに対応する指示調整済みモデルです。 |
| JetBrains Mellum2 12B A2.5B | `JetBrains/Mellum2-12B-A2.5B-Instruct` | テキスト | 131k | 2.5B-12B (有効-総数) | Mellum2-12B-A2.5B-Instruct は、131K のコンテキストを備えた高速な MoE モデルで、コーディング、ツールの使用、低レイテンシーの AI ワークフロー向けに設計されています。 |
| Meta Llama 3.1 70B | `meta-llama/Llama-3.1-70B-Instruct` | テキスト | 131k | 70B (総数) | 多言語チャットボットで応答性の高い対話を実現するために最適化された、効率的な会話モデルです。 |
| OpenPipe Qwen3 14B Instruct | `OpenPipe/Qwen3-14B-Instruct` | テキスト | 32.8k | 14.8B (総数) | ファインチューニングによるエージェント構築向けに OpenPipe が最適化した、効率的な多言語対応の密な指示調整済みモデルです。 |
| Qwen3.6 27B | `Qwen/Qwen3.6-27B` | テキスト, 画像 | 262k | 27B (総数) | Qwen3.6-27B は、262K のコンテキストを備えた 27B の密なマルチモーダルモデルで、最上位クラスのエージェント型コーディング向けに設計されています。 |
| Qwen3.5 35B A3B | `Qwen/Qwen3.5-35B-A3B` | テキスト, 画像 | 262k | 3B-35B (有効-総数) | Qwen3.5-35B-A3B は、重みが公開されたマルチモーダル MoE モデルで、チャット、推論、エージェント型タスクにおいて効率的で高スループットな推論を実現するよう設計されています。 |
| Qwen3 30B A3B | `Qwen/Qwen3-30B-A3B-Instruct-2507` | テキスト | 262k | 3.3B-30.5B (有効-総数) | Qwen3-30B-A3B-Instruct-2507 は、推論、コーディング、長いコンテキストの理解を強化した、30.5B の MoE 指示調整済みモデルです。 |

<h2 id="use-model-ids">
  モデル ID を使用する
</h2>

API を呼び出す際にモデルを指定するには、前の表の `Model ID` を使用します。例:

```python theme={"system"}
response = client.chat.completions.create(
    model="meta-llama/Llama-3.1-8B-Instruct",
    messages=[...]
)
```

<h2 id="next-steps">
  次のステップ
</h2>

モデルを選択したら、以下のリソースのいずれかで続行してください：

* 各モデルの[使用制限と料金](/ja/products/inference/serverless/usage-limits)をご確認ください。
* これらのモデルの[API リファレンス](/ja/products/inference/serverless/api-reference)で使い方をご覧ください。
* [W\&B プレイグラウンド](/ja/products/inference/serverless/ui-guide)でモデルをお試しください。


## Related topics

- [利用可能なモデル](/ja/products/post-training/serverless-training/available-models.md)
