> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 推論情報を表示する

> Serverless Inference の応答で推論情報を返して表示する方法

[Google's Gemma 4](https://huggingface.co/google/gemma-4-31B-it) などの推論モデルは、最終的な回答とともに推論ステップに関する情報を返します。このページでは、Serverless Inference で推論に対応するモデルを特定する方法、応答内の推論出力を確認する場所、切り替えに対応するモデルで推論を有効または無効にする方法を説明します。モデルの中間的な推論を確認したり、応答に推論を含めるかどうかを制御したりする際に、このガイドを使用してください。

モデルが推論をサポートするかどうかを確認するには、以下の「サポートされるモデル」の表、または UI のモデルカタログページにある **Supported Features** セクションを確認してください。

推論情報は、応答の `reasoning` フィールドに表示されます。推論に対応していないモデルの応答では、このフィールドの値は `null` です。

<h2 id="supported-models-with-reasoning">
  推論をサポートする、サポートされるモデル
</h2>

次の表は、推論出力を返すことができる Serverless Inference モデルと、それぞれの動作方法をリストしています：

* **常時有効:** モデルは常に推論出力を返します。これを無効にすることはできません。
* **デフォルトで有効** / **デフォルトで無効:** 推論出力をオンまたはオフにできます。設定を指定しない場合のデフォルトを表に示します。
* **適応型; モデルがデフォルトで選択:** モデルはリクエストごとに推論出力を返すかどうかを決定します。これを上書きすることができます。

| モデル ID (API で使用) | 推論サポート |
| - | - |
| `deepseek-ai/DeepSeek-V4.1-Flash` | デフォルトで有効 |
| `deepseek-ai/DeepSeek-V4-Flash` | デフォルトで無効 |
| `deepseek-ai/DeepSeek-V4-Flash-0731` | デフォルトで有効 |
| `deepseek-ai/DeepSeek-V4-Pro` | デフォルトで無効 |
| `deepseek-ai/DeepSeek-V4-Pro-0813` | デフォルトで有効 |
| `google/gemma-4-31B-it` | デフォルトで無効 |
| `google/gemma-4-26B-A4B-it` | デフォルトで無効 |
| `ibm-granite/granite-4.2-8b` | デフォルトで有効 |
| `MiniMaxAI/MiniMax-M3` | 適応型; モデルがデフォルトで選択 |
| `moonshotai/Kimi-K2.7-Code` | 常時有効 |
| `moonshotai/Kimi-K2.6` | 常時有効 |
| `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B` | デフォルトで有効 |
| `nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B` | デフォルトで有効 |
| `openai/gpt-oss-120b` | 常時有効 |
| `openai/gpt-oss-20b` | 常時有効 |
| `Qwen/Qwen3.8-27B` | デフォルトで有効 |
| `Qwen/Qwen3.6-35B-A3B` | デフォルトで有効 |
| `Qwen/Qwen3.6-27B` | デフォルトで有効 |
| `Qwen/Qwen3.5-35B-A3B` | デフォルトで有効 |
| `zai-org/GLM-5.3-Flash` | 常時有効 |
| `zai-org/GLM-5.2` | デフォルトで有効 |

<h3 id="models-with-always-on-reasoning">
  推論が`常時有効`なモデル
</h3>

前述の[サポートされるモデル](#supported-models-with-reasoning)の表でモデルが`常時有効`と記載されている場合、推論は常に含まれ、無効にすることはできません。

<h3 id="disable-reasoning">
  推論を無効にする
</h3>

前の[サポートされるモデル](#supported-models-with-reasoning)の表でモデルが `デフォルトで有効` と記載されている場合、推論を無効にすると、トークン使用量を削減したり、応答を簡潔にしたりできます。リクエストで推論を使用しない場合は、`chat_template_kwargs` で `enable_thinking` フラグを `False` (Python) または `false` (Bash) に設定します。リクエストが完了すると、応答に推論内容は含まれません。

<Tabs>
  <Tab title="Python">
    ```python lines highlight={13-17} theme={"system"}
    import openai

    client = openai.OpenAI(
        base_url='https://api.inference.wandb.ai/v1',
        api_key="[YOUR-API-KEY]",  # https://forge.coreweave.com/settings でAPIキーを作成します
    )

    response = client.chat.completions.create(
        model="google/gemma-4-31B-it",
        messages=[
            {"role": "user", "content": "3.11 and 3.8, which is greater?"}
        ],
        extra_body={
            "chat_template_kwargs": {
                "enable_thinking": False
            }
        },
    )
    ```
  </Tab>

  <Tab title="Bash">
    ```bash lines highlight={9} theme={"system"}
    curl https://api.inference.wandb.ai/v1/chat/completions \
      -H "Content-Type: application/json" \
      -H "Authorization: Bearer [YOUR-API-KEY]" \
      -d '{
        "model": "google/gemma-4-31B-it",
        "messages": [
          { "role": "user", "content": "3.11 and 3.8, which is greater?" }
        ],
        "chat_template_kwargs": {"enable_thinking": false}
      }'
    ```
  </Tab>
</Tabs>

<h3 id="enable-reasoning">
  推論を有効にする
</h3>

前述の[サポートされるモデル](#supported-models-with-reasoning)の表でモデルが `デフォルトで無効` と表示されている場合は、前述のコードスニペットで `enable_thinking` フラグを `True` (Python) または `true` (Bash) に設定すると、推論を有効にできます。
