Skip to main content
Google’s Gemma 4 などの推論モデルは、最終的な回答とともに推論ステップに関する情報を返します。このページでは、Serverless Inference で推論に対応するモデルを特定する方法、応答内の推論出力を確認する場所、切り替えに対応するモデルで推論を有効または無効にする方法を説明します。モデルの中間的な推論を確認したり、応答に推論を含めるかどうかを制御したりする際に、このガイドを使用してください。 モデルが推論をサポートするかどうかを確認するには、以下の「サポートされるモデル」の表、または UI のモデルカタログページにある Supported Features セクションを確認してください。 推論情報は、応答の reasoning フィールドに表示されます。推論に対応していないモデルの応答では、このフィールドの値は null です。

推論をサポートする、サポートされるモデル

次の表は、推論出力を返すことができる Serverless Inference モデルと、それぞれの動作方法をリストしています:
  • 常時有効: モデルは常に推論出力を返します。これを無効にすることはできません。
  • デフォルトで有効 / デフォルトで無効: 推論出力をオンまたはオフにできます。設定を指定しない場合のデフォルトを表に示します。
  • 適応型; モデルがデフォルトで選択: モデルはリクエストごとに推論出力を返すかどうかを決定します。これを上書きすることができます。

推論が常時有効なモデル

前述のサポートされるモデルの表でモデルが常時有効と記載されている場合、推論は常に含まれ、無効にすることはできません。

推論を無効にする

前のサポートされるモデルの表でモデルが デフォルトで有効 と記載されている場合、推論を無効にすると、トークン使用量を削減したり、応答を簡潔にしたりできます。リクエストで推論を使用しない場合は、chat_template_kwargs で enable_thinking フラグを False (Python) または false (Bash) に設定します。リクエストが完了すると、応答に推論内容は含まれません。

推論を有効にする

前述のサポートされるモデルの表でモデルが デフォルトで無効 と表示されている場合は、前述のコードスニペットで enable_thinking フラグを True (Python) または true (Bash) に設定すると、推論を有効にできます。
最終更新日 2026年9月30日