Skip to main content
추론 모델(예: Google의 Gemma 4)은 최종 답변과 함께 추론 단계에 대한 정보를 반환합니다. 이 페이지에서는 Serverless Inference에서 추론을 지원하는 모델을 파악하는 방법, 응답에서 추론 출력을 찾는 위치, 추론을 켜고 끌 수 있는 모델의 경우 이를 제어하는 방법을 설명합니다. 모델의 중간 추론을 검사하거나 응답에 추론이 표시되는지 제어하려면 이 가이드를 사용하세요. 모델이 추론을 지원하는지 확인하려면 지원되는 모델 table 또는 UI의 카탈로그 페이지에 있는 Supported Features 섹션을 확인하세요. 추론 정보는 응답의 reasoning 필드에 나타납니다. 이 필드의 값은 추론을 지원하지 않는 모델의 응답에서는 null입니다.

추론을 지원하는 모델

다음 표는 추론 출력을 반환할 수 있는 Serverless Inference 모델과 각 모델의 동작 방식을 보여줍니다.
  • 항상 켜짐: 모델이 항상 추론 출력을 반환하며, 이 기능은 비활성화할 수 없습니다.
  • 기본적으로 활성화됨 / 기본적으로 비활성화됨: 추론 출력을 켜거나 끌 수 있습니다. 표에는 설정을 지정하지 않았을 때 적용되는 기본값이 표시됩니다.
  • 적응형; 기본적으로 모델이 선택: 모델이 요청마다 추론 출력을 반환할지 결정합니다. 이 동작은 재정의할 수 있습니다.

Always on 추론이 있는 모델

이전 지원되는 모델 table에 Always on으로 나열된 모델은 항상 추론을 포함하며, 이를 비활성화할 수 없습니다.

추론 비활성화

앞의 지원되는 모델 table에 기본적으로 활성화됨으로 표시된 모델은 추론을 비활성화하여 토큰 사용량을 줄이거나 응답을 단순화할 수 있습니다. 요청에서 추론을 사용하지 않으려면 chat_template_kwargs에서 enable_thinking 플래그를 False(Python) 또는 false(Bash)로 설정하세요. 요청이 완료되면 응답에 추론 콘텐츠가 포함되지 않습니다.

추론 활성화

모델이 앞의 지원되는 모델 table에 기본적으로 비활성화됨으로 나열되어 있는 경우, 앞의 코드 스니펫에서 enable_thinking 플래그를 True (Python) 또는 true (Bash)로 설정하여 추론을 활성화할 수 있습니다.
마지막 수정일 2026년 9월 30일