reasoning 필드에 나타납니다. 이 필드의 값은 추론을 지원하지 않는 모델의 응답에서는 null입니다.
추론을 지원하는 모델
다음 표는 추론 출력을 반환할 수 있는 Serverless Inference 모델과 각 모델의 동작 방식을 보여줍니다.- 항상 켜짐: 모델이 항상 추론 출력을 반환하며, 이 기능은 비활성화할 수 없습니다.
- 기본적으로 활성화됨 / 기본적으로 비활성화됨: 추론 출력을 켜거나 끌 수 있습니다. 표에는 설정을 지정하지 않았을 때 적용되는 기본값이 표시됩니다.
- 적응형; 기본적으로 모델이 선택: 모델이 요청마다 추론 출력을 반환할지 결정합니다. 이 동작은 재정의할 수 있습니다.
Always on 추론이 있는 모델
이전 지원되는 모델 table에 Always on으로 나열된 모델은 항상 추론을 포함하며, 이를 비활성화할 수 없습니다.
추론 비활성화
앞의 지원되는 모델 table에기본적으로 활성화됨으로 표시된 모델은 추론을 비활성화하여 토큰 사용량을 줄이거나 응답을 단순화할 수 있습니다. 요청에서 추론을 사용하지 않으려면 chat_template_kwargs에서 enable_thinking 플래그를 False(Python) 또는 false(Bash)로 설정하세요. 요청이 완료되면 응답에 추론 콘텐츠가 포함되지 않습니다.
- Python
- Bash
추론 활성화
모델이 앞의 지원되는 모델 table에기본적으로 비활성화됨으로 나열되어 있는 경우, 앞의 코드 스니펫에서 enable_thinking 플래그를 True (Python) 또는 true (Bash)로 설정하여 추론을 활성화할 수 있습니다.