stream 옵션을 true로 설정하면 모델의 응답을 청크 스트림으로 점진적으로 반환하므로 전체 응답을 기다리지 않고 도착하는 대로 결과를 표시할 수 있습니다. 모델이 출력을 생성하는 데 시간이 걸리는 경우 유용합니다.
모든 호스팅된 모델은 스트리밍 출력을 지원합니다. 모델이 출력을 생성하기 시작하는 데 오랜 시간이 걸리는 경우 비스트리밍 요청이 시간 초과될 수 있으므로 추론 모델에 스트리밍을 권장합니다.
다음 예시는 Chat Completion 요청에 스트리밍을 활성화합니다:
- Python
- Bash