stream オプションを true に設定すると、モデルの応答がチャンクのストリームとして段階的に返されます。そのため、応答全体の完了を待たずに、届いた結果から順に表示できます。これは、モデルの出力生成に時間がかかる場合に便利です。
ホストされているすべてのモデルがストリーミング出力をサポートしています。推論モデルではストリーミングの使用を推奨します。非ストリーミングのリクエストでは、モデルが出力を開始するまでに時間がかかるとタイムアウトする可能性があるためです。
次のサンプルでは、チャット補完リクエストでストリーミングを有効にしています。
- Python
- Bash