stream est définie sur true, la réponse du modèle est renvoyée de manière incrémentielle, sous forme de flux de fragments. Vous pouvez ainsi afficher les résultats au fur et à mesure qu’ils arrivent, sans attendre la réponse complète. C’est particulièrement utile lorsque les modèles mettent du temps à générer leur sortie.
Tous les modèles hébergés prennent en charge la sortie en streaming. Le streaming est recommandé pour les modèles de raisonnement, car les requêtes sans streaming peuvent expirer si le modèle tarde à commencer à produire sa sortie.
Les exemples suivants activent le streaming pour une requête de complétion de chat :
- Python
- Bash