Vues disponibles
- volume de requêtes dans le temps ;
- part du trafic par modèle cible du routage ;
- répartition par version de projet ;
- volume de jetons en entrée et en sortie ;
- erreurs des fournisseurs ;
- coût estimé en entrée, en sortie et total ;
- modèles de comparaison qui ne reçoivent actuellement aucun trafic.
Couverture de la tarification
Les coûts sont des estimations. L’interface utilise, par ordre de priorité :- un prix de modèle défini manuellement sur le fournisseur ou le modèle fine-tuné ;
- la tarification W&B Inference du modèle de base d’un modèle fine-tuné ;
- le catalogue LiteLLM intégré, si un modèle correspondant y figure.
Utiliser Analytics pendant le déploiement progressif
Après avoir modifié l’acheminement, vérifiez que :- le nouveau modèle reçoit la part de trafic prévue ;
- l’ancien modèle conserve le poids résiduel attendu ou un poids nul ;
- le taux d’erreur n’augmente pas ;
- le volume de jetons et le comportement de fin de génération restent cohérents ;
- le coût estimé évolue dans le sens attendu.
API : Lire les analyses du projet (GET /tasks/{alias}/analytics)
API : Lire les analyses du projet (GET /tasks/{alias}/analytics)
Le paramètre de requête Pour le schéma de la réponse, voir Obtenir Analytics d’une tâche.
time_range accepte des fenêtres relatives telles que 1h, 24h, 5d, 30d ou 12w :