Skip to main content
Ce guide vous montre comment utiliser Weave avec Serverless Inference pour découvrir les principes fondamentaux de Weave. Utilisez Serverless Inference pour créer et tracer des applications LLM à l’aide de modèles open source disponibles en temps réel, sans avoir à configurer votre propre infrastructure ni à gérer les clés API de plusieurs fournisseurs. Avec votre clé API CoreWeave Forge, vous pouvez interagir avec tous les modèles hébergés par Serverless Inference. À la fin de ce guide, vous aurez tracé des appels LLM, comparé des modèles et exécuté une évaluation, que vous pourrez consulter dans l’interface de Weights & Biases.

Ce que vous allez apprendre

Ce guide vous montre comment :
  • Configurer Weave et Serverless Inference.
  • Créer une application LLM de base avec traçage automatique.
  • Comparer plusieurs modèles.
  • Évaluer les performances d’un modèle sur un jeu de données.
  • Consulter vos résultats dans l’interface utilisateur de Weights & Biases.

Prérequis

  • Un compte CoreWeave Forge
  • Python 3.10+ ou Node.js 18+
  • Les paquets requis installés :
    • Python : pip install weave openai
    • TypeScript : npm install weave openai
  • Une clé API OpenAI définie dans une variable d’environnement.

Tracer votre premier appel LLM

Cette section vous montre comment effectuer un appel LLM unique et le faire tracer automatiquement par Weave, afin de vérifier que votre configuration fonctionne avant de passer à des exemples plus complexes. Pour commencer, copiez-collez l’exemple de code suivant. Il utilise le modèle Llama 3.1-8B de Serverless Inference. Lorsque vous exécutez ce code, Weave :
  • Trace automatiquement votre appel LLM.
  • Journalise les entrées, les sorties, la latence et l’utilisation des jetons.
  • Fournit un lien pour afficher votre trace dans l’interface de Weights & Biases.

Créer une application de synthèse de texte

Maintenant que vous avez tracé un seul appel LLM, cette section montre comment Weave trace des opérations imbriquées réparties sur plusieurs fonctions. Vous verrez ainsi comment une véritable application LLM en plusieurs étapes est capturée dans l’interface utilisateur. Exécutez ensuite le code suivant, une application de synthèse de base qui illustre la façon dont Weave trace les opérations imbriquées :

Comparer plusieurs modèles

Un cas d’utilisation courant de Weave consiste à comparer la manière dont différents modèles répondent à un même prompt. Serverless Inference donne accès à plusieurs modèles. Utilisez le code suivant pour comparer les performances de Llama et de DeepSeek à partir de leurs réponses respectives :

Évaluer les performances du modèle

Au-delà des comparaisons ponctuelles, cette section vous montre comment exécuter une évaluation structurée sur un jeu de données afin de mesurer et de comparer méthodiquement la qualité des modèles. Évaluez les performances d’un modèle sur une tâche de questions-réponses à l’aide de l’EvaluationLogger intégré à Weave. Il fournit un suivi structuré des évaluations, avec agrégation automatique, capture de l’utilisation des jetons et des fonctionnalités de comparaison avancées dans l’interface utilisateur. Ajoutez le code suivant à la fin du script utilisé dans la section précédente :
Après avoir exécuté ces exemples, vous disposez d’appels LLM tracés, d’un pipeline de synthèse imbriqué, d’une comparaison de modèles et d’une évaluation complète, tous journalisés dans Weave. L’exécution de ces exemples affiche dans le terminal des liens vers les traces. Cliquez sur l’un de ces liens pour afficher les traces dans l’interface de Weights & Biases. Dans l’interface de Weights & Biases, vous pouvez :
  • Consulter la chronologie de tous vos appels LLM.
  • Inspecter les entrées et les sorties de chaque opération.
  • Afficher l’utilisation des jetons et les coûts estimés (capturés automatiquement par EvaluationLogger).
  • Analyser la latence et les métriques de performances.
  • Accéder à l’onglet Evals pour consulter les résultats d’évaluation agrégés.
  • Utiliser la fonctionnalité Compare pour analyser les performances de différents modèles.
  • Parcourir des exemples précis pour voir comment différents modèles se comportent sur les mêmes entrées.

Modèles disponibles

Pour obtenir la liste complète des modèles disponibles, consultez la section Modèles disponibles de la documentation Serverless Inference.

Étapes suivantes

Une fois les notions de base acquises, les ressources suivantes vous aideront à approfondir votre utilisation de Weave et de Serverless Inference :

Dépannage

Dernière modification le 30 septembre 2026