Skip to main content
Partie 2 : Fonctionnalités de production - Enveloppes de fournisseur, application des politiques, sessions et observabilité.

La configuration

Nous construisons un chatbot de support client pour un produit SaaS fictif appelé “CloudDash”, un tableau de bord de surveillance cloud. Le chatbot répond aux questions sur les prix, les fonctionnalités et le dépannage. En cours de route, nous ajoutons une évaluation des scores RAIL à chaque couche pour garantir que les réponses du chatbot sont sûres, précises, équitables et utiles.

Installer les dépendances

Variables d’environnement

Créez un fichier .env :
Obtenez votre clé API RAIL : Inscrivez-vous sur responsibleailabs.ai/dashboard. Le niveau gratuit comprend 100 crédits pour suivre tout ce tutoriel.

Construire le chatbot de base

Commencez avec un chatbot de base utilisant OpenAI directement, sans intégration RAIL pour l’instant. C’est la fondation sur laquelle nous allons ajouter le scoring.
chatbot.py
Cela fonctionne, mais nous n’avons aucune visibilité sur la qualité de la réponse. Cette réponse est-elle sûre ? Est-elle factuellement précise ? Contient-elle des biais ? Nous n’avons aucun moyen de le savoir, jusqu’à ce que nous ajoutions le score RAIL.

Ajouter l’évaluation du score RAIL

La manière la plus simple d’ajouter l’évaluation RAIL est avec RailScoreClient. Un appel nous donne des scores sur les 8 dimensions RAIL.
chatbot_with_eval.py

Interpréter les résultats

Vie privée = 5.0 signifie “non applicable.” RAIL retourne 5.0 (neutre) lorsque la vie privée est sans rapport avec le contenu évalué.

Évaluation approfondie

Le mode de base vous donne des scores. Le mode approfondi vous donne le pourquoi : explications par dimension, problèmes détectés et suggestions d’amélioration.
deep_eval.py

Basique vs Approfondi

Astuce d’économie : Utilisez le mode de base pour chaque réponse en production, et le mode approfondi de manière sélective. Par exemple, déclenchez le mode approfondi lorsque le score de base tombe en dessous de votre seuil, ou comme un audit périodique sur un échantillon de réponses.

Quelles sont les prochaines étapes

Partie 2 : Fonctionnalités de production

Enveloppes de fournisseur, application des politiques (bloquer/régénérer), suivi des sessions multi-tours et observabilité Langfuse.