Concept : Évaluation | Python :
client.eval()Paramètres
string
requis
Le texte généré par IA à évaluer. Doit contenir entre 10 et 10 000 caractères.
string
défaut:"basic"
Mode d’évaluation :
"basic": les modèles de scoring fondamentaux de RAIL pour un scoring rapide en temps réel."deep": une analyse plus approfondie et détaillée qui peut aussi renvoyer des explications par dimension et des étiquettes de problèmes."auto": exécute le modebasicet escalade automatiquement vers le modedeepuniquement lorsqu’un problème réel est détecté (une dimension avec un score faible ou une faible confiance, ou un signal d’alerte). Vous obtenez un scoring rapide sur le contenu propre et une analyse approfondie exactement là où cela compte. La réponseresultinclutresolved_mode("basic"ou"deep"– le niveau réellement exécuté) etescalated(booléen). Facturé au niveau qui a réellement exécuté.
string[]
Sous-ensemble de dimensions à évaluer. Omettez ce paramètre pour évaluer les 8. Options :
fairness, safety, reliability, transparency, privacy, accountability, inclusivity, user_impact.object
Pondérations personnalisées par dimension. Les valeurs doivent totaliser 100. Ex. :
{"safety": 25, "reliability": 20, ...}.string
Indication de contexte métier :
"general", "healthcare", "legal", "finance", "code". Améliore la précision de l’évaluation.boolean
défaut:"false"
Inclure les explications par dimension (mode deep uniquement).
boolean
défaut:"false"
Inclure les étiquettes de problèmes détectés par dimension (mode deep uniquement).
boolean
défaut:"false"
Inclure les suggestions d’amélioration par dimension (mode deep uniquement).
Requête
Réponse
object
Comment la politique de votre application a jugé ce résultat.
enforcement: le mode de la politique (log_only,blockouregenerate).threshold: le score global requis pour passer.score: le score global de ce résultat.passed: si le score a atteint le seuil.enforced: si le verdict a été appliqué. Lorsquefalse, la politique est en mode observation : le verdict est rapporté mais la réponse n’est pas modifiée, ce qui vous permet de voir ce qui serait bloqué. Vérifiez l’état en vigueur avecGET /config.
block renvoie 422 POLICY_BLOCKED et une politique regenerate tente une réécriture sécurisée avant d’appliquer sa solution de repli.number
Score RAIL global (0.0–10.0), moyenne pondérée de toutes les dimensions évaluées.
number
Confiance du modèle dans le score (0.0–1.0).
object
Scores par dimension. Chaque entrée contient
score (0–10) et confidence (0–1). En mode deep : également explanation, issues, suggestions.boolean
true si ce résultat provient du cache (0 crédit facturé).string
Pour le mode
"auto", le niveau qui a réellement exécuté – "basic" ou "deep". Utilisez result.escalated pour déterminer si le jugement approfondi a été invoqué.boolean
Présent (à
true) uniquement lorsque le contenu soumis dépasse la fenêtre d’analyse (environ 4 000 caractères) : le score reflète la partie initiale du contenu. Répartissez les contenus plus longs sur plusieurs appels pour une couverture complète.number
Crédits facturés pour cette requête.
0 pour les réponses en cache.