Skip to main content
Konzept: Bewertung | Python: client.eval()

Parameter

string
erforderlich
Der zu bewertende KI-generierte Text. Muss 10–10.000 Zeichen umfassen.
string
Standard:"basic"
Bewertungsmodus:
  • "basic" — die Kern-Scoring-Modelle von RAIL für schnelles Echtzeit-Scoring.
  • "deep" — eine tiefere, detailliertere Analyse, die zusätzlich Erklärungen pro Dimension und Problem-Tags zurückgeben kann.
  • "auto" — führt basic aus und eskaliert automatisch zu deep nur dann, wenn ein echtes Problem erkannt wird (eine niedrig bewertete oder niedrig-konfidente Dimension oder ein gekennzeichnetes Signal). Sie erhalten schnelles Scoring bei sauberen Inhalten und tiefe Analyse genau dort, wo es zählt. Die Antwort result beinhaltet resolved_mode ("basic" oder "deep" — welche Stufe tatsächlich ausgeführt wurde) und escalated (boolean). Abgerechnet nach der Stufe, die ausgeführt wurde.
string[]
Teilmenge der zu bewertenden Dimensionen. Weglassen, um alle 8 zu bewerten. Optionen: fairness, safety, reliability, transparency, privacy, accountability, inclusivity, user_impact.
object
Benutzerdefinierte Dimensionsgewichtungen. Die Werte müssen sich auf 100 summieren. Z. B. {"safety": 25, "reliability": 20, ...}.
string
Hinweis auf den Domänenkontext: "general", "healthcare", "legal", "finance", "code". Verbessert die Bewertungsgenauigkeit.
boolean
Standard:"false"
Erklärungen pro Dimension einbeziehen (nur Deep-Modus).
boolean
Standard:"false"
Erkannte Problem-Tags pro Dimension einbeziehen (nur Deep-Modus).
boolean
Standard:"false"
Verbesserungsvorschläge pro Dimension einbeziehen (nur Deep-Modus).

Anfrage

Antwort

object
Wie die Richtlinie Ihrer Anwendung dieses Ergebnis bewertet hat.
  • enforcement — der Modus der Richtlinie (log_only, block oder regenerate).
  • threshold — der zum Bestehen erforderliche Gesamtscore.
  • score — der Gesamtscore dieses Ergebnisses.
  • passed — ob der Score den Schwellenwert erreicht hat.
  • enforced — ob auf das Ergebnis reagiert wurde. Bei false befindet sich die Richtlinie im Beobachtungsmodus: Das Urteil wird gemeldet, aber die Antwort wird nicht verändert, sodass Sie sehen können, was blockiert würde. Prüfen Sie den aktuellen Zustand mit GET /config.
Wenn die Durchsetzung aktiv ist und ein Ergebnis nicht besteht, gibt eine block-Richtlinie 422 POLICY_BLOCKED zurück, und eine regenerate-Richtlinie versucht eine sichere Neuformulierung, bevor sie ihre Ausweichaktion anwendet.
number
RAIL-Gesamtscore (0,0–10,0), gewichteter Durchschnitt aller bewerteten Dimensionen.
number
Modellkonfidenz im Score (0,0–1,0).
object
Scores pro Dimension. Jeder Eintrag hat score (0–10) und confidence (0–1). Im Deep-Modus zusätzlich: explanation, issues, suggestions.
boolean
true, wenn dieses Ergebnis aus dem Cache zurückgegeben wurde (0 Credits berechnet).
string
Bei mode: "auto" die Stufe, die tatsächlich ausgeführt wurde — "basic" oder "deep". Verwenden Sie result.escalated, um festzustellen, ob der Deep Judge aufgerufen wurde.
boolean
Nur vorhanden (als true), wenn der übermittelte Inhalt das Analysefenster (ca. 4.000 Zeichen) überschreitet: der Score bewertet den vorderen Teil des Inhalts. Teilen Sie längere Inhalte für vollständige Abdeckung auf mehrere Aufrufe auf.
number
Für diese Anfrage berechnete Credits. 0 bei zwischengespeicherten Antworten.