> ## Documentation Index
> Fetch the complete documentation index at: https://docs.responsibleailabs.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 評価

> 責任ある AI の 8 つの次元にわたって AI 生成コンテンツをスコアリングします。

評価は RAIL Score システムの基盤です。他のすべての機能は評価スコアに依存しています。

<Info>
  **API エンドポイント:** `POST /railscore/v1/eval` | **Python:** `client.eval()` | **JavaScript:** `client.eval()`
</Info>

## 8 つの RAIL 次元

| 次元                          | 測定するもの                          |
| --------------------------- | ------------------------------- |
| **公平性 (Fairness)**          | 属性を問わない公平な扱い。バイアスやステレオタイプがないこと。 |
| **安全性 (Safety)**            | 有害、毒性、または危険なコンテンツがないこと。         |
| **信頼性 (Reliability)**       | 事実の正確性、内部的な一貫性、適切なキャリブレーション。    |
| **透明性 (Transparency)**      | 限界、推論、不確実性の明確なコミュニケーション。        |
| **プライバシー (Privacy)**        | 個人情報の保護とデータの最小化。                |
| **説明責任 (Accountability)**   | 追跡可能な推論、明示された前提、誤りの認識。          |
| **包括性 (Inclusivity)**       | 包括的な言葉づかい、アクセシビリティ、文化的配慮。       |
| **ユーザーインパクト (User Impact)** | 適切な詳細レベルとトーンで提供されるポジティブな価値。     |

各次元の完全な定義、スコアアンカー、具体例については、[RAIL フレームワーク](/concepts/rail-framework)を参照してください。

## Basic、Deep、Auto モード

```mermaid theme={null}
flowchart TD
    Input["Content + Parameters"] --> Router{"Mode?"}
    Router -- "basic" --> Core["RAIL core scoring"]
    Router -- "deep" --> Deep["RAIL deep analysis"]
    Router -- "auto" --> Auto{"Issue detected?"}
    Auto -- "no" --> Core
    Auto -- "yes" --> Deep
    Core --> Out1["Score + Confidence"]
    Deep --> Out2["Score + Confidence + Explanations + Issues"]
```

どちらのモードも同じ 8 つの次元をスコアリングし、同じ全体 RAIL スコアを返します。違いは分析の深さと、返ってくる詳細情報です。

<Tabs>
  <Tab title="basic モード">
    RAIL のコアスコアリングモデルを使用します。高速 (通常 1 秒未満) で、本番環境でのリアルタイムスコアリング向けに作られています。

    返されるもの: 全体スコア、次元ごとのスコア、信頼度の値。

    ```python theme={null}
    result = client.eval(content="Your text here", mode="basic")
    # result.rail_score.score       -> 7.6
    # result.dimension_scores       -> {fairness: {score: 7.7, confidence: 0.84}, ...}
    ```
  </Tab>

  <Tab title="deep モード">
    コンテンツについてのより深く詳細な分析です。数秒かかりますが、スコアに加えて次元ごとの説明、問題タグ、改善提案を返すことができます。

    ```python theme={null}
    result = client.eval(
        content="Your text here",
        mode="deep",
        include_explanations=True,
        include_issues=True,
        include_suggestions=True,
    )
    # result.dimension_scores["transparency"].explanation -> "The process is mostly clear, but..."
    # result.dimension_scores["safety"].issues            -> ["Potential phishing risks"]
    ```
  </Tab>

  <Tab title="Auto モード">
    すべてのリクエストで **basic** を実行し、実際の問題が検出された場合のみ **deep** にエスカレートします。クリーンなコンテンツは高速で安く、精査が必要なコンテンツは自動的に深い分析を受けます。

    ```python theme={null}
    result = client.eval(content="Your text here", mode="auto")
    # result.resolved_mode -> "basic"  (クリーンなコンテンツ — 高速のままで終了)
    #                               -> "deep"   (問題検出 — エスカレート)
    # result.escalated     -> False / True
    ```

    レスポンスの `result` 内の `resolved_mode` と `escalated` により、実際に実行されたティアがわかります。課金は実行されたティアに基づきます。
  </Tab>
</Tabs>

**使い分け:** 本番リクエストのホットパスでスコアリングし、素早い判定が欲しいときは **basic** を選びます。何かが低スコアになった*理由*をレビュー担当者に示す必要があるとき、またはポリシーをデバッグして調整しているときは、説明と問題タグが返ってくる **deep** を選びます。ほとんどのトラフィックで basic の速さを望みながら、精査が必要なコンテンツに自動的に深い分析を行いたいときは **auto** を選びます。

### レスポンス

すべての評価は次を返します:

* `rail_score` — 全体スコア (0〜10)、その `confidence`、そして 1 行の `summary`。
* `dimension_scores` — 8 つの次元それぞれの `score` と `confidence`。deep モードでは各次元に `explanation` と `issues` (リクエストすれば `suggestions` も) が付きます。
* `policy_outcome` — [アプリケーションのポリシー](/concepts/policy-engine)がその結果をどう判断したか。

## 選択的な次元

```python theme={null}
result = client.eval(
    content="Your text here",
    mode="basic",
    dimensions=["safety", "privacy", "reliability"],
)
```

## カスタム重み

重みの合計は 100 である必要があります:

```python theme={null}
result = client.eval(
    content="Patient should take 500mg ibuprofen every 4 hours.",
    mode="deep",
    domain="healthcare",
    weights={
        "safety": 25, "privacy": 20, "reliability": 20,
        "accountability": 15, "transparency": 10,
        "fairness": 5, "inclusivity": 3, "user_impact": 2,
    },
)
```

## スコアティア

スコアは 5 つのバンドのいずれかにマッピングされます。**Excellent** (9.0〜10.0) から **Critical** (0.0〜2.9) までです。完全な表と各バンドの意味については、[RAIL フレームワーク](/concepts/rail-framework#score-tiers)を参照してください。

## キャッシング

同一のリクエストはキャッシュされた結果を返すため、同じコンテンツの繰り返しスコアリングは高速で、再課金されません。basic モードは 5 分間、deep モードは 3 分間キャッシュされます。

<CardGroup cols={2}>
  <Card title="API リファレンス: 評価" icon="code" href="/api-reference/evaluation">
    完全なエンドポイント仕様
  </Card>

  <Card title="Python SDK: 評価" icon="python" href="/sdk/python/evaluation">
    Python コードの例
  </Card>
</CardGroup>
