使用連貫性與流暢度評估器來衡量 AI 生成文本的寫作品質,獨立於事實正確性之外。 AI 生成的文字可能缺乏邏輯流暢度或文法品質,僅有最低的正確度——這些評估者系統性地指出這些缺口。
連貫性
連貫性評估器衡量回應中想法的邏輯與有條理呈現,使讀者能輕鬆跟隨並理解作者的思路。 一個 連貫 的回答會直接回應問題,句子與段落之間有明確連結,運用適當的轉折和邏輯的思路順序。 分數越高,連貫性越好。
流暢度
流暢度評估器衡量書面溝通的有效性與清晰度。 此指標著重於語法準確性、詞彙範圍、句子複雜度、連貫性及整體可讀性。 它評估想法傳達的流暢度,以及讀者理解文本的難易度。
配置並執行評估器
通用評估者會獨立於特定用例評估 AI 生成文本的寫作品質。 當邏輯流暢與論證重要時,使用連貫性——例如在問答或摘要中。 當文法品質和可讀性與內容無關時,請使用流暢度。 同時讓兩位評審員一起檢查,才能全面了解寫作品質。
對於 LLM 作為法官的評估者,你可以使用 Azure OpenAI 或 OpenAI 的推理與非推理模型來評審 LLM 法官。 為了性能與成本的最佳平衡,請使用 gpt-5-mini。
範例:
| 評估員 | 它衡量的是什麼 | 所需輸入 | 必要參數 |
|---|---|---|---|
builtin.coherence |
思想的邏輯流動與組織 |
query、response |
deployment_name |
builtin.fluency |
語法準確性與可讀性 | response |
deployment_name |
範例輸入
你的測試資料集應該包含資料映射中引用的欄位:
{"query": "What are the benefits of renewable energy?", "response": "Renewable energy reduces carbon emissions, lowers long-term costs, and provides energy independence."}
{"query": "How does photosynthesis work?", "response": "Plants convert sunlight, water, and carbon dioxide into glucose and oxygen through chlorophyll in their leaves."}
設定範例
資料映射語法:
-
{{item.field_name}}參考你測試資料集中的欄位(例如,{{item.query}})。 -
{{sample.output_text}}參考:評估過程中產生或檢索的回應文字。 在用模型目標或代理人目標評估時,請使用此方法。
testing_criteria = [
{
"type": "azure_ai_evaluator",
"name": "coherence",
"evaluator_name": "builtin.coherence",
"initialization_parameters": {"deployment_name": model_deployment},
"data_mapping": {"query": "{{item.query}}", "response": "{{item.response}}"},
},
{
"type": "azure_ai_evaluator",
"name": "fluency",
"evaluator_name": "builtin.fluency",
"initialization_parameters": {"deployment_name": model_deployment},
"data_mapping": {"response": "{{item.response}}"},
},
]
關於執行評估及設定資料來源的詳細說明,請參閱 SDK 中的執行評估 。
範例輸出
這些評估者會以1至5李克特量表(1 = 非常差,5 = 優異)回傳分數。 預設通過門檻是3。 達到或超過門檻的成績即視為及格。 主要輸出欄位:
{
"type": "azure_ai_evaluator",
"name": "Coherence",
"metric": "coherence",
"score": 4,
"label": "pass",
"reason": "The response directly addresses the question with clear, logical connections between ideas.",
"threshold": 3,
"passed": true
}
備註
這些評估者使用 LLM 作為評判的評分方式,並產生每次評估呼叫的模型推論成本。 評分信度對於非常短的回應(約少於20個標記)可能會有所不同。 兩位評審目前都支持英語回答。
對話層級評估
當你開始 evaluation_level="conversation" 評估跑時,連貫性可以評估完整的對話。 在此模式下,評估者評估的是整個對話的邏輯流程,而非個別回應。
當你想衡量代理人在多個回合中是否維持一致的推理和主題流暢時,可以使用對話層級的連貫性評估。 評估者會考慮想法在整個互動中連結的良好程度,而不僅僅是單一回應。
備註
對話層級評估需要 messages 資料映射中的欄位,該欄位應包含完整的對話陣列,格式為 OpenAI 訊息。