专业口径说明:本文依据公开研究和常见工程实现解释相关机制。不同产品的检索、重排、生成与来源选择策略并不相同;本文不还原任何平台未公开的固定权重,也不构成引用结果承诺。
相关性、可信度、充分性和忠实性是评估 RAG 质量时常用的分析维度,但它们不是所有 AI 产品公开采用的“四项来源评分”。
四个问题分别在检查什么
- 相关性:检索材料是否回答当前问题。
- 充分性:现有材料是否足以支持回答,还是应该继续检索或拒答。
- 忠实性:回答是否受到材料支持,是否添加了材料中没有的结论。
- 来源质量:材料是否适合支撑这类主张,是否可追溯、及时且存在利益关系。
内容方如何使用
这些维度适合作为内容审查表和内部测试框架。它们不能被包装成对 ChatGPT、百度 AI 或其他产品内部权重的还原。
对内容工作的实际意义
- 为关键主张匹配原始来源。
- 把结论、证据、时间和适用范围写清楚。
- 监测回答准确性,而不只统计是否出现品牌。
先分清四个评估对象
- 查询:用户真正要完成什么任务,问题是否包含错误前提或缺少必要条件。
- 检索片段:片段与问题是否相关,证据是否充分,来源是否合适且可追溯。
- 生成回答:回答是否忠实于片段,是否混入片段没有支持的断言,是否正确表达不确定性。
- 来源展示:链接是否指向真正支持该结论的页面,归属是否准确,用户是否能继续核验。
常见故障如何定位
如果检索片段本身不相关,问题可能出在查询扩展、索引或召回;如果片段相关但缺少关键条件,是充分性问题;如果片段完整而回答添加了不存在的数据,是忠实性问题;如果回答准确但链接到不支持该结论的页面,是来源展示或归属问题。
这几类问题需要不同的解决方法。站长只能直接改善自己的页面与证据,不能承诺修复产品内部检索或生成,但可以用清晰记录向平台反馈错误。
拒答也需要分类
- 安全政策拒答:问题触发产品安全边界,不应当作内容优化失败。
- 证据不足拒答:系统没有获得足够材料,适合检查内容覆盖与来源质量。
- 前提不成立:问题包含错误假设,好的系统应纠正前提而不是强行回答。
- 异常失败:超时、界面错误或暂时性服务问题,应从样本中单独标记。
一个轻量评估表
对每个问题分别记录检索相关性、证据充分性、回答忠实性、答案准确性、来源适配度和拒答类型。评分可以使用“通过/部分通过/失败/不适用”,并保留一句判断依据。样本量较小时,原始案例往往比平均分更有价值。
边界与结论
RAG 评估框架用于诊断系统和内容,不等于平台公开的引用选择公式。
-
RAG 评估四个维度权重一样吗?相关性、充分性、忠实性和来源质量是本知识库采用的评估框架,不是所有产品公开的四项权重。可以通过固定数据集、人工标注和错误案例分别测试,但不要把结果当成平台内部评分。
-
能直接测试四个维度的表现吗?可间接测试:在不同 AI 产品中提问目标问题,观察引用情况、准确度和忠实度。虽非量化但能直观反映综合表现。
-
四个维度会互相冲突吗?有可能。极高忠实度(完全照搬)可能降低答案相关性(AI 需要按问题调整措辞)。平衡策略:准确事实+简洁句式方便灵活复述。
