第六次课:知识质量、检索增强与可解释回答
第六次课:知识质量、检索增强与可解释回答
学习目标
通过本讲学习,学生应能够:
- 理解知识准确性、完整性、一致性、时效性和可追溯性的基本含义。
- 使用简单指标评价小型知识图谱或知识抽取结果。
- 识别实体错误、关系错误、信息遗漏、知识冲突和知识过时等常见问题。
- 了解检索增强生成的基本流程,以及检索、证据和回答之间的关系。
- 理解为什么一个可信回答需要给出证据来源。
- 通过案例分析判断回答是否正确、完整、可解释和可核验。
- 为自己的小图谱或抽取结果设计一张质量评价表。
本讲的核心问题是:知识被抽取出来或写入图谱以后,我们怎样判断它是否值得相信和使用?
一、知识数量多,不等于知识质量高
在前几次课中,我们已经完成了小领域选择、schema 设计和文本知识抽取。一个小组可能已经从文本中抽取了几十条甚至上百条三元组。
但是,三元组数量并不能直接说明知识图谱的质量。
例如,一个系统从课程资料中抽取了以下知识:
(认知智能中的知识构建研究,负责人,周老师)
(认知智能中的知识构建研究,总学时,32)
(认知智能中的知识构建研究,要求完成,课程论文)
(认知智能中的知识构建研究,先修课程,深度学习)
假设原始资料只明确说明了课程负责人、16 个学时和课程论文要求,并没有提到“深度学习是先修课程”,那么上述四条知识中至少存在以下问题:
- “总学时 32”与原始资料不一致;
- “先修课程为深度学习”没有来源依据;
- 系统虽然输出了更多知识,但其中包含错误和虚构内容。
因此,知识构建不能只问“抽取了多少”,还要问:
- 抽取的知识是否正确?
- 应该抽取的内容是否被遗漏?
- 不同知识之间是否矛盾?
- 知识是否已经过时?
- 能否找到每条知识的来源?
二、知识质量的五个基本维度
1. 准确性
准确性表示知识是否与可靠来源或人工核验结果一致。
例如,原文为:
本课程共 16 个学时。
正确抽取为:
(本课程,总学时,16)
若抽取为:
(本课程,总学时,32)
则属于事实错误。
准确性通常回答:系统给出的知识中,有多少是正确的?
2. 完整性
完整性表示应该记录的知识是否被充分获取。
例如,一段文本中明确提到课程包含知识图谱、自然语言处理和大语言模型三个主题,但系统只抽取了“知识图谱”,那么虽然这一条是正确的,整体结果仍然不完整。
完整性通常回答:原文中应当获得的知识,有多少被系统找到?
3. 一致性
一致性表示知识之间是否相互协调,是否出现无解释的矛盾。
例如:
(某课程,总学时,16)
(某课程,总学时,32)
如果两条知识没有学期、版本或来源说明,就会形成冲突。
但如果补充时间信息:
(某课程,2025 年总学时,32)
(某课程,2026 年总学时,16)
这两条知识可能并不矛盾,而是在描述不同版本。
因此,一致性检查不能只看数值是否不同,还要结合时间、范围和来源。
4. 时效性
时效性表示知识是否仍然适用于当前时间或当前任务。
例如,旧版教学大纲中的考核方式曾经正确,但课程调整后,它可能不再适合回答当前学生的问题。
时效性通常需要记录:
- 知识产生或发布的时间;
- 知识适用的学期或版本;
- 最近一次核验时间;
- 是否已有更新资料。
“曾经正确”不等于“现在仍然正确”。
5. 可追溯性
可追溯性表示能否说明一条知识来自哪里,以及依据是什么。
例如:
| 知识 | 来源 | 位置 | 访问日期 |
|---|---|---|---|
| 课程总学时为 16 | 课程 README | 课程简介 | 2026-08-10 |
| 课程要求完成论文 | 课程 README | 教学方式 | 2026-08-10 |
可追溯性不是额外装饰,而是核验、纠错、更新和解释知识的基础。
三、知识抽取结果中的常见错误
评价知识质量前,应先建立错误分类。统一的错误类型可以帮助不同小组使用相同标准分析结果。
1. 实体错误
实体错误包括实体边界错误、类型错误、实体缺失和虚构实体。
| 错误类型 | 示例 |
|---|---|
| 边界错误 | 将“北京大学人工智能研究院”只识别为“北京大学” |
| 类型错误 | 将课程名称标记为人物 |
| 实体遗漏 | 未识别原文中的“知识图谱” |
| 虚构实体 | 原文没有“李老师”,系统却生成李老师 |
2. 关系错误
关系错误包括关系类型错误、方向错误、关系遗漏和虚构关系。
原文:课程由周老师负责。
正确:(课程,负责人,周老师)
错误:(课程,作者,周老师)
错误:(周老师,负责人,课程)
3. 属性错误
属性错误常见于数字、日期、单位和版本信息。
例如:
- 将“16 学时”抽取为“16 学分”;
- 将“2026 年 9 月”抽取为“2025 年 9 月”;
- 将旧版属性覆盖新版属性,却没有保留版本信息。
4. 信息遗漏
遗漏是指原文中存在且符合抽取目标的信息没有被提取。
遗漏可能由以下原因造成:
- 表达方式不符合人工规则;
- 实体类型没有包含在 schema 中;
- 模型忽略了较长句子中的后半部分;
- 关系跨越多个句子,工具无法识别;
- 提示词没有明确要求抽取时间或来源。
5. 无依据补充
无依据补充是指系统利用常识或猜测生成了原文没有明确说明的内容。
例如,原文说某课程面向本科三年级学生,模型便推断它的先修课程一定是“机器学习”。这种推断可能合理,但不能直接当作原文事实写入图谱。
6. 冲突与过时
冲突可能来自不同资料、不同时间或不同对象。
例如:
来源 A:某课程采用闭卷考试。
来源 B:某课程采用课程论文考核。
处理前应先检查:
- 是否属于不同学期;
- 是否属于不同班级;
- 哪个来源更权威;
- 哪个来源更新;
- 是否需要同时保留并标记适用范围。
四、用简单指标评价知识抽取结果
1. 建立参考答案
评价前,需要先由人工整理一份参考答案。参考答案可以由两名或多名小组成员分别标注,再讨论存在分歧的内容。
参考答案并不一定绝对完美,但它必须遵循统一 schema,并有明确的原文依据。
2. 正确、错误与遗漏
将系统输出与参考答案比较,可以把结果分成三类:
| 类别 | 含义 |
|---|---|
| 正确 | 抽取结果与参考答案一致,且有原文依据 |
| 错误 | 系统给出了结果,但内容、类型、方向或证据不正确 |
| 遗漏 | 参考答案中存在,但系统没有抽取出来 |
3. 准确率
准确率表示系统抽取出来的结果中,有多少是正确的。
准确率 = 正确结果数 ÷ 系统抽取结果总数
例如,系统抽取了 20 条三元组,其中 16 条正确:
准确率 = 16 ÷ 20 = 80%
4. 召回率
召回率表示参考答案中应该抽取的知识,有多少被系统找到。
召回率 = 正确结果数 ÷ 参考答案中的结果总数
例如,参考答案共有 25 条三元组,系统正确抽取了 16 条:
召回率 = 16 ÷ 25 = 64%
召回率也可以理解为对“遗漏情况”的量化。
5. 来源可追溯率
来源可追溯率表示抽取结果中有多少能够定位到明确来源和证据。
来源可追溯率 = 有明确来源和证据的结果数 ÷ 抽取结果总数
例如,20 条三元组中只有 12 条记录了来源:
来源可追溯率 = 12 ÷ 20 = 60%
6. 指标不能代替案例分析
两个方法可能具有相同准确率,但错误类型完全不同:
- 方法 A 主要遗漏长句中的关系;
- 方法 B 主要生成原文不存在的关系。
对于知识构建任务,第二类错误可能风险更高。因此,评价不能只报告一个分数,还应分析典型案例。
五、从知识库到检索增强生成
大语言模型可以直接回答问题,但其参数中的知识可能不准确、难以更新或无法追溯。检索增强生成(Retrieval-Augmented Generation,RAG)的基本思路是:回答之前先查资料,再根据资料生成答案。
1. 基本流程
准备知识资料
↓
整理并建立可检索的知识库
↓
接收用户问题
↓
检索相关文本、表格或知识图谱内容
↓
将检索结果作为证据提供给大语言模型
↓
生成回答并标注来源
2. RAG 中的三个关键环节
知识准备
知识库中的资料必须真实、完整、版本明确。若知识库本身包含错误,检索增强也可能生成错误回答。
知识检索
系统需要从知识库中找出与问题最相关的内容。检索结果可能出现:
- 找到了正确证据;
- 找到了相关但不足以回答问题的内容;
- 找到了过时或错误资料;
- 没有找到应有证据;
- 找到了过多无关内容。
回答生成
大语言模型需要依据检索证据组织答案。即使检索到了正确资料,模型仍可能误读证据、忽略证据或加入无依据内容。
因此,评价 RAG 不能只看最终回答,还要分别检查知识库、检索结果和生成回答。
六、为什么回答需要证据来源
1. 证据帮助核验答案
如果系统只回答“本课程共 16 学时”,用户无法判断这个数字来自哪里。
更可信的回答是:
本课程共 16 个学时。依据:课程 README 中的课程安排说明。
用户可以继续打开来源并核对原文。
2. 证据帮助发现过时信息
如果两个回答分别引用 2025 年和 2026 年的课程大纲,用户可以判断它们可能对应不同版本。
3. 证据提高解释性
可解释回答不只是“说得更详细”,而是说明:
- 使用了哪些资料;
- 哪些证据支持结论;
- 哪些内容仍然不确定;
- 是否存在冲突来源。
4. 有来源不等于来源可靠
系统给出链接或文档名称,只能说明答案“有出处”,不能自动证明出处可信。
还应检查:
- 来源是否真实存在;
- 来源是否权威;
- 引用内容是否真的支持答案;
- 来源是否过时;
- 是否只引用了对自己有利的片段。
七、如何评价一个检索增强回答
假设用户提问:
这门课最终需要提交什么成果?
系统回答:
学生需要提交一篇自己撰写的相关课程论文。来源:课程 README。
可以从以下方面评价:
| 评价维度 | 检查问题 |
|---|---|
| 回答准确性 | 回答是否与原始资料一致? |
| 回答完整性 | 是否遗漏了问题要求的关键信息? |
| 证据相关性 | 引用内容是否真正支持回答? |
| 来源可追溯性 | 能否定位到具体文档或段落? |
| 时效性 | 来源是否适用于当前学期? |
| 忠实性 | 回答是否添加了证据中没有的内容? |
三类典型案例
案例一:答案正确,证据正确
回答与原文一致,引用内容能够直接支持答案。这是理想情况。
案例二:答案看似正确,但证据不支持
回答可能碰巧正确,但引用资料没有相关内容。这种回答不可视为充分可信。
案例三:检索到正确证据,但回答错误
系统检索到了正确教学大纲,却把“课程论文”误写成“毕业论文”。说明问题出在生成阶段,而不是检索阶段。
通过区分这些情况,可以更准确地定位系统问题。
八、案例分析:直接回答与检索增强回答
问题
《认知智能中的知识构建研究》课程主要采用什么教学方式?
回答 A:直接回答
课程主要采用教师讲授、实验教学和期末考试相结合的方式。
可能的问题:
- 回答中包含“实验教学”和“期末考试”,但未给出证据;
- 回答可能来自模型的常见课程经验,而不是本课程资料;
- 用户无法核验答案。
回答 B:检索增强回答
课程采用“教师讲授 + 文献研讨 + 专题汇报 + 方案设计”的方式组织。依据为课程 README 中的“教学方式”部分。
评价:
- 回答与课程资料一致;
- 来源明确;
- 引用内容与问题直接相关;
- 用户可以返回原文核验。
进一步思考
如果 README 后续被修改,知识库中的旧版本是否会自动更新?如果新旧版本同时存在,检索系统会优先选择哪一个?这说明 RAG 仍然依赖知识质量和版本管理。
九、为小图谱或抽取结果设计评价表
评价表应同时记录数量、质量和具体证据。下面给出一个基础模板。
1. 总体评价表
| 评价项目 | 结果 | 计算或判断依据 |
|---|---|---|
| 参考答案三元组数 | 人工核验结果 | |
| 系统抽取三元组数 | 方法输出结果 | |
| 正确三元组数 | 与参考答案一致且有证据 | |
| 错误三元组数 | 事实、类型、方向或证据错误 | |
| 遗漏三元组数 | 参考答案中有、系统未抽取 | |
| 准确率 | 正确数 ÷ 系统抽取总数 | |
| 召回率 | 正确数 ÷ 参考答案总数 | |
| 有来源记录的三元组数 | 能定位到原文或文件 | |
| 来源可追溯率 | 有来源结果数 ÷ 系统抽取总数 | |
| 冲突知识数 | 多来源信息不一致 | |
| 过时知识数 | 已有更新版本或不再适用 |
2. 逐条案例记录表
| 编号 | 原文证据 | 参考知识 | 系统结果 | 判断 | 错误类型 | 来源 | 备注 |
|---|---|---|---|---|---|---|---|
| 1 | “课程共 16 学时” | (课程,总学时,16) | (课程,总学时,16) | 正确 | 无 | README | |
| 2 | “学生提交课程论文” | (学生,提交,课程论文) | (学生,发表,课程论文) | 错误 | 关系错误 | README | “提交”被改为“发表” |
| 3 | “由周老师负责” | (课程,负责人,周老师) | 未抽取 | 遗漏 | 关系遗漏 | README | 规则未覆盖该句式 |
3. 错误类型汇总表
| 错误类型 | 数量 | 典型案例 | 可能原因 | 改进想法 |
|---|---|---|---|---|
| 实体边界错误 | ||||
| 实体类型错误 | ||||
| 关系类型错误 | ||||
| 关系方向错误 | ||||
| 信息遗漏 | ||||
| 无依据补充 | ||||
| 来源缺失 | ||||
| 知识过时 |
这三张表可以直接作为后续课程项目实验记录的一部分。
十、课堂练习:评价本组已有结果
每组从第五次课的抽取结果中选择 10–20 条三元组,完成以下任务:
- 核对原文,建立参考答案;
- 将抽取结果标记为正确、错误或遗漏;
- 计算准确率和召回率;
- 检查每条知识是否有明确来源;
- 统计来源可追溯率;
- 标记可能的冲突知识和过时知识;
- 选择至少 3 个典型错误进行原因分析;
- 提出一个可以在后续实验中验证的改进方法。
课堂汇报时,应使用具体证据表达:
本组共检查 20 条抽取结果,其中 15 条正确、3 条错误、2 条无明确来源。错误主要集中在关系类型混淆和时间信息遗漏。下一步准备在抽取提示中增加关系定义、时间字段和证据字段,比较修改前后的准确率与可追溯率。
十一、课后任务:知识质量评价报告
基于本组小型知识图谱或第五次课的抽取结果,提交一份“知识质量评价报告”。
报告包括:
- 评价对象:说明图谱领域、数据来源、三元组数量和抽取方法;
- 参考答案:说明参考答案如何建立、由谁核验;
- 总体评价表:填写准确率、召回率、错误数、遗漏数和来源可追溯率;
- 错误类型表:统计主要错误类型;
- 案例分析:至少分析 3 个正确案例和 3 个错误或遗漏案例;
- 来源检查:说明资料来源是否权威、是否存在旧版本或冲突;
- 可解释回答示例:基于图谱或资料库回答 2 个问题,并为每个回答提供证据来源;
- 改进方案:提出一个范围可控、可以通过再次实验验证的改进方法。
评价报告必须如实保留失败结果。错误、遗漏和冲突是分析对象,不应通过删除不利结果来美化实验。
十二、本讲小结
本讲的核心观点是:
- 知识数量不能代表知识质量;
- 准确性、完整性、一致性、时效性和可追溯性是知识质量的基础维度;
- 准确率反映抽取结果中有多少正确,召回率反映应抽取的知识有多少被找到;
- 指标需要与错误案例结合,才能解释系统为什么成功或失败;
- RAG 的基本思想是先检索外部知识,再依据证据生成回答;
- 检索到资料不等于最终回答正确,还要检查证据相关性和回答忠实性;
- 可解释回答需要给出能够核验的来源,并诚实说明不确定性;
- 一张规范的评价表可以将零散观察转化为后续论文中的实验依据。
下一讲将讨论如何从已有观察和评价结果中形成研究问题,设计简单的对比实验,并将课程项目逐步转化为一项规范的小型研究。
