跳至主要內容

第一次课:认知智能与知识构建——智能系统为什么需要知识

周子力大约 12 分钟教学文档认知智能知识构建知识图谱大语言模型

第一次课:认知智能与知识构建——智能系统为什么需要知识

学习目标

通过本讲学习,学生应能够:

  1. 理解认知智能与知识构建的基本含义。
  2. 区分数据、信息与知识。
  3. 了解文本知识、结构化知识、参数化知识和检索型知识的基本特点。
  4. 初步理解知识图谱、大语言模型、检索增强生成和智能体之间的关系。
  5. 从真实场景中发现知识问题,并提出初步研究问题。

本讲不要求掌握复杂算法、训练模型或数学推导。重点是建立课程地图,并理解:科研的起点不是“我想用一个模型”,而是“这里存在一个值得解释或改进的问题”。


一、从一个问题开始:会回答,等于真正知道吗?

请思考以下情境:

某位同学向大语言模型提问:

人工智能导论课程的考试要求是什么?

模型给出了完整、流畅的回答,包括考试形式、分数比例和复习重点。但经核对发现,其中部分信息来自旧版课程通知,甚至包含了并不存在的要求。

这个案例说明:一个系统能够生成自然、连贯的语言,并不意味着它掌握了可靠的知识。

智能系统在使用知识时,常常面临以下问题:

  • 它的知识从哪里来?
  • 这些知识是否真实、准确、完整?
  • 不同来源的信息发生冲突时,系统相信什么?
  • 知识发生变化后,系统能否及时更新?
  • 系统给出答案时,能否说明依据是什么?

这些问题构成了“认知智能中的知识构建研究”的核心。


二、什么是认知智能

认知智能关注智能系统如何理解环境、积累经验、使用知识并完成任务。它不仅关注“输入什么,输出什么”,还关注系统内部如何组织信息、理解概念、建立关联、进行推理和修正错误。

一个具有认知能力的智能系统,通常需要完成以下过程:

感知与获取
    ↓
理解与表示
    ↓
记忆与组织
    ↓
推理与决策
    ↓
行动与反馈
    ↓
学习与更新

例如,一个学习助手接收到“我应该先学什么课程”的问题后,需要:

  1. 理解学生询问的是课程学习路径。
  2. 获取课程介绍、培养方案、先修关系等资料。
  3. 将这些资料组织为可查询的知识。
  4. 根据学生已修课程进行推理。
  5. 给出建议,并说明建议依据。
  6. 在培养方案更新后同步修正自己的知识。

其中,“获取、组织、表示、推理和更新知识”就是本课程关注的重点。


三、什么是知识构建

知识构建是指将分散的、原始的、可能不完整甚至相互冲突的信息,转化为机器能够理解、存储、查询、推理和更新的知识的过程。

可以将它理解为一条完整链条:

文本、表格、网页、数据库、图像、专家经验
                    ↓
              知识获取与抽取
                    ↓
           知识表示与组织结构
                    ↓
        融合、核验、质量评估与更新
                    ↓
       问答、推荐、推理、决策与智能体行动

知识构建不是单一技术,而是一系列问题的组合:

  • 如何从文本中识别实体、关系和事件?
  • 如何为知识设计统一的概念体系与关系结构?
  • 如何将不同来源的同一实体对齐?
  • 当不同资料给出矛盾结论时,如何消解冲突?
  • 如何评价知识是否准确、完整、可靠?
  • 当现实世界发生变化时,如何更新系统中的知识?

四、数据、信息与知识

数据、信息和知识之间存在层次差异。

1. 数据

数据是原始记录,尚未经过解释或组织。

例如:

  • 一份课程通知;
  • 一张课表;
  • 某网页上的课程介绍;
  • 一组学生成绩;
  • 一篇新闻文本。

2. 信息

信息是经过整理后能够表达某个事实的内容。

例如:

  • 《人工智能导论》在周三上午上课;
  • 课程总评由作业、实验和考试组成;
  • 某课程由某位教师负责。

3. 知识

知识不仅是单个事实,还包含概念、关系、规则和可用于推理的结构。

例如:

  • 如果学生没有 Python 编程基础,学习机器学习课程可能会有困难;
  • 如果某门课程是另一门课程的先修课,则应先完成前者;
  • 如果课程教学大纲更新,则旧版本中的考核要求不应直接用于回答当前问题。

可以简单表示为:

数据:一份课程通知
信息:课程考试占总评的 40%
知识:课程考核要求会随教学大纲版本变化,应优先使用最新版本

五、知识的常见表示方式

同一份知识可以用不同方式表示。不同表示方式决定了系统能够完成什么任务。

表示方式示例特点
文本知识“《人工智能导论》面向本科三年级学生开设。”信息丰富、容易获取,但机器不易直接推理
结构化知识(人工智能导论,面向,本科三年级学生)清晰、可查询、可建立关系
本体或概念体系“课程”属于“教学资源”,“先修课程”属于课程关系统一概念与关系的含义
向量表示将课程介绍编码为一组数值,用于语义检索适合相似度计算与检索,但解释性较弱
参数化知识大语言模型在训练中吸收的语言模式和事实使用方便,但难追溯、可能过时或产生幻觉

三元组表示

知识图谱中常用“实体—关系—实体(或属性值)”表示一个事实,称为三元组。

例如:

(人工智能导论,面向,本科三年级学生)
(人工智能导论,负责人,李老师)
(人工智能导论,包含,知识图谱)
(人工智能导论,建议前置能力,Python 编程基础)

这些三元组连接起来,就形成了一个小型知识图谱。


六、知识图谱、大语言模型与智能体

1. 知识图谱

知识图谱是一种以图结构组织知识的方式。它通常由实体、关系、属性和规则组成。

例如,在课程场景中:

学生 ──修读──> 课程
课程 ──包含──> 知识点
课程 ──建议前置能力──> Python
课程 ──负责人──> 教师

知识图谱的优势是:

  • 知识结构清楚;
  • 支持查询与关联分析;
  • 可展示推理路径;
  • 易于追溯知识来源;
  • 适合处理实体和关系明确的任务。

其局限是构建和维护成本较高,面对开放、复杂文本时需要额外的抽取与融合工作。

2. 大语言模型

大语言模型能够理解和生成自然语言,并在训练过程中学习大量语言模式和部分事实知识。

它的优势是:

  • 可以直接理解自然语言问题;
  • 能从文本中总结、抽取和生成内容;
  • 交互自然,适合问答和辅助写作。

但它也存在明显局限:

  • 可能产生“幻觉”,即生成看似合理但不真实的内容;
  • 知识可能过时;
  • 难以说明答案来自何处;
  • 对具体领域事实的可靠性不稳定。

3. 检索增强生成

检索增强生成(Retrieval-Augmented Generation,RAG)是在大模型回答前,先从外部资料库中检索相关内容,再依据检索结果生成回答。

基本过程如下:

用户问题
   ↓
检索相关文档、数据库或知识图谱
   ↓
获得可引用的证据
   ↓
大语言模型组织回答
   ↓
输出带有事实依据的结果

RAG 的核心价值是:让模型在回答时更多依赖外部、可更新、可追溯的知识,而不只依赖模型内部记忆。

4. 智能体

智能体是在完成任务时能够规划步骤、调用工具、使用外部知识并根据结果调整行动的系统。

例如,一个课程学习智能体可以:

  1. 理解学生的学习目标;
  2. 查询课程知识图谱;
  3. 检索教学大纲与课程资料;
  4. 调用日历或选课工具;
  5. 生成个性化学习建议;
  6. 根据学生反馈调整后续计划。

智能体需要组织的不只是事实知识,还包括任务知识、工具知识和交互过程中的记忆。


七、知识构建研究关注的核心问题

本课程将围绕以下问题展开:

研究环节典型问题
知识获取如何从文本、表格、网页或图像中抽取实体、关系和事件?
知识表示如何将知识组织成三元组、概念体系、知识图谱或向量库?
知识融合多个来源描述同一事实时,如何识别、合并或处理冲突?
知识质量如何判断知识是否准确、完整、一致、可追溯?
知识推理系统如何利用已有知识得到新的结论?
知识更新当事实变化时,如何发现旧知识并进行修正?
知识增强如何利用知识图谱、检索和工具调用降低大模型幻觉?

这些问题既具有理论意义,也与现实应用密切相关。


八、从应用想法到研究问题

科研不是简单地说“我要做一个系统”,而是要说明系统中存在什么值得验证和改进的问题。

应用想法可研究的问题
做一个校园问答机器人当课程通知频繁更新时,如何减少问答系统引用过时信息的情况?
用大模型构建知识图谱大语言模型从课程文本中抽取关系时,最常见的错误是什么?使用关系约束能否减少这些错误?
做一个论文问答系统与直接提问大模型相比,加入文献检索后能否提高回答的事实正确性和证据可追溯性?
做一个疾病科普系统不同来源的疾病科普文本出现冲突时,如何识别并标记不一致的知识?

一个适合本课程的初步研究问题,通常应满足以下条件:

  1. 对象明确:针对什么领域、什么数据或什么场景;
  2. 问题具体:知识在哪个环节存在缺失、错误、冲突或不足;
  3. 可以验证:能够通过数据、案例或方法比较进行判断;
  4. 范围可控:可以在一个学期内完成初步研究。

九、课堂练习:从文本到知识图谱

阅读以下文本:

《人工智能导论》面向本科三年级学生开设,由李老师负责。课程包含机器学习、知识图谱和大语言模型三个主题。修读该课程前,建议学生掌握 Python 编程基础。

完成以下任务:

  1. 找出文本中的实体;
  2. 找出实体之间的关系;
  3. 写出至少 5 条三元组;
  4. 提出一个文本无法直接回答、但学习助手可能需要回答的问题。

参考三元组:

(人工智能导论,面向,本科三年级学生)
(人工智能导论,负责人,李老师)
(人工智能导论,包含,机器学习)
(人工智能导论,包含,知识图谱)
(人工智能导论,包含,大语言模型)
(人工智能导论,建议前置能力,Python 编程基础)

可以继续思考:

  • “建议掌握 Python”是否等于“必须先修 Python”?
  • 如果另一份通知显示课程负责人是王老师,应如何处理?
  • 如果明年课程教学内容改变,旧知识如何更新?
  • 如何让系统在回答时展示信息来源?

这些问题将在后续课程中逐步展开。


十、课后任务:问题观察卡

请选择一个熟悉的应用场景,例如学习助手、校园服务、医疗科普、旅游问答、科研文献检索、传统文化问答等,完成一份 300–500 字的“问题观察卡”。

内容包括:

  1. 应用场景:系统面向谁,解决什么需求;
  2. 知识来源:它可能依赖哪些文本、数据库、网页、专家知识或其他资料;
  3. 知识问题:指出一种具体问题,例如知识缺失、错误、冲突、过时、无法解释或调用不当;
  4. 初步研究问题:用一句问句表述;
  5. 初步验证方式:说明准备收集什么材料,或比较什么方法。

示例:

在课程问答场景中,大语言模型可能将旧版教学大纲中的考试要求作为当前要求回答。该系统需要使用课程通知、教学大纲和课程网站等知识来源。我的研究问题是:加入课程资料检索与来源引用后,是否能降低课程问答中的过时信息错误?我准备收集不同版本的课程资料和若干学生常见问题,对比直接提问大模型与检索增强回答的正确性和可追溯性。


十一、本讲小结

本讲的核心观点是:

  • 认知智能离不开知识;
  • 知识不仅要被获取,还要被组织、核验、调用和更新;
  • 大语言模型可以使用知识,但不天然保证知识真实、完整和可追溯;
  • 知识图谱、检索增强生成和智能体为可靠知识使用提供了不同路径;
  • 科研的起点是从真实场景中发现一个清晰、可验证、范围可控的问题。

下一讲将讨论:同一份知识可以如何表示,以及不同知识表示方式会如何影响系统的查询、推理和应用能力。

上次编辑于:
贡献者: zlzhou