跳至主要內容

第七次课:从观察到研究方案——提出一个小问题

周子力大约 18 分钟教学文档科研方法研究问题实验设计知识构建

第七次课:从观察到研究方案——提出一个小问题

学习目标

通过本讲学习,学生应能够:

  1. 区分工程任务、应用目标和研究问题。
  2. 使用“研究对象—比较方法—评价标准”表达一个可验证的研究问题。
  3. 理解 baseline、对比实验、案例分析和研究局限的基本含义。
  4. 判断一个研究问题是否范围适中、数据可得并能在课程内完成。
  5. 将前几次课积累的图谱、抽取结果和质量分析收敛为一个小型研究项目。
  6. 完成一页研究方案,包括问题、数据、两种比较方法、评价方式、预期结果和风险。

本讲的核心原则是:本科生的课程研究不需要一开始就解决宏大问题,但必须提出一个清楚、可比较、可评价、可以真正完成的小问题。


一、从“做一个系统”到“研究一个问题”

前几次课中,各小组已经完成了小领域选择、知识图谱 schema、文本知识抽取、文献阅读和知识质量评价。此时,学生常会这样描述自己的项目:

  • 做一个课程知识图谱;
  • 用大模型抽取古诗词知识;
  • 做一个校园问答系统;
  • 用 RAG 减少大模型幻觉;
  • 做一个疾病科普知识库。

这些表达说明了大致方向,但还不是完整的研究问题。它们没有说明:

  • 具体研究什么现象;
  • 准备比较哪些方法;
  • 使用什么数据;
  • 如何判断结果是否更好;
  • 研究范围是否能够在课程内完成。

研究方案需要把“想做什么”进一步转换为“想验证什么”。

模糊兴趣
   ↓
真实观察或具体困难
   ↓
可以比较的研究问题
   ↓
数据、方法与评价设计
   ↓
小规模实验和证据
   ↓
课程论文

二、工程任务、应用目标与研究问题

1. 工程任务

工程任务强调“把一个系统或功能做出来”。

例如:

  • 搭建一个课程问答系统;
  • 构建一个古诗词知识图谱;
  • 开发一个文本关系抽取工具;
  • 建立一个校园资料检索库。

完成工程任务可以体现实践能力,但如果只展示系统页面或功能,通常还不能构成完整研究。

2. 应用目标

应用目标强调系统服务什么人、解决什么需求。

例如:

  • 帮助学生查询课程的先修关系;
  • 帮助读者发现古诗中的常见意象;
  • 帮助用户从多份课程资料中查找最新要求;
  • 帮助研究者整理某个主题下的论文关系。

应用目标比工程任务更接近真实需求,但仍需要转化为可以验证的研究问题。

3. 研究问题

研究问题强调一个可以通过数据和实验回答的问题。

例如:

在 30 篇课程通知文本中,与简单人工规则相比,使用带有 schema 约束的 LLM 提示词是否能提高关系抽取的召回率,并减少无依据三元组?

这个问题包含:

  • 研究对象:30 篇课程通知;
  • 比较方法:人工规则与带 schema 约束的 LLM;
  • 评价标准:召回率和无依据三元组数量;
  • 任务边界:课程通知中的关系抽取。

4. 三者之间的关系

类型主要问题示例
工程任务要做出什么?构建课程问答系统
应用目标为谁解决什么需求?帮助学生查询最新课程要求
研究问题要比较和验证什么?RAG 是否比直接提问更能减少过时信息错误?

一个课程项目可以包含工程实现,但课程论文必须围绕研究问题组织证据。


三、研究问题从哪里来

研究问题不一定来自“灵光一现”,更多时候来自前期工作的具体观察。

1. 来自抽取错误

第五次课中可能观察到:

  • 人工规则准确,但遗漏较多;
  • LLM 抽取较完整,但会补充原文没有的知识;
  • 现成工具无法识别领域术语;
  • 时间、否定和条件信息容易被忽略。

这些观察可以转化为研究问题:

在课程通知的关系抽取中,要求 LLM 同时输出原文证据,是否能减少无依据关系?

2. 来自知识质量问题

第六次课中可能观察到:

  • 图谱中部分知识没有来源;
  • 同一实体有多个不同名称;
  • 旧版资料与新版资料发生冲突;
  • 检索系统找到相关资料,但回答仍然错误。

这些观察可以转化为研究问题:

在课程问答中,加入资料日期与版本信息后,系统是否更少引用过时知识?

3. 来自文献局限

第四次课阅读论文时可能发现:

  • 已有方法只在英文数据上测试;
  • 研究只报告总体指标,没有分析错误类型;
  • 方法没有记录知识来源;
  • 实验数据与自己的小领域明显不同。

这些局限可以转化为小规模验证:

某种通用实体识别工具在古诗词文本中最常见的错误类型是什么?增加领域词表后是否有所改善?

4. 来自方法比较

如果两种方法各有优缺点,可以提出比较型问题:

对于格式相对固定的校园通知,人工规则和 LLM 在实体与关系抽取的准确率、召回率和错误类型上有何差异?

比较型问题特别适合大三学生,因为它不要求提出全新的复杂模型,但能够训练规范的数据、实验和分析方法。


四、研究问题的基本表达

一个适合课程项目的研究问题,至少应说明研究对象、比较方法和评价标准。

1. 研究对象

研究对象说明“在哪些数据、领域或场景中研究”。

例如:

  • 30 篇课程通知;
  • 20 首唐诗及其公开注释;
  • 某一种疾病的 50 段权威科普文本;
  • 某个 AI 主题下的 30 篇论文摘要;
  • 由 20 个问题组成的课程问答测试集。

“中文文本”“知识图谱数据”通常过于宽泛,应进一步限定领域、来源和规模。

2. 比较方法

比较方法说明“准备比较什么”。

适合课程项目的比较包括:

  • 人工规则与 LLM 抽取;
  • 无 schema 提示与有 schema 提示;
  • 不要求证据与要求证据的提示方式;
  • 直接提问大模型与检索增强回答;
  • 不使用领域词表与使用领域词表;
  • 不记录时间信息与记录时间/版本信息。

比较方法应控制在两种或少量几种,避免一次比较过多方法导致实验无法完成。

3. 评价标准

评价标准说明“如何判断结果”。

可以选择:

  • 实体或关系抽取准确率;
  • 召回率与遗漏数量;
  • 无依据知识数量;
  • 来源可追溯率;
  • 过时信息错误数量;
  • 回答正确率;
  • 证据是否支持回答;
  • 不同错误类型的数量和比例。

4. 基本表达模板

在【研究对象】上,与【方法 A】相比,【方法 B】是否能够在
【评价指标】方面获得改善?它主要减少或增加了哪些错误?

例如:

在 20 首唐诗及其注释文本上,与开放式 LLM 抽取相比,加入实体类型和关系类型约束的提示词是否能够提高三元组准确率,并减少无依据的主题关系?

也可以使用分析型表达:

【某种方法】在【某类数据】上的主要错误类型是什么?这些错误与
【文本特点、提示方式或 schema 设计】有什么关系?

例如:

通用命名实体识别工具在古诗词文本中的主要实体边界错误是什么?增加诗人、地点和意象词表后,哪些错误得到改善?


五、什么是 Baseline

Baseline 通常译为基线或基准方法,是实验中用于比较的基本方法。

假设学生提出一种带 schema 和证据要求的 LLM 抽取方法,可以将简单提示的 LLM 抽取作为 baseline:

Baseline:只要求“从文本中抽取三元组”
改进方法:提供实体类型、关系类型、JSON 格式和原文证据要求

如果研究 RAG,可以设置:

Baseline:直接向大模型提问
比较方法:检索课程资料后再回答,并要求引用证据

Baseline 的作用

  • 判断改进方法是否真的比简单方法好;
  • 明确结果提升来自哪里;
  • 避免只展示一种方法,无法解释其效果;
  • 为论文中的对比实验提供参照。

适合本科课程项目的 Baseline

  • 简单人工规则;
  • 不带示例的提示词;
  • 不带 schema 的提示词;
  • 直接大模型回答;
  • 现成 NLP 工具的默认结果;
  • 不进行来源或版本过滤的检索结果。

Baseline 不一定复杂,但必须与研究问题相关,并在相同数据和评价标准下比较。


六、什么是对比实验

对比实验是在尽可能保持其他条件相同的情况下,比较不同方法的结果。

例如,要比较“是否要求原文证据”的影响:

实验条件方法 A方法 B
测试文本相同的 30 段文本相同的 30 段文本
实体和关系 schema相同相同
模型相同相同
输出格式相同相同
唯一差异不要求证据要求原文证据

这样,结果差异更可能来自“证据要求”,而不是数据、模型或其他条件不同。

常见的不公平比较

  • 方法 A 使用 10 段简单文本,方法 B 使用 30 段复杂文本;
  • 两种方法使用不同的实体和关系定义;
  • 只认真检查新方法的结果,没有同样检查 baseline;
  • 只展示新方法成功的案例;
  • 改变了多个条件,却把效果归因于其中一个条件。

课程项目不要求复杂实验,但要求比较过程尽量公平、透明。


七、案例分析和研究局限

1. 为什么要做案例分析

准确率和召回率能说明总体表现,但不能解释方法为什么成功或失败。

案例分析应至少包括:

  • 方法 A 正确、方法 B 错误的案例;
  • 方法 B 正确、方法 A 遗漏的案例;
  • 两种方法都失败的案例;
  • 具有代表性的实体、关系或回答错误。

例如:

对于“建议学生掌握 Python 基础”,规则方法未抽取关系;LLM 将“建议前置能力”错误改写为“必须先修”。说明 LLM 能发现隐含联系,但可能把较弱的建议关系强化为强制关系。

这样的案例可以解释指标差异,也能形成下一步改进方向。

2. 什么是研究局限

研究局限是对结果适用范围的诚实说明。

课程项目常见局限包括:

  • 数据量较小;
  • 只选择了一个领域;
  • 参考答案由学生标注,可能存在主观性;
  • 只比较了两种简单方法;
  • 使用的 LLM 可能随版本更新而变化;
  • 没有训练新模型;
  • 实验结果不能直接推广到其他领域。

局限不意味着研究没有价值。清楚说明局限,反而说明研究者理解自己的证据能够支持到什么程度。


八、把问题收敛到课程内能够完成

1. 过大的问题

以下问题通常超出课程范围:

  • 如何解决大语言模型幻觉?
  • 如何构建完整的医学知识图谱?
  • 如何让知识图谱实现真正的认知智能?
  • 如何设计一个超过现有模型的新算法?

这些问题对象过宽、资源需求过大,也缺少清晰的评价范围。

2. 收敛后的问题

可以将大问题缩小:

大问题课程内可完成的小问题
如何解决大模型幻觉?在 20 个课程问答问题上,要求引用原文是否能减少无依据回答?
如何构建医学知识图谱?从 30 段权威疾病科普文本中构建症状—疾病小图谱,并分析抽取错误。
如何改进知识抽取?在校园通知文本中,加入 schema 约束是否能提高 LLM 关系抽取准确率?
如何实现知识更新?为不同版本的课程通知增加时间字段,是否能减少系统引用过时要求?

3. 可完成性检查

在确定研究问题前,应回答:

  1. 数据能否在一周内收集或整理?
  2. 参考答案能否由小组人工完成?
  3. 两种比较方法能否实际运行?
  4. 指标能否计算或人工评价?
  5. 是否能找到至少 2–3 个典型案例?
  6. 即使没有明显提升,是否仍能分析失败原因?
  7. 是否能在课程结束前形成完整论文?

如果大部分问题无法回答,应继续缩小研究范围。


九、一页研究方案的基本结构

一页研究方案不需要写成长篇论文,但应让读者能够判断项目是否值得做、能否完成以及如何验证。

1. 研究题目

题目应包含对象、任务或比较重点。

例如:

Schema 约束对大语言模型课程文本关系抽取效果的影响

2. 问题背景与观察

用 2–3 句话说明:

  • 真实场景中出现了什么问题;
  • 前期抽取或质量评价发现了什么现象;
  • 为什么值得继续验证。

3. 研究问题

用一句问句写清对象、方法比较和评价指标。

4. 数据

说明:

  • 数据来自哪里;
  • 计划使用多少文本或问题;
  • 数据包含哪些类型;
  • 如何建立人工参考答案;
  • 是否涉及版权、隐私或敏感信息。

5. 两种比较方法

至少包括:

  • 方法 A:baseline;
  • 方法 B:要验证的比较方法或改进策略。

两种方法应使用相同测试数据和统一 schema。

6. 评价方式

根据任务选择 2–4 项:

  • 准确率;
  • 召回率;
  • 错误与遗漏数量;
  • 来源可追溯率;
  • 无依据知识数量;
  • 回答正确率;
  • 典型案例分析。

7. 预期结果

预期结果是一项研究假设,不是提前宣布实验结论。

例如:

预计加入 schema 和证据约束后,无依据三元组数量会减少,准确率可能提高;但由于约束更严格,部分隐含关系可能被遗漏,召回率不一定提高。

这种表述同时考虑可能的收益和代价,更符合研究逻辑。

8. 风险与备用方案

需要提前说明:

  • 数据不足怎么办;
  • 两种方法结果差异很小怎么办;
  • 工具或模型无法使用怎么办;
  • 人工标注存在分歧怎么办;
  • 项目规模超出预期时如何缩小。

十、一页研究方案模板

项目题目:

1. 背景与观察
用 2–3 句话说明真实问题和前期发现。

2. 研究问题
在【研究对象】上,与【方法 A】相比,【方法 B】是否能在
【评价指标】方面获得改善?主要错误类型有何变化?

3. 数据
数据来源:
数据规模:
数据类型:
参考答案建立方式:

4. 比较方法
方法 A(Baseline):
方法 B(比较/改进方法):
需要保持相同的实验条件:

5. 评价方式
指标 1:
指标 2:
案例分析方式:

6. 预期结果
预计可能出现的结果及理由:

7. 风险与备用方案
风险 1:             备用方案:
风险 2:             备用方案:

8. 相关文献
列出 2–3 篇与问题最相关的论文。

十一、示例研究方案

项目题目

原文证据约束对 LLM 课程文本关系抽取质量的影响

背景与观察

前期实验发现,LLM 能从课程介绍中抽取较多关系,但有时会将“建议掌握”错误地抽取为“必须先修”,也可能生成原文中不存在的课程关系。缺少原文证据会增加人工核验成本。

研究问题

在 30 段课程介绍与通知文本上,与普通抽取提示相比,要求 LLM 为每条三元组提供原文证据,是否能提高关系抽取准确率并减少无依据三元组?

数据

  • 30 段公开课程介绍与通知;
  • 每段约 100–300 字;
  • 由两名小组成员根据统一 schema 标注参考三元组;
  • 出现分歧时通过讨论形成最终参考答案。

比较方法

  • 方法 A:只要求 LLM 抽取三元组;
  • 方法 B:提供相同 schema,同时要求每条三元组附带原文证据;
  • 两种方法使用相同文本、相同模型和相同实体关系类型。

评价方式

  • 三元组准确率;
  • 三元组召回率;
  • 无依据三元组数量;
  • 关系类型错误数量;
  • 典型错误案例分析。

预期结果

预计证据约束可以减少无依据三元组并提高准确率,但可能使模型倾向于输出较少结果,从而影响召回率。

风险与备用方案

  • 若 30 段文本标注工作量过大,缩小为 20 段;
  • 若两种提示结果差异较小,重点分析不同关系类型上的表现;
  • 若模型输出不稳定,固定提示模板并重复执行,记录差异;
  • 若无法使用在线模型,改用可获得的现成工具或人工规则作为比较方法。

十二、课堂练习:研究问题诊断

各小组用一句话写出当前研究问题,并与其他小组交换检查。

检查以下内容:

检查项是/否修改建议
是否有明确研究对象?
是否说明比较的两种方法?
是否有可计算或可判断的评价标准?
数据是否能够获得?
参考答案是否能够建立?
范围是否能在课程内完成?
即使结果没有提升,是否仍可分析?

修改时,每次只保留一个核心问题。其他有价值但暂时无法完成的想法,可以放入论文的“局限与未来工作”。


十三、课后任务:提交一页研究方案

每组提交一页研究方案,必须包含:

  1. 项目题目;
  2. 问题背景与前期观察;
  3. 一条明确的研究问题;
  4. 数据来源、类型与规模;
  5. 方法 A:baseline;
  6. 方法 B:比较或改进方法;
  7. 评价指标与案例分析方式;
  8. 预期结果;
  9. 至少两个项目风险及备用方案;
  10. 2–3 篇直接相关论文。

提交前自查

  • 研究问题是否可以用一次小规模实验回答?
  • 两种方法是否在相同数据上进行比较?
  • 指标是否真正对应研究问题?
  • 预期结果是否写成假设,而不是提前编造结论?
  • 是否明确说明数据、工具和时间风险?
  • 是否能根据这份方案开始下一步实验?

十四、本讲小结

本讲的核心观点是:

  • 工程任务关注“做出什么”,研究问题关注“比较和验证什么”;
  • 一个清晰的研究问题应包含研究对象、比较方法和评价标准;
  • baseline 为实验提供基本参照,没有比较就难以判断方法是否有效;
  • 对比实验应尽量保持数据、schema、模型和评价标准一致;
  • 指标说明总体表现,案例分析解释方法为什么成功或失败;
  • 研究局限用于说明证据的适用边界,不应被隐瞒;
  • 大三学生的课程研究应主动控制范围,优先完成一个小而完整的研究闭环;
  • 一页研究方案应能够直接指导后续数据准备、实验比较和论文写作。

下一讲将围绕研究计划汇报和论文结构展开,把研究问题、相关工作、方法与实验安排组织成一篇课程论文的基本框架。

上次编辑于:
贡献者: zlzhou