第七次课:从观察到研究方案——提出一个小问题
第七次课:从观察到研究方案——提出一个小问题
学习目标
通过本讲学习,学生应能够:
- 区分工程任务、应用目标和研究问题。
- 使用“研究对象—比较方法—评价标准”表达一个可验证的研究问题。
- 理解 baseline、对比实验、案例分析和研究局限的基本含义。
- 判断一个研究问题是否范围适中、数据可得并能在课程内完成。
- 将前几次课积累的图谱、抽取结果和质量分析收敛为一个小型研究项目。
- 完成一页研究方案,包括问题、数据、两种比较方法、评价方式、预期结果和风险。
本讲的核心原则是:本科生的课程研究不需要一开始就解决宏大问题,但必须提出一个清楚、可比较、可评价、可以真正完成的小问题。
一、从“做一个系统”到“研究一个问题”
前几次课中,各小组已经完成了小领域选择、知识图谱 schema、文本知识抽取、文献阅读和知识质量评价。此时,学生常会这样描述自己的项目:
- 做一个课程知识图谱;
- 用大模型抽取古诗词知识;
- 做一个校园问答系统;
- 用 RAG 减少大模型幻觉;
- 做一个疾病科普知识库。
这些表达说明了大致方向,但还不是完整的研究问题。它们没有说明:
- 具体研究什么现象;
- 准备比较哪些方法;
- 使用什么数据;
- 如何判断结果是否更好;
- 研究范围是否能够在课程内完成。
研究方案需要把“想做什么”进一步转换为“想验证什么”。
模糊兴趣
↓
真实观察或具体困难
↓
可以比较的研究问题
↓
数据、方法与评价设计
↓
小规模实验和证据
↓
课程论文
二、工程任务、应用目标与研究问题
1. 工程任务
工程任务强调“把一个系统或功能做出来”。
例如:
- 搭建一个课程问答系统;
- 构建一个古诗词知识图谱;
- 开发一个文本关系抽取工具;
- 建立一个校园资料检索库。
完成工程任务可以体现实践能力,但如果只展示系统页面或功能,通常还不能构成完整研究。
2. 应用目标
应用目标强调系统服务什么人、解决什么需求。
例如:
- 帮助学生查询课程的先修关系;
- 帮助读者发现古诗中的常见意象;
- 帮助用户从多份课程资料中查找最新要求;
- 帮助研究者整理某个主题下的论文关系。
应用目标比工程任务更接近真实需求,但仍需要转化为可以验证的研究问题。
3. 研究问题
研究问题强调一个可以通过数据和实验回答的问题。
例如:
在 30 篇课程通知文本中,与简单人工规则相比,使用带有 schema 约束的 LLM 提示词是否能提高关系抽取的召回率,并减少无依据三元组?
这个问题包含:
- 研究对象:30 篇课程通知;
- 比较方法:人工规则与带 schema 约束的 LLM;
- 评价标准:召回率和无依据三元组数量;
- 任务边界:课程通知中的关系抽取。
4. 三者之间的关系
| 类型 | 主要问题 | 示例 |
|---|---|---|
| 工程任务 | 要做出什么? | 构建课程问答系统 |
| 应用目标 | 为谁解决什么需求? | 帮助学生查询最新课程要求 |
| 研究问题 | 要比较和验证什么? | RAG 是否比直接提问更能减少过时信息错误? |
一个课程项目可以包含工程实现,但课程论文必须围绕研究问题组织证据。
三、研究问题从哪里来
研究问题不一定来自“灵光一现”,更多时候来自前期工作的具体观察。
1. 来自抽取错误
第五次课中可能观察到:
- 人工规则准确,但遗漏较多;
- LLM 抽取较完整,但会补充原文没有的知识;
- 现成工具无法识别领域术语;
- 时间、否定和条件信息容易被忽略。
这些观察可以转化为研究问题:
在课程通知的关系抽取中,要求 LLM 同时输出原文证据,是否能减少无依据关系?
2. 来自知识质量问题
第六次课中可能观察到:
- 图谱中部分知识没有来源;
- 同一实体有多个不同名称;
- 旧版资料与新版资料发生冲突;
- 检索系统找到相关资料,但回答仍然错误。
这些观察可以转化为研究问题:
在课程问答中,加入资料日期与版本信息后,系统是否更少引用过时知识?
3. 来自文献局限
第四次课阅读论文时可能发现:
- 已有方法只在英文数据上测试;
- 研究只报告总体指标,没有分析错误类型;
- 方法没有记录知识来源;
- 实验数据与自己的小领域明显不同。
这些局限可以转化为小规模验证:
某种通用实体识别工具在古诗词文本中最常见的错误类型是什么?增加领域词表后是否有所改善?
4. 来自方法比较
如果两种方法各有优缺点,可以提出比较型问题:
对于格式相对固定的校园通知,人工规则和 LLM 在实体与关系抽取的准确率、召回率和错误类型上有何差异?
比较型问题特别适合大三学生,因为它不要求提出全新的复杂模型,但能够训练规范的数据、实验和分析方法。
四、研究问题的基本表达
一个适合课程项目的研究问题,至少应说明研究对象、比较方法和评价标准。
1. 研究对象
研究对象说明“在哪些数据、领域或场景中研究”。
例如:
- 30 篇课程通知;
- 20 首唐诗及其公开注释;
- 某一种疾病的 50 段权威科普文本;
- 某个 AI 主题下的 30 篇论文摘要;
- 由 20 个问题组成的课程问答测试集。
“中文文本”“知识图谱数据”通常过于宽泛,应进一步限定领域、来源和规模。
2. 比较方法
比较方法说明“准备比较什么”。
适合课程项目的比较包括:
- 人工规则与 LLM 抽取;
- 无 schema 提示与有 schema 提示;
- 不要求证据与要求证据的提示方式;
- 直接提问大模型与检索增强回答;
- 不使用领域词表与使用领域词表;
- 不记录时间信息与记录时间/版本信息。
比较方法应控制在两种或少量几种,避免一次比较过多方法导致实验无法完成。
3. 评价标准
评价标准说明“如何判断结果”。
可以选择:
- 实体或关系抽取准确率;
- 召回率与遗漏数量;
- 无依据知识数量;
- 来源可追溯率;
- 过时信息错误数量;
- 回答正确率;
- 证据是否支持回答;
- 不同错误类型的数量和比例。
4. 基本表达模板
在【研究对象】上,与【方法 A】相比,【方法 B】是否能够在
【评价指标】方面获得改善?它主要减少或增加了哪些错误?
例如:
在 20 首唐诗及其注释文本上,与开放式 LLM 抽取相比,加入实体类型和关系类型约束的提示词是否能够提高三元组准确率,并减少无依据的主题关系?
也可以使用分析型表达:
【某种方法】在【某类数据】上的主要错误类型是什么?这些错误与
【文本特点、提示方式或 schema 设计】有什么关系?
例如:
通用命名实体识别工具在古诗词文本中的主要实体边界错误是什么?增加诗人、地点和意象词表后,哪些错误得到改善?
五、什么是 Baseline
Baseline 通常译为基线或基准方法,是实验中用于比较的基本方法。
假设学生提出一种带 schema 和证据要求的 LLM 抽取方法,可以将简单提示的 LLM 抽取作为 baseline:
Baseline:只要求“从文本中抽取三元组”
改进方法:提供实体类型、关系类型、JSON 格式和原文证据要求
如果研究 RAG,可以设置:
Baseline:直接向大模型提问
比较方法:检索课程资料后再回答,并要求引用证据
Baseline 的作用
- 判断改进方法是否真的比简单方法好;
- 明确结果提升来自哪里;
- 避免只展示一种方法,无法解释其效果;
- 为论文中的对比实验提供参照。
适合本科课程项目的 Baseline
- 简单人工规则;
- 不带示例的提示词;
- 不带 schema 的提示词;
- 直接大模型回答;
- 现成 NLP 工具的默认结果;
- 不进行来源或版本过滤的检索结果。
Baseline 不一定复杂,但必须与研究问题相关,并在相同数据和评价标准下比较。
六、什么是对比实验
对比实验是在尽可能保持其他条件相同的情况下,比较不同方法的结果。
例如,要比较“是否要求原文证据”的影响:
| 实验条件 | 方法 A | 方法 B |
|---|---|---|
| 测试文本 | 相同的 30 段文本 | 相同的 30 段文本 |
| 实体和关系 schema | 相同 | 相同 |
| 模型 | 相同 | 相同 |
| 输出格式 | 相同 | 相同 |
| 唯一差异 | 不要求证据 | 要求原文证据 |
这样,结果差异更可能来自“证据要求”,而不是数据、模型或其他条件不同。
常见的不公平比较
- 方法 A 使用 10 段简单文本,方法 B 使用 30 段复杂文本;
- 两种方法使用不同的实体和关系定义;
- 只认真检查新方法的结果,没有同样检查 baseline;
- 只展示新方法成功的案例;
- 改变了多个条件,却把效果归因于其中一个条件。
课程项目不要求复杂实验,但要求比较过程尽量公平、透明。
七、案例分析和研究局限
1. 为什么要做案例分析
准确率和召回率能说明总体表现,但不能解释方法为什么成功或失败。
案例分析应至少包括:
- 方法 A 正确、方法 B 错误的案例;
- 方法 B 正确、方法 A 遗漏的案例;
- 两种方法都失败的案例;
- 具有代表性的实体、关系或回答错误。
例如:
对于“建议学生掌握 Python 基础”,规则方法未抽取关系;LLM 将“建议前置能力”错误改写为“必须先修”。说明 LLM 能发现隐含联系,但可能把较弱的建议关系强化为强制关系。
这样的案例可以解释指标差异,也能形成下一步改进方向。
2. 什么是研究局限
研究局限是对结果适用范围的诚实说明。
课程项目常见局限包括:
- 数据量较小;
- 只选择了一个领域;
- 参考答案由学生标注,可能存在主观性;
- 只比较了两种简单方法;
- 使用的 LLM 可能随版本更新而变化;
- 没有训练新模型;
- 实验结果不能直接推广到其他领域。
局限不意味着研究没有价值。清楚说明局限,反而说明研究者理解自己的证据能够支持到什么程度。
八、把问题收敛到课程内能够完成
1. 过大的问题
以下问题通常超出课程范围:
- 如何解决大语言模型幻觉?
- 如何构建完整的医学知识图谱?
- 如何让知识图谱实现真正的认知智能?
- 如何设计一个超过现有模型的新算法?
这些问题对象过宽、资源需求过大,也缺少清晰的评价范围。
2. 收敛后的问题
可以将大问题缩小:
| 大问题 | 课程内可完成的小问题 |
|---|---|
| 如何解决大模型幻觉? | 在 20 个课程问答问题上,要求引用原文是否能减少无依据回答? |
| 如何构建医学知识图谱? | 从 30 段权威疾病科普文本中构建症状—疾病小图谱,并分析抽取错误。 |
| 如何改进知识抽取? | 在校园通知文本中,加入 schema 约束是否能提高 LLM 关系抽取准确率? |
| 如何实现知识更新? | 为不同版本的课程通知增加时间字段,是否能减少系统引用过时要求? |
3. 可完成性检查
在确定研究问题前,应回答:
- 数据能否在一周内收集或整理?
- 参考答案能否由小组人工完成?
- 两种比较方法能否实际运行?
- 指标能否计算或人工评价?
- 是否能找到至少 2–3 个典型案例?
- 即使没有明显提升,是否仍能分析失败原因?
- 是否能在课程结束前形成完整论文?
如果大部分问题无法回答,应继续缩小研究范围。
九、一页研究方案的基本结构
一页研究方案不需要写成长篇论文,但应让读者能够判断项目是否值得做、能否完成以及如何验证。
1. 研究题目
题目应包含对象、任务或比较重点。
例如:
Schema 约束对大语言模型课程文本关系抽取效果的影响
2. 问题背景与观察
用 2–3 句话说明:
- 真实场景中出现了什么问题;
- 前期抽取或质量评价发现了什么现象;
- 为什么值得继续验证。
3. 研究问题
用一句问句写清对象、方法比较和评价指标。
4. 数据
说明:
- 数据来自哪里;
- 计划使用多少文本或问题;
- 数据包含哪些类型;
- 如何建立人工参考答案;
- 是否涉及版权、隐私或敏感信息。
5. 两种比较方法
至少包括:
- 方法 A:baseline;
- 方法 B:要验证的比较方法或改进策略。
两种方法应使用相同测试数据和统一 schema。
6. 评价方式
根据任务选择 2–4 项:
- 准确率;
- 召回率;
- 错误与遗漏数量;
- 来源可追溯率;
- 无依据知识数量;
- 回答正确率;
- 典型案例分析。
7. 预期结果
预期结果是一项研究假设,不是提前宣布实验结论。
例如:
预计加入 schema 和证据约束后,无依据三元组数量会减少,准确率可能提高;但由于约束更严格,部分隐含关系可能被遗漏,召回率不一定提高。
这种表述同时考虑可能的收益和代价,更符合研究逻辑。
8. 风险与备用方案
需要提前说明:
- 数据不足怎么办;
- 两种方法结果差异很小怎么办;
- 工具或模型无法使用怎么办;
- 人工标注存在分歧怎么办;
- 项目规模超出预期时如何缩小。
十、一页研究方案模板
项目题目:
1. 背景与观察
用 2–3 句话说明真实问题和前期发现。
2. 研究问题
在【研究对象】上,与【方法 A】相比,【方法 B】是否能在
【评价指标】方面获得改善?主要错误类型有何变化?
3. 数据
数据来源:
数据规模:
数据类型:
参考答案建立方式:
4. 比较方法
方法 A(Baseline):
方法 B(比较/改进方法):
需要保持相同的实验条件:
5. 评价方式
指标 1:
指标 2:
案例分析方式:
6. 预期结果
预计可能出现的结果及理由:
7. 风险与备用方案
风险 1: 备用方案:
风险 2: 备用方案:
8. 相关文献
列出 2–3 篇与问题最相关的论文。
十一、示例研究方案
项目题目
原文证据约束对 LLM 课程文本关系抽取质量的影响
背景与观察
前期实验发现,LLM 能从课程介绍中抽取较多关系,但有时会将“建议掌握”错误地抽取为“必须先修”,也可能生成原文中不存在的课程关系。缺少原文证据会增加人工核验成本。
研究问题
在 30 段课程介绍与通知文本上,与普通抽取提示相比,要求 LLM 为每条三元组提供原文证据,是否能提高关系抽取准确率并减少无依据三元组?
数据
- 30 段公开课程介绍与通知;
- 每段约 100–300 字;
- 由两名小组成员根据统一 schema 标注参考三元组;
- 出现分歧时通过讨论形成最终参考答案。
比较方法
- 方法 A:只要求 LLM 抽取三元组;
- 方法 B:提供相同 schema,同时要求每条三元组附带原文证据;
- 两种方法使用相同文本、相同模型和相同实体关系类型。
评价方式
- 三元组准确率;
- 三元组召回率;
- 无依据三元组数量;
- 关系类型错误数量;
- 典型错误案例分析。
预期结果
预计证据约束可以减少无依据三元组并提高准确率,但可能使模型倾向于输出较少结果,从而影响召回率。
风险与备用方案
- 若 30 段文本标注工作量过大,缩小为 20 段;
- 若两种提示结果差异较小,重点分析不同关系类型上的表现;
- 若模型输出不稳定,固定提示模板并重复执行,记录差异;
- 若无法使用在线模型,改用可获得的现成工具或人工规则作为比较方法。
十二、课堂练习:研究问题诊断
各小组用一句话写出当前研究问题,并与其他小组交换检查。
检查以下内容:
| 检查项 | 是/否 | 修改建议 |
|---|---|---|
| 是否有明确研究对象? | ||
| 是否说明比较的两种方法? | ||
| 是否有可计算或可判断的评价标准? | ||
| 数据是否能够获得? | ||
| 参考答案是否能够建立? | ||
| 范围是否能在课程内完成? | ||
| 即使结果没有提升,是否仍可分析? |
修改时,每次只保留一个核心问题。其他有价值但暂时无法完成的想法,可以放入论文的“局限与未来工作”。
十三、课后任务:提交一页研究方案
每组提交一页研究方案,必须包含:
- 项目题目;
- 问题背景与前期观察;
- 一条明确的研究问题;
- 数据来源、类型与规模;
- 方法 A:baseline;
- 方法 B:比较或改进方法;
- 评价指标与案例分析方式;
- 预期结果;
- 至少两个项目风险及备用方案;
- 2–3 篇直接相关论文。
提交前自查
- 研究问题是否可以用一次小规模实验回答?
- 两种方法是否在相同数据上进行比较?
- 指标是否真正对应研究问题?
- 预期结果是否写成假设,而不是提前编造结论?
- 是否明确说明数据、工具和时间风险?
- 是否能根据这份方案开始下一步实验?
十四、本讲小结
本讲的核心观点是:
- 工程任务关注“做出什么”,研究问题关注“比较和验证什么”;
- 一个清晰的研究问题应包含研究对象、比较方法和评价标准;
- baseline 为实验提供基本参照,没有比较就难以判断方法是否有效;
- 对比实验应尽量保持数据、schema、模型和评价标准一致;
- 指标说明总体表现,案例分析解释方法为什么成功或失败;
- 研究局限用于说明证据的适用边界,不应被隐瞒;
- 大三学生的课程研究应主动控制范围,优先完成一个小而完整的研究闭环;
- 一页研究方案应能够直接指导后续数据准备、实验比较和论文写作。
下一讲将围绕研究计划汇报和论文结构展开,把研究问题、相关工作、方法与实验安排组织成一篇课程论文的基本框架。
