千笔-AIWritePaper · https://www.aiwritepaper.com
讨论与局限是论文里最容易「写得很顺、审不过」的部分。常见的两种假完成:一是讨论段把相关结果写成因果、把单校样本写成普遍规律,还用一句「与已有研究一致」带过;二是局限段只有「样本量有限、方法有待完善、未来可进一步深化」三件套,没有一条说明这个局限会让结论往哪个方向偏。答辩或审稿一问「D1 是相关还是因果?局限会高估还是低估这个效应?」,整段失守。
这篇给出一个可复跑的协议:先用三列表把每条发现的解释和边界写死,再做双版本烟测,拿同一段讨论的版本 A(故意保留常见毛病)和版本 B(按三列表重写)逐行对照,每一行给出 pass/fail;最后再放一个伪 B失败样本,它看起来什么都写了,却在最关键的一行失败。文中的研究情境是虚构示例,只用来演示写法,不对应任何真实研究。
图:左侧三列表是真源;中部版本 A 与版本 B 逐行对照;右侧验收结论与伪 B 的失败行。
目标说明
读完应能独立完成五件事:
- 为讨论与局限建三列表:
发现编号 | 解释(与谁对话) | 边界与局限影响方向,每条发现一行。 - 写出同一段讨论的版本 A 与版本 B,并能逐句指出二者差在哪里。
- 用 R1–R7 验收表给 A、B 两个版本逐行判 pass/fail,而不是凭感觉说「B 更好」。
- 识别伪 B:局限列全了,结论却在最后一句复活,这种段落必须判失败。
- 用一个 18 行的粗筛脚本先扫一遍可疑措辞,再做人工验收。
适用边界
适合
- 结果章已经定稿,讨论与局限还在反复改。
- 导师批注「讨论太浅」「局限太套路」,但说不清具体改哪一句。
- 用 AI 辅助起草过讨论段,需要检查有没有被写成因果或过度外推。
不适合
- 结果本身还没跑完:讨论的边界取决于设计和数据,先把结果章定下来。
- 想用烟测证明「论文一定能过」:烟测只证明这段讨论可以被逐句核对。
- 期待一个万能模板:不同设计(实验、准实验、横断面、质性)能写的强度不同,边界句要按设计写。
三列表:讨论与局限的真源
| 列 | 写什么 | 最低标准 |
|---|---|---|
| 发现编号 | D1、D2……与结果章表图对应 | 能指到具体表号 |
| 解释(与谁对话) | 这个发现与哪几篇文献相符或相反,差异可能来自哪里 | 点名文献,不写「已有研究」 |
| 边界与局限影响方向 | 设计允许的最强措辞;每条局限会使结论高估还是低估;不支持哪种外推 | 至少一句「不支持……」 |
示例(虚构):
| 发现编号 | 解释(与谁对话) | 边界与局限影响方向 |
|---|---|---|
| D1:AI 写作辅助时长与写作焦虑弱负相关(表 3) | 与文献 [12] 课堂干预方向相符;与文献 [17]「依赖加重焦虑」相反,差异可能来自测量时点 | 横断面,只能写相关;可能存在反向因果;自报时长有回忆偏差,可能放大相关;不支持外推到研究生和其他院校 |
三列表不进正文,它是写讨论段时的对照依据:正文每一句都应该能在表里找到出处。
双版本烟测:真 A/B 段落
版本 A(故意保留常见毛病,必须判 fail)
本研究发现,生成式 AI 的使用能够显著降低大学生的写作焦虑,这与已有研究结论一致,充分说明 AI 工具在高等教育写作教学中具有广阔的应用前景。当然,本研究也存在一定的局限性,如样本量有限、研究方法有待完善等,未来研究可进一步扩大样本范围、深化相关分析。
版本 B(按三列表重写)
在本校 312 名本科生的横断面样本中,每周使用生成式 AI 写作辅助的时长与写作焦虑呈弱负相关(D1,见表 3)。这一方向与文献 [12] 在课堂干预中的观察相符,但与文献 [17] 报告的“依赖加重焦虑”相反;两者差异可能来自测量时点不同(学期中 vs 期末)。由于数据来自单校横断面问卷,D1 不能解释为使用 AI 导致焦虑下降:焦虑较低的学生也可能更愿意尝试新工具(反向因果)。此外,使用时长为自报,回忆偏差可能使高频使用者被高估,从而放大相关的绝对值。因此,D1 只支持“在单校本科样本中存在弱负相关”,不支持向研究生或其他院校外推;检验因果方向需要纵向追踪或随机分组设计。
A/B 验收表(逐行判定)
| 编号 | 检查项 | 通过标准 | 版本 A | 版本 B |
|---|---|---|---|---|
| R1 | 发现可指回 | 句中出现发现编号或表号 | fail:无表号 | pass:D1、表 3 |
| R2 | 措辞与设计相符 | 横断面只写相关,不用因果动词 | fail:「显著降低」 | pass:「弱负相关」 |
| R3 | 文献对话点名 | 相符与相反各至少一篇,写出差异来源 | fail:「与已有研究一致」 | pass:[12] 相符、[17] 相反、时点差异 |
| R4 | 替代解释 | 至少一条替代解释(反向因果、混杂等) | fail:无 | pass:反向因果 |
| R5 | 局限写影响方向 | 每条局限说明高估还是低估 | fail:「样本量有限」无方向 | pass:回忆偏差可能放大相关 |
| R6 | 边界句 | 至少一句「不支持……」 | fail:反而外推到「高等教育」 | pass:不支持外推到研究生、其他院校 |
| R7 | 未来研究可执行 | 说出需要什么设计来回答什么问题 | fail:「进一步深化」 | pass:纵向或随机分组检验因果方向 |
版本 A 七行全败,版本 B 七行全过。门禁:没有 A 的 fail 记录,不得声称做过双版本烟测;B 有任何一行 fail,不得合入。
失败样本:伪 B 为什么不过
本研究局限在于:(1)单校横断面数据,无法确定因果方向;(2)使用时长为自报,可能存在回忆偏差;(3)样本仅含本科生。尽管如此,结果仍表明生成式 AI 能够有效缓解写作焦虑,建议高校尽快推广 AI 写作辅助。
它比版本 A 好看得多:局限分条列出,甚至承认了「无法确定因果方向」。但逐行看:
- R2 fail:最后一句「有效缓解」是因果措辞,和第(1)条自相矛盾。
- R5 fail:三条局限都没有写影响方向,读者不知道结论会被高估还是低估。
- R6 fail:「建议高校尽快推广」正是第(3)条局限所否定的外推。
伪 B 的问题不在于少写了什么,而在于局限写了,结论没改。局限段一旦承认「无法确定因果」,同一章节里所有因果措辞都必须同步降级,否则等于自己推翻自己。这一条也是审稿中最容易被直接指出的矛盾。
可跑粗筛:先扫措辞,再人工验收
下面的脚本只做粗筛:命中可疑措辞就报出来,缺少影响方向词和边界句也报出来。它不能代替 R1–R7,只是让人工验收先看最可能出问题的地方。
# lint_discussion.py —— 讨论/局限段落粗筛:只报可疑信号,不代替人工判定importre,sys RULES=[("causal_verb",r"(显著)?(降低|提升|提高|缓解|导致|促进)(了)?[^,。]{0,8}(焦虑|能力|成绩|效率)","因果动词:须对照设计是否允许因果"),("vague_consist",r"与(已有|以往|既有)研究(结论)?一致","‘一致’未点名文献"),("hype",r"(广阔|巨大)的?(应用)?前景|充分(说明|证明)|尽快推广","外推/口号"),("boilerplate",r"一定的?局限|有待(完善|提高)|进一步(扩大|深化)","模板化局限"),]NEED=[("impact_dir",r"(高估|低估|放大|缩小|偏向)","局限未写影响方向"),("boundary",r"(不能解释为|不支持|仅支持|只支持)","缺边界句")]text=open(sys.argv[1],encoding="utf-8").read()NEG=re.compile(r"(不能解释为|并不意味着|并非)[^。]{0,12}$")# 否定语境不报hits=[(k,m.group(0),why)fork,p,whyinRULESforminre.finditer(p,text)ifnot(k=="causal_verb"andNEG.search(text[max(0,m.start()-20):m.start()]))]miss=[(k,why)fork,p,whyinNEEDifnotre.search(p,text)]fork,s,whyinhits:print(f"HIT{k:<13}「{s}」{why}")fork,whyinmiss:print(f"MISS{k:<13}{why}")print("RESULT:","fail"ifhitsormisselse"pass(仅粗筛,仍需人工 R1–R7)")对三个版本实跑的输出(原样):
== version_A HIT causal_verb 「显著降低大学生的写作焦虑」 因果动词:须对照设计是否允许因果 HIT vague_consist 「与已有研究结论一致」 ‘一致’未点名文献 HIT hype 「充分说明」 外推/口号 HIT hype 「广阔的应用前景」 外推/口号 HIT boilerplate 「一定的局限」 模板化局限 HIT boilerplate 「有待完善」 模板化局限 HIT boilerplate 「进一步扩大」 模板化局限 MISS impact_dir 局限未写影响方向 MISS boundary 缺边界句 RESULT: fail == version_B RESULT: pass(仅粗筛,仍需人工 R1–R7) == version_B_fake HIT causal_verb 「缓解写作焦虑」 因果动词:须对照设计是否允许因果 HIT hype 「尽快推广」 外推/口号 MISS impact_dir 局限未写影响方向 MISS boundary 缺边界句 RESULT: fail一个值得记下的细节:初版脚本把版本 B 里「不能解释为使用 AI 导致焦虑下降」也报成了因果措辞,这是否定语境下的误报,于是加了NEG规则。规则脚本一定会有误报和漏报,所以结果栏写的是「仅粗筛」。
协议记录(可抄走)
version,finding,check,result,note A,D1,R1-R7,fail,七行全败(故意保留) B,D1,R1-R7,pass,七行全过 B_fake,D1,R2|R5|R6,fail,局限写了结论没改踩坑
- 只改局限段,不回头改讨论段和结论段里的因果措辞。
- 把「与已有研究一致」当成文献对话,从来不写相反的文献。
- 局限条目越列越多,却没有一条写影响方向,读者无法判断结论还剩多少可信度。
- 未来研究写成「扩大样本、深化分析」,没有说明用什么设计回答什么问题。
- 删掉版本 A 的记录,事后无法证明做过对照。
当天 45 分钟脚本
- 从结果章抽出 2–3 条核心发现,建三列表。
- 把现有讨论段复制一份作为版本 A,不改动,跑粗筛并记录。
- 按三列表重写版本 B,跑粗筛。
- 用 R1–R7 逐行给 A、B 判定,写进协议记录。
- 全文搜索因果动词,确认讨论、局限、结论、摘要四处措辞一致。
总结
讨论与局限的双版本烟测,核心是两件事:每句话能在三列表里找到出处,每条局限说清结论会往哪边偏。版本 A 用来证明问题真实存在,版本 B 用来证明问题可以逐行修掉,伪 B 提醒你局限和结论必须同步修改。三列表是真源,验收表是门禁,脚本只是粗筛。