lieflat-less-ai-tone 去AI味三大改写约束深度解析:从统计显著到可执行规则(白名单、信息守恒、语义排除)
【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone
lieflat-less-ai-tone 是一个基于 283 万字语料统计的去 AI 味 skill:它先用语言学方法量化「什么是 AI 味」,再把 11 项统计显著的特征转写成可执行的改写规则。但统计显著不等于能直接拿去改文章——本文深度解析它从数据到规则之间的三重约束:白名单、信息守恒与语义排除,帮新手看懂这套去 AI 味规则集的设计逻辑。
项目速览:283 万字对照语料,筛出 11 条「真 AI 味」特征
这个 skill 的研究设计很直白:300 篇由五个主流模型(Claude、DeepSeek、Gemini、GPT、Kimi)在受控条件下生成,329 篇人类作者的公开文章作对照,合计 629 篇、282.7 万汉字。对公共讨论中常见的 26 项「AI 文风」候选特征逐项计算频率比,只有倍率 R = AI 侧 ÷ 人类侧 ≥ 2.0 的特征才被立为规则,最终 11 项通过、15 项淘汰。
| 通过检验的特征 | 实测倍率(AI ÷ 人类) |
|---|---|
| 翻案腔(“不是 A 而是 B”) | 3.4× |
| 顿号罗列过密 | 1.8× |
| 相邻句结构同构 | 2.0× |
| 破折号 | 3.0× |
| 提示性冒号 / 空转句引列表 | 3.8× / 9.4× |
| 序数词充当小标题 | 3.1× |
| 拟人化喻体(“像一位智慧的导师”) | 7.3× |
| 概括表述覆盖已有数据 | 0.35×(反向) |
| 起手式(“说白了”“先说结论”) | 3.2× |
| 译文句式(仅 5 种够格) | 2.6–5.3× |
| 段首零回指评论 | 4.4×(区分力最强) |
更关键的是那些没通过的检验:正文设问句人类用得多 17 倍、比喻人类多 2.4 倍、句内同构排比人类反而更高。也就是说,流行清单里不少「AI 味」条目要么站不住,方向甚至是反的。完整结果表见 RESEARCH.md。
为什么统计显著还不够?
倍率 ≥ 2.0 只是收录门槛,把统计结果直接变成改写规则还会踩三个坑:
- 方向反了或无法验收。单字虚词 AI 侧确实偏低,但正确方向是「补虚词」,补完没法验收、还容易把正式文章改出口语味——整项弃用。材料密度一项人类侧是 AI 的 2.8 倍,「补充数据」会违反信息守恒,只保留可执行的一半(原文已有数据时不许用概括词盖掉)。
- 特征落不到具体词句。「比喻贴不贴切」「案例是否堆砌」这类判断依赖语义理解,无法转写成可执行算子,写了也没法验收。
- 无界改写会破坏原文。若凭印象对全文「润色」,信息会被悄悄加进来或删掉,去 AI 味反而变成了改写内容。
为此,项目把 11 项特征转写为规则时附加了三重约束,原文见 README.md 第 4 节。
约束一:白名单原则,只改清单内的 11 项 ✅
白名单原则是这套去 AI 味规则的「硬边界」,核心只有一条:未命中任何规则的句子逐字保留。
- 只处理清单内 11 项,不增加清单外的判断标准;
- 标题层级、章节顺序、段落数量与顺序、列表、表格、代码块位置一律不动;
- 一句话即使命中规则,也只改解决该问题所必需的最小部分,不顺便润色、不调语气;
- 对某处是否命中没有把握时,保持原文。
与之配套的是「不作为改写理由」表:句长不够参差、虚词偏少、被动句、正文问句、比喻本身等,看着像 AI 味但实测站不住,不能据此改字。这张表和规则一样是硬约束——比如按流行建议「删设问」,会让文本进一步偏离人类写作特征。相关边界与免改清单见 SKILL.md、SKILL.md。
约束二:信息守恒,不许新增也不许删减 🚫
信息守恒回答的是「改写时能不能动内容」:不能。
不许新增——哪怕只是为了让句子更具体、更像人写的,以下一律不得凭改写添加:姓名与机构、数字与金额、日期与顺序、引语与对话、来源与出处、因果与心理活动、任何原文没写的细节或案例。
不许删减——原文的观点、结论和限定词(“可能”“通常”“据说”“在某些情况下”)必须完整保留。把「可能提升」改成「提升」属于篡改判断强度,不是去 AI 味。
验收方法很朴素:改写后每个实词,都要能在原文里指出出处,指不出来就是新增,必须撤销。这条直接写进了文末的最终验收清单。也因此,「把抽象写具体」明确不属于这个 skill 的职责——原文抽象就让它抽象,第 8 条只允许把原文已有的具体数据提到概括词的位置,绝不自己造数字。完整条款见 SKILL.md。
约束三:语义排除,语感不立为规则 🧪
第三重约束处理的是最隐蔽的坑:把「感觉像 AI」写进规则。
有三类判断被明确排除在规则之外:比喻是否贴切、设问是否解决了读者的真实疑问、并列案例是否属堆砌。它们的共同点是依赖语义理解,无法转写成可执行算子;若写入规则,只会诱导执行者依主观语感改写,改多少都说不清对错。项目原文的表述是:「不因主观上『接近 AI 文风』而破例。」
这条约束有方法论上的工程保障:每个特征以正则算子实现,而本项目如实记录了六次算子设计缺陷导致的测量失误(例如把正常并列误判为嵌套定语、分母选错得出 32 倍的假差异),并确立操作规程——任何算子在采信频率前,须先抽样检视 20 条命中实例。失误记录见 README.md 第 5 节。
一个典型对照:「比喻是否贴切」被排除,因为实测人类用比喻是 AI 的 2.4 倍;但其中的形态化子项「拟人化喻体」(像一位智慧的导师、永不疲倦的审查员)倍率达 7.3,触发行定位明确,于是只收这一项。规则的依据是触发标记可定位,而不是频率高低或印象分。
三条约束如何配合:一次改写的完整流程
把三重约束串起来,就是 SKILL.md 中规定的标准用法:
- 锁定框架:标题、章节、段落、列表、表格、代码块的位置先固定,白名单边界生效;
- 逐项检查:只按 11 条规则逐项过,不引入清单外的标准;
- 最小改写:命中处只改必需部分,信息不增不减(信息守恒生效);
- 验收复查:每一处改动都能对应某条编号规则、每个实词都能在原文指出出处,指不出就撤销。
语义排除则贯穿全程:遇到「比喻贴不贴切」这类问题,规则明确不处理,交还给人。
新手上手:规则集、结果表与复算脚本
| 资料 | 内容 |
|---|---|
| SKILL.md | 规则集全貌:硬边界 + 11 条改写规则 + 最终验收清单,可直接作为 system prompt 使用 |
| RESEARCH.md | 每条规则的预设 vs 实测、被推翻的条目与六次测量失误 |
| scripts/compare-human-ai.py | 句层特征在两侧语料的频率与比值 |
| scripts/check-structure.py | 段落层结构:相邻句同构、段首零回指 |
| scripts/check-translationese.py | 生成侧译文句式频率筛查 |
三个脚本的算子定义都写在文件首部,换成自己的语料即可复算全部指标——这也是这个开源去 AI 味 skill 最值得学习的一点:规则不只给结论,方法链(切分规程、分母选择、判定阈值、算子定义)全部可复核。
一句话总结:lieflat-less-ai-tone 用 283 万字语料证明了一件事——好的去 AI 味工具不靠「语感」,而靠可定位的触发标记、守恒的信息和一份明确的白名单。
【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考