news 2026/10/7 15:10:16

lieflat-less-ai-tone 去AI味三大改写约束深度解析:从统计显著到可执行规则(白名单、信息守恒、语义排除)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
lieflat-less-ai-tone 去AI味三大改写约束深度解析:从统计显著到可执行规则(白名单、信息守恒、语义排除)

lieflat-less-ai-tone 去AI味三大改写约束深度解析:从统计显著到可执行规则(白名单、信息守恒、语义排除)

【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone

lieflat-less-ai-tone 是一个基于 283 万字语料统计的去 AI 味 skill:它先用语言学方法量化「什么是 AI 味」,再把 11 项统计显著的特征转写成可执行的改写规则。但统计显著不等于能直接拿去改文章——本文深度解析它从数据到规则之间的三重约束:白名单、信息守恒与语义排除,帮新手看懂这套去 AI 味规则集的设计逻辑。

项目速览:283 万字对照语料,筛出 11 条「真 AI 味」特征

这个 skill 的研究设计很直白:300 篇由五个主流模型(Claude、DeepSeek、Gemini、GPT、Kimi)在受控条件下生成,329 篇人类作者的公开文章作对照,合计 629 篇、282.7 万汉字。对公共讨论中常见的 26 项「AI 文风」候选特征逐项计算频率比,只有倍率 R = AI 侧 ÷ 人类侧 ≥ 2.0 的特征才被立为规则,最终 11 项通过、15 项淘汰。

通过检验的特征实测倍率(AI ÷ 人类)
翻案腔(“不是 A 而是 B”)3.4×
顿号罗列过密1.8×
相邻句结构同构2.0×
破折号3.0×
提示性冒号 / 空转句引列表3.8× / 9.4×
序数词充当小标题3.1×
拟人化喻体(“像一位智慧的导师”)7.3×
概括表述覆盖已有数据0.35×(反向)
起手式(“说白了”“先说结论”)3.2×
译文句式(仅 5 种够格)2.6–5.3×
段首零回指评论4.4×(区分力最强)

更关键的是那些没通过的检验:正文设问句人类用得多 17 倍、比喻人类多 2.4 倍、句内同构排比人类反而更高。也就是说,流行清单里不少「AI 味」条目要么站不住,方向甚至是反的。完整结果表见 RESEARCH.md。

为什么统计显著还不够?

倍率 ≥ 2.0 只是收录门槛,把统计结果直接变成改写规则还会踩三个坑:

  1. 方向反了或无法验收。单字虚词 AI 侧确实偏低,但正确方向是「补虚词」,补完没法验收、还容易把正式文章改出口语味——整项弃用。材料密度一项人类侧是 AI 的 2.8 倍,「补充数据」会违反信息守恒,只保留可执行的一半(原文已有数据时不许用概括词盖掉)。
  2. 特征落不到具体词句。「比喻贴不贴切」「案例是否堆砌」这类判断依赖语义理解,无法转写成可执行算子,写了也没法验收。
  3. 无界改写会破坏原文。若凭印象对全文「润色」,信息会被悄悄加进来或删掉,去 AI 味反而变成了改写内容。

为此,项目把 11 项特征转写为规则时附加了三重约束,原文见 README.md 第 4 节。

约束一:白名单原则,只改清单内的 11 项 ✅

白名单原则是这套去 AI 味规则的「硬边界」,核心只有一条:未命中任何规则的句子逐字保留。

  • 只处理清单内 11 项,不增加清单外的判断标准;
  • 标题层级、章节顺序、段落数量与顺序、列表、表格、代码块位置一律不动;
  • 一句话即使命中规则,也只改解决该问题所必需的最小部分,不顺便润色、不调语气;
  • 对某处是否命中没有把握时,保持原文。

与之配套的是「不作为改写理由」表:句长不够参差、虚词偏少、被动句、正文问句、比喻本身等,看着像 AI 味但实测站不住,不能据此改字。这张表和规则一样是硬约束——比如按流行建议「删设问」,会让文本进一步偏离人类写作特征。相关边界与免改清单见 SKILL.md、SKILL.md。

约束二:信息守恒,不许新增也不许删减 🚫

信息守恒回答的是「改写时能不能动内容」:不能。

不许新增——哪怕只是为了让句子更具体、更像人写的,以下一律不得凭改写添加:姓名与机构、数字与金额、日期与顺序、引语与对话、来源与出处、因果与心理活动、任何原文没写的细节或案例。

不许删减——原文的观点、结论和限定词(“可能”“通常”“据说”“在某些情况下”)必须完整保留。把「可能提升」改成「提升」属于篡改判断强度,不是去 AI 味。

验收方法很朴素:改写后每个实词,都要能在原文里指出出处,指不出来就是新增,必须撤销。这条直接写进了文末的最终验收清单。也因此,「把抽象写具体」明确不属于这个 skill 的职责——原文抽象就让它抽象,第 8 条只允许把原文已有的具体数据提到概括词的位置,绝不自己造数字。完整条款见 SKILL.md。

约束三:语义排除,语感不立为规则 🧪

第三重约束处理的是最隐蔽的坑:把「感觉像 AI」写进规则。

有三类判断被明确排除在规则之外:比喻是否贴切、设问是否解决了读者的真实疑问、并列案例是否属堆砌。它们的共同点是依赖语义理解,无法转写成可执行算子;若写入规则,只会诱导执行者依主观语感改写,改多少都说不清对错。项目原文的表述是:「不因主观上『接近 AI 文风』而破例。」

这条约束有方法论上的工程保障:每个特征以正则算子实现,而本项目如实记录了六次算子设计缺陷导致的测量失误(例如把正常并列误判为嵌套定语、分母选错得出 32 倍的假差异),并确立操作规程——任何算子在采信频率前,须先抽样检视 20 条命中实例。失误记录见 README.md 第 5 节。

一个典型对照:「比喻是否贴切」被排除,因为实测人类用比喻是 AI 的 2.4 倍;但其中的形态化子项「拟人化喻体」(像一位智慧的导师、永不疲倦的审查员)倍率达 7.3,触发行定位明确,于是只收这一项。规则的依据是触发标记可定位,而不是频率高低或印象分。

三条约束如何配合:一次改写的完整流程

把三重约束串起来,就是 SKILL.md 中规定的标准用法:

  1. 锁定框架:标题、章节、段落、列表、表格、代码块的位置先固定,白名单边界生效;
  2. 逐项检查:只按 11 条规则逐项过,不引入清单外的标准;
  3. 最小改写:命中处只改必需部分,信息不增不减(信息守恒生效);
  4. 验收复查:每一处改动都能对应某条编号规则、每个实词都能在原文指出出处,指不出就撤销。

语义排除则贯穿全程:遇到「比喻贴不贴切」这类问题,规则明确不处理,交还给人。

新手上手:规则集、结果表与复算脚本

资料内容
SKILL.md规则集全貌:硬边界 + 11 条改写规则 + 最终验收清单,可直接作为 system prompt 使用
RESEARCH.md每条规则的预设 vs 实测、被推翻的条目与六次测量失误
scripts/compare-human-ai.py句层特征在两侧语料的频率与比值
scripts/check-structure.py段落层结构:相邻句同构、段首零回指
scripts/check-translationese.py生成侧译文句式频率筛查

三个脚本的算子定义都写在文件首部,换成自己的语料即可复算全部指标——这也是这个开源去 AI 味 skill 最值得学习的一点:规则不只给结论,方法链(切分规程、分母选择、判定阈值、算子定义)全部可复核。

一句话总结:lieflat-less-ai-tone 用 283 万字语料证明了一件事——好的去 AI 味工具不靠「语感」,而靠可定位的触发标记、守恒的信息和一份明确的白名单。

【免费下载链接】lieflat-less-ai-tone一个基于 283 万字语料统计的去 AI 味 skill · An AI-tone removal skill grounded in a 2.83-million-character corpus study项目地址: https://gitcode.com/gh_mirrors/li/lieflat-less-ai-tone

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/7 15:09:44

评论系统架构设计:高并发读写、缓存一致性与稳定性实践

聊一聊评论系统,这可能是我觉得最容易被低估的业务后端之一。表面上看,评论就是一张表、两个接口的事,存进去再查出来。但现实情况是,每当一个爆款内容出现,流量一下子涌进来,最先扛不住的往往就是评论服务…

作者头像 李华
网站建设 2026/10/7 15:08:33

AnyPS5与PS5模拟器的本质区别:原生移植路线的7个关键技术差异

AnyPS5与PS5模拟器的本质区别:原生移植路线的7个关键技术差异 【免费下载链接】AnyPS5 Tool for automatic PS5 executables porting to Linux and Windows 项目地址: https://gitcode.com/GitHub_Trending/an/AnyPS5 想搞清楚 AnyPS5 和 PS5 模拟器到底有什…

作者头像 李华
网站建设 2026/10/7 15:08:22

一条命令背后,五层各司其职

一、一个简单的问题:date 是谁在执行你在终端里输入 date,按一下回车,时间就出来了。看起来一步完成,其实背后有六个角色接力。执行 date 时发生了什么"流程图分六步:1 终端输入(date)&…

作者头像 李华
网站建设 2026/10/7 15:06:38

前端通信与React核心:HTTP、WebSocket与状态更新全解

如果你写过前端代码,就一定躲不开“前端通信”这四个字。页面要拉数据,表单要提交,日志要上报,服务端还要实时推消息,甚至两个浏览器标签页之间也得互相递个话。而在 React 项目里,这些问题往往还会跟上组件…

作者头像 李华
网站建设 2026/10/7 15:06:19

功能盘点|AI论文写作工具推荐,论文写作与修改之选

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华