26条"AI特征"被推翻15条:你收藏的去AI味清单,删得最狠的恰恰是人味

源自25位全网作者

18:53

被全网转发的"去AI味指令",正在遭遇一场来路不太对的翻车。小红书单条"文章AI味从90%降到0%“的指令被收藏5.8万次,10月4日"先让AI学会像人说话再重写"的视频又收走4.5万收藏,标题就写着"AI 写的文章一眼假?”。小红书小红书

而10月9日,一位用WorkBuddy跑初稿、照着"AI味清单"逐句修了半年稿的作者发复盘说,他把清单废了。 让他下决心的是GitHub上一个两千五百多星(实测2548星)的语料研究——把26项全网公认的"AI文风特征"逐项上机测量,结果15项要么无差异、要么方向是反的,他删得最狠的设问和比喻,恰恰是人类用得更多的东西。知乎GitHub

这份研究不是又一个"凭感觉总结"的清单。值得每个靠AI出稿、再靠手工去味吃饭的人把它过一遍——不是因为它给了标准答案,而是因为它第一次把"去AI味"这门玄学的账本摊开了。

283万字的对照实验是怎么做的

研究用629篇文章、282.7万汉字构建对照语料:生成侧300篇,由claude-opus-4-6、deepseek-v4-pro、gemini-3.1-pro、gpt-5.6-sol、kimi-k3五个模型各写60篇、覆盖38个话题,生成时不联网、不加任何风格指令,只给题目;人类侧329篇公开发表文本,按来源分组独立统计。 然后把公共讨论里流传的26项"AI味"候选特征逐项做算子、算生成侧与人类侧的频率比:比值≥2.0才算成立,0.8到1.25之间判"无区分力",比值<0.8意味着人类侧更高——那"删掉它"的方向本身就错了。结果:11项通过,15项出局,3项方向反转。判定程序公开可复算,三个脚本随仓库发布。GitHub

你删得最狠的三条,恰恰是误杀

设问句。 各清单的第一戒律都是"AI爱自问自答,删掉"。实测:人类正文设问每千字1.83处,AI只有0.10处——人比AI爱问17倍;至于"自问自答"这个具体形态,两侧频率完全持平(各0.13处)。 按清单删设问,等于把自己的文本往AI的方向修。知乎

比喻。 “AI爱用比喻拔高抽象概念"同样不成立:人类比喻频率是AI的2.4倍,用比喻独立起段是8倍。 真正的差异在喻体——AI爱写"像一位智慧的导师”“一个永不疲倦的审查员"这类理想化人格喻(该项高出人类7.3倍),人写的是"像个老师傅”“像我那个做人脉的医生朋友”。所以去AI味的正确动作不是删比喻,是把抒情式喻体换成讲事式的具体人。GitHub

句长参差。 “句子要有长有短才自然"被直接证伪:句长变异系数AI 0.58、人类0.67,比值0.87,无差异。 这项还是整个研究翻车最狠的一处——初测时曾得出"AI句长均匀度是人类51倍"的吓人结论,追查后发现是切句程序的bug:Markdown表格没有句号,被当成了一整个句子,有一组语料里跑出了一个一万九千字的"句子”。修正重测,差异消失。研究团队把包括这次在内的六次测量失误全部写进了论文,并定了条规程:任何算子先抽样检视20条命中实例,再采信频率。GitHub

破折号。 经典清单条目,实测分模型极差超过40倍:DeepSeek每千字5.16个、Claude 4.25、Kimi 2.32、Gemini 0.51,GPT只有0.11个。 破折号证明不了"是不是AI",顶多证明"你用的哪家"。研究者初期只测两个模型时得出"破折号是Claude独有",扩到五个模型就被推翻了——多数流传清单,就是把单一模型的癖好当成了全体AI的罪证。GitHub

真正站得住的11条,几乎全在篇章层

通过的11项有个共同点:不在用词标点上,在段落和句子怎么衔接上。 逐条能直接换成改稿动作:GitHub

  • 段首零回指评论,区分力最强,4.4倍。 AI爱在新段落开头光着下判断:“听起来像条功能描述”“值得注意的是配置文件的位置”——评价对象不标出来,读者得翻回上一段找。 人类会写"这听起来像条功能描述"。补一个指示代词,4.4倍差距就消掉了。顺带一刀:段首衔接词的总密度两侧无差异(14.4%对15.1%),"禁连接词"这条也砍错了。知乎

  • 空转冒号句,9.4倍。 “我见过的几种典型场景:”——句子本身零信息,唯一作用是宣布下面有列表;AI每千字0.29处,真人接近零。知乎

  • 对举结构"不是A而是B",3.4倍;顿号并列过密,1.8倍;相邻句同一骨架连写,2倍;序数词充当小标题,3.1倍;"说白了"类起首语,3.2倍。

  • 译文句式,18项候选只活下5项:过长前置定语、“当……时"从句、“对于……来说"话题壳、句首"然而,”、“这意味着"复述句。 而"不仅仅是”(每千字0.05)、“值得注意的是”(0.02)、“使得……能够”(0.03)这类被英文AI检测经验移植过来的"高频罪状”,在中文语料里根本不构成生成文本的区别特征——现代汉语书面语早就消化了它们,见一个杀一个是白干活。GitHub

  • 一条反向特征:数字密度。 人类每千字17.92个数字,AI只有6.34个。 AI味的根子不是编数据,是爱用概括表述覆盖掉你原文里已有的具体数字。所以性价比最高的一步不是删词,是喂料:初稿就把年份、人数、预算、比分喂给模型,改稿时盯着它别把你交的具体数据"总结"没了。GitHub

为什么你的清单会反:三个机制

第一,英文检测经验的直接移植。现在流传最广的那批"万能指令",源头是英文世界绕开GPT检测的prompt——收藏7777的"GPT5.2去AI味:从92%到0%“帖,正文就是五段英文,开头是"Replace all transition words and conjunctiops in the sentences with the most basic and commonly used ones”,结尾是"Deletes the conclusion part in the end of the text"。 把这些句法假设搬到中文,一半概率搬错。第二,单一模型的样本冒充全体AI,破折号就是现成例子。第三,清单有保质期:GPT的破折号频率不到一年从"近乎每句一个"降到每千字0.11,模型一直在向人类文风收敛,你抄的那张清单是几年前版本的,没人告诉你。小红书

限流那一半焦虑,两边的证据都别全信

去AI味人群的另一半动力是"平台会识别AI味、压低推荐"。今天(10月9日)知乎上这个争议正好吵成两半:一半文章说"文案AI味重没流量,平台识别出流水线内容会压低分发权重"。 另一半则拿出账号数据反驳:“AI率只是影响文章质量的一个重要指标,但不是完全指标”,100多篇稿子阅读量卡在200,问题出在语义同质化和套模板,不在"被判定成AI"。 值得注意的是一批高赞判断都自带工具传送门——推"小橡皮"的、推"contentany"的、推"EduPro降AI率引擎"的,去味焦虑和卖检测、卖改写是同一门生意。知乎知乎

证据只能推到这儿:"平台按AI味限流"至今没有任何官方口径可核,两边都是从业者观察;语料研究本身也留了诚实的局限声明——人类侧语料因版权与隐私不公开、第三方无法直接复算数值,正则算子测不了语义层特征,所有频率都只代表特定时点。 换句话说,这份研究能告诉你"哪些改法对读者观感有效",告诉不了你"能不能躲过检测器"。想靠删词骗过AIGC检测的,这张清单帮不了你;文书圈那篇流传很广的总结里有句话倒是和实验互洽——“为了降低分数去改,往往越改越假;为了让人读得下去去改,分数通常会跟着下来”。GitHub知乎

这张表怎么用

照着清单手工改稿的号主/写手:把旧清单换掉。停掉四条——删设问、删比喻、为参差强拆句子、全模型禁破折号;执行四条——段首评论补回指、杀空转冒号、拆连续同构句、理想化喻体换具体人;再加一条——初稿喂具体数字,改稿防概括覆盖。

多模型换着用的重度用户:每次换模型后按那11项重新校一遍癖好表,别拿上一家模型的清单套下一家。同一段提示词换模型跑,破折号能差40倍。

目标是过检测的(学术/文书):特征清单管观感、不管检测器分数,检测口径各家不同且在换代;先认目标机构的规则,再决定掏不掏检测的钱。

继续观察什么:这套结论的存活性取决于复算——脚本和算子定义都开源,你可以拿自己账号的旧稿当语料跑一遍;另外盯各平台会不会哪天把"AI特征与推荐权重的关系"说出口。在此之前,任何告诉你"删了这个词就能拿流量"的帖子,包括这份,都先按证据档位打折再看。

半年时间,一张全网都在转的清单,教会我们把眼睛盯在词上——而283万字说:盯段落,盯衔接,盯你有没有东西可写。清单会过期,统计口径和复算方法不会。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章