10月5日晚,人民日报"人民锐评"点名批量上线的离谱网文:歹徒持刀深深刺进男主胸腔,男人却丝毫无伤,理由是"他的心早已提到了嗓子眼";霸总掏出一百万现金砸在别人脸上;女主大量失血,一夜之间身体完全复原。 "谁来管管现在的小说"这个话题在此之前已经登上热搜。微博
在锐评给出的因果链里,流量导向(日更是收益硬条件)排第一,编辑精细审核缺位排第二,AI排第三:模板套重生复仇霸总、换个人名生成成百上千部,而模型抓取互联网文本时又会不断复刻网上流传的荒诞桥段,“越传越错”。微博
但在用AI写作的人那边,另一场争论已经持续了大半年:AI写作,是不是真的变差了?从6月搜到10月,至少五篇独立发帖把这事摆上了台面——
6月4日,“C哥聊科技"在知乎断言:过去半年,全世界所有新模型的写作能力在"断崖式下跌”。知乎
8月13日,知乎答主史蒂芬(236赞同、69评论)的解释是:AI"从文科生变理科生",to C写作显著退化,特点是油腻。
8月24日,马小帅做了同一套提示词下的新旧模型盲测,结论:一年前已下架的Gemini 2.5 Pro仍是第一名。
9月24日,David周子轩反驳:模型没有变笨,是训练目标和用户心智"错位"。知乎
10月1日,小红书用户O_o(560赞、94评)连载三工具实测,结论更扎心:每家都会崩,崩法不一样。
锐评说的是读者受到的伤害,吵架的是书桌前的人。对拿AI写长篇的作者,这两件事得拆开,才做得对选择。
先把证据分档:哪句话有研究、哪句话是体感、哪句话还不能认
第一档:AI味句式泛滥。证据最硬,有研究背书。 马小帅引述的多项研究显示,instruction tuning和RLHF之后,模型输出在语法、词汇、修辞上系统性地偏离人类写作:名词密集、信息密度高、正式、中性,第一人称和个人经历变少,“不是X而是Y”、破折号、列举、过渡词频率暴涨;不同厂商模型的创意输出随时间越来越相似,多样性下降。 体感侧对得上:史蒂芬帖子里写得很直白——面向大众的自媒体写作、网文这类to C生成"是在显著退化的,特点是油腻,来来回回都是相同的词汇和句式"。 评论区更具体:高赞说"DS写文会点转折词给它狂的,尤其是’不是……而是……'“,另一条41赞是"我一看到’颠覆你的认知’几个字,我就关了”。所以"AI写差了"的一半真相是:它不再给你惊喜,而人类的鉴赏力还在进化。这一条改变不了模型,只能改变用法。知乎知乎
第二档:同题新旧盲测。方向一致,样本很小。 马小帅的任务是仿写财经博主写日报,跑了五款模型,他的主观排序:Gemini 2.5 Pro(9分)>DeepSeek-V4-Pro(7.3)>Claude Sonnet 5(6.5)>Codex 5.6 Sol(6)>Gemini 3.6 Flash(5.3)。 毛病也写得具体:DeepSeek"情绪饱满、有判断力,可惜后半段内容有点重复,收尾松了";Claude"写到中段逻辑绕来绕去,没说透";Codex"正文却写成了新闻汇编,最没人味儿"。一个人的提示词、一天的任务,没有对照组,不能外推;但它和多个博主的体验互证——“一年前同一套提示词跑出来的初稿改两下就能发,现在几乎每次都要从头到尾大改一遍”。知乎

第三档:“模型写作能力客观退化”。说法最重,证据最少。 David周子轩把反证摆得很清楚:公开资料没有写作质量的统一定义,更没有不同代际模型的纵向对比数据,“退化"在严格口径下无法证实。 能确认的是三条机制:行业资源确实流向推理、代码和agent;推理轨迹数据拿来训练后,模型思考层次变深,输出却容易"像解题过程”,和人类的线性阅读习惯打架;有研究提示输出超过约3000 token后质量明显下降。再加上合成数据反复喂给模型会诱发model collapse——这正是人民锐评"越传越错"在机制层的注脚。知乎
对写作者,最稳妥的表述只有一句:写作能力这半年没有可见进步、优先级被移走、风格在收敛、语料在被全网烂梗污染——是不是"退化",留给基准,你不必赌。
你真正花钱的地方:长篇的三种崩,不是文笔退步
写小说的用户,痛点从来不在单句,在第30章。O_o把DeepSeek、元宝、Kimi连着用了一遍,帖子里的三种崩法完全不重叠:DeepSeek"越写画风越怪,人设全崩,后面会忽然输出一大段文字重复率极高";元宝"记不住设定、剧情发展总是很急促、字数少得可怜";Kimi的文风、排版、上下文记忆被认为最适合连载,但评论区最集中的抱怨是"文特别平,加了情感曲线的指令也没有用"。小红书
这不是文笔问题,是三种机制不同的故障,解法也不同:
记忆漂移(人设崩、前后矛盾):工程能救。做过的人已经把它做成了产品——写同人文的作者三把刷子一句话点破原因:聊天界面"非常容易忘掉比较久的上下文,而且画风不稳定容易崩"。 所以把人物卡、世界观规则、伏笔清单做成文档,每章随提示注入,别指望对话记忆。知乎
自我重复(重复率突增):粒度能救。别让它一次长驱直入生成大段正文,控制单次续写字数、分段生成后人工拼接。
情感平(节奏单调):最难救。换模型或人工重写情绪段,提示词调教基本被证明无效(情感曲线那条就是例子)。
所以别问"哪家文笔最强",问"哪家跑哪一段"。知乎用户Kuanwei为"同一批角色在多部独立短篇里出演"专门做了DeepSeek Harness插件"短篇集作家",卖点就一个:角色人设不崩。 连专门做插件的人都只敢承诺"人设不崩"这一件事,你就知道"哪家最强"这个问题本身有多不靠谱。知乎

按体裁分工表(全部是社区实测样本,不是官方排名)
段位 | 社区口碑位 | 依据与代价 |
|---|---|---|
大纲、世界观、初稿骨架 | DeepSeek-V4-Pro:情绪饱满、判断力强(马小帅盲测7.3分位),后半段重复的毛病用短程分次生成绕开 | app与API玩家基数大,社区吐槽集中在画风漂移而非价格 |
长篇连载续写、跨章节记忆 | Kimi:文风、排版、上下文过渡被连载用户评为最顺(O_o实测),情感平靠人工补情绪段 | app会员引导明显、API偏贵是社区一致说法,动手前查现价 |
同人、还原原著人物性格 | Grok:评论区公认"抓原著人物性格更厉害",但按评论说法订阅不便宜 | 小额先试 |
热点仿写、文案逻辑框架 | GPT系:评论区公认"逻辑好"、“文笔凑合”,情绪落点需第二个模型或人工 | 有人实测"让GPT写完还得去豆包润色" |
修稿、去AI味 | 不让生成模型自审:马小帅让Codex给五篇仿写打分,明显偏向自家输出;实操是换模型交叉润色 | 多一次API调用成本 |

表里的模型版本都是各信源当时实测的,模型更新极快。开工前,用你自己的提示词做一次同题测试——这是全文成本最低、也最不会被别人经验坑住的一步。
发稿前的三道检查:把人民锐评倒过来,照自己
人民锐评点名的三条原因,正好能翻成用AI写作者的三道自检:
常识链:把动作戏里的身体、物理描述单独拎出来问一句"这做得到吗"。被点名的离谱桥段,几乎全死在"心提到嗓子眼"这种字面不成立的句子上。AI不会主动做常识校验,这一道必须人加。
动机链:每个强冲突问一句"人物的动机撑得住吗"。知乎上对"机器味"的高赞判断是:AI稿最大的问题不是写得差,而是写得太像"正确答案"——冲突、情绪、连每段结尾的小总结都很正确,就是不像活人写的事。知乎
更新节奏:稳定日更是平台收益的硬条件,也是锐评认定的"放弃推敲"的源头。知乎用户九悟19岁实操AI写小说三个月,话讲得狠:90%用AI写小说的人一分钱都赚不到,“不是AI不行,是方法从根上就错了”。 AI帮你凑日更时,审核缺位就转嫁到你头上。可以借通彻哥10月5日给的流程:AI初稿→拆成命题和证据→人工修改连接→AI重组,专治"逻辑有问题却被润色得越来越像论文"。知乎知乎

接下来盯三个信号
番茄、起点等平台在锐评之后是否跟进具体规则——7月已经有一轮拒签和下榜,下一轮可能就是审核条款;
下一代模型发布时,创意写作还进不进发布会。马小帅盲测里9分的那款已经下架,他的原话是:眼下市面上能拿到手的模型,没有一个能达到当年这个水准。 哪天厂商愿意把资源分回写作,"退化"论才有被证伪的机会;知乎
写作质量的公开纵向基准何时出现——尺子一旦有了,这场持续半年的争论就能一次性结案。
离谱网文是"AI直出+没人把关"的终点站,退化之争是"尺子不存在"的焦虑。对用AI辅助写作的人,两半其实都捏在自己手里:尺子没有,就先做自己的同题测试;没人把关,就用三道检查把自己当编辑。模型会替你跑完一段,但替你写不成一本书。