大模型都在卷编程,AI写作却越来越“AI味”:先别抄“去味”提示词,看看这两张榜

源自12位全网作者

01:07

如果你是用 AI 主要干写作的人,这个 8 月可能会有点懵。

新模型一个接一个地发,宣传词里排在一起的关键词几乎都是同一个:编程。8 月 14 日智谱发布 GLM-5.3,官方介绍称其编码能力比上一代提升约 50%,还声称“意外涌现”出网络安全能力,在漏洞挖掘基准 CyberGym 上做到开源第一。36氪同期阿里开源 Qwen3.8 系列,还发布了一款能在笔记本上运行的全新大模型。知乎据博主统计,DeepSeek V4 Flash 发布后单日调用量达到 8 万亿 Token,登顶全球大模型调用榜首。微博

大模型都在卷编程,AI写作却越来越“AI味”:先别抄“去味”提示词,看看这两张榜

看这个阵容,大模型厂商像是集体转型成了编程工具公司。但现实是,大多数用 AI 的人根本不写代码。8 月 14 日小红书有网友直接吐槽:“讲真我用AI根本不怎么写代码,天天都在让它帮我写东西”。小红书知乎 8 月 17 日有个提问更直白:“现在擅长写作的AI模型哪个最好?”诉求只有一句——“不要那种ai味道特别浓的,更有可读性的”。知乎

一边是行业集体卷编程,一边是写作用户求“活人感”。这个落差,不是偶然发生的。

一、为什么都在卷编程:不是因为编程最重要,而是因为它最能“证明”

知乎上本周有个回答把这件事说透了:编程是少数能被清楚衡量的智力任务。代码能不能编译、程序能不能跑、测试通没通过,都有明确判定;AI 写错了,可以根据报错继续改,“生成、执行、发现错误、继续修改”形成一个完整闭环。而这个闭环,恰恰是当下主流后训练路线最重要的燃料——只有能被自动打分的任务,才能拿来大规模训练模型。资本市场需要明确的进步,产品发布需要好看的数字,代码排行榜就成了最方便的证明方式。知乎

写作恰好相反。用那位作者的话说:“一篇文章有没有灵魂,无法通过单元测试判断”。知乎GLM-5.3 反而从侧面印证了这个逻辑:它与上一代共用同一个基座,所有提升都来自后训练,编码能力就涨了约 50%——能被自动打分的任务,杠杆就是这么夸张。36氪

再加上商业逻辑。程序员是最容易接受 AI、也最愿意为效率付费的一批用户,Coding Plan 和订阅套餐自然成了大模型厂商眼下最确定的变现路径。连一向低价的 DeepSeek 都开始反向涨价:V4-Pro 的输出价格从每百万 Token 6 元涨到了高峰时段的 27 元,涨幅 350%。知乎“国产模型只会越来越便宜”的阶段,可能已经过去了。

二、但这场竞赛的代价,正落在你的写作体验上

你直观感受到的“AI 味”,其实就是这种资源倾斜的副产品。有知乎回答描述得很准:现在的模型参数更大了,推理能力更强了,编程分数也越来越高,但写出来的文章却越来越像——“开头一定要先制造一个问题,中间一定要分成几个小标题,结尾一定要进行价值升华”。知乎

围绕“去 AI 味”,甚至已经长出了一门生意。小红书上“去 AI 味提示词”帖子动辄几千上万收藏;微博上有人开源了“活人感写作 skill”,专门用来弱化文字里的 AI 感。微博AI 博主“数字生命卡兹克”8 月 5 日感慨:“写作,好像是2026年的今年,被AI行业忽视的最多的场景”。微博

更隐蔽的是信任成本。有微博用户说得扎心:AI 写文发展到现在,创作者无法证明自己不是用 AI 写的,读者也无法分辨眼前的文字是不是 AI 写的。微博当所有模型都用同一套“模范作文”模板写字,连真人写作都开始被怀疑是 AI。

说到这里要划一条边界:“写作能力全面倒退”目前没有基准证据,我不下这个结论。但有两份社区整理的“写作榜”,至少能回答一个更实际的问题:到底谁写作真的行。

大模型都在卷编程,AI写作却越来越“AI味”:先别抄“去味”提示词,看看这两张榜

第一个是 Hemingway-bench:评委是小说家、编辑、诗人,盲评 AI 写的小说、文案和邮件,打分只看品味和原创性,格式再工整也不加分。结果相当反直觉——一批在编程和推理榜上呼风唤雨的旗舰模型,在这里名次并不靠前。

大模型都在卷编程,AI写作却越来越“AI味”:先别抄“去味”提示词,看看这两张榜

第二个是 Arena 创意写作榜,尺子完全不同——纯大众盲投:同一道题,两个匿名模型各写一篇,网友选好的那篇,已经投了 117 万多次。小红书

大模型都在卷编程,AI写作却越来越“AI味”:先别抄“去味”提示词,看看这两张榜

大众投票的结果更扎心:推理能力公认顶尖的 Claude Opus 5,写作只排第 7;综合跑分第一梯队的 GPT-5.6 Sol,创意写作直接掉到第 11。小红书把两份榜单交叉对照更有意思:同一个模型,两榜名次能差出十几位。图里的总结很直白——推理最强的模型,写作不一定最强。

三、写作用户怎么办:几条能直接用的判断

第一,选模型看“写作战绩”,别看编程榜。各家口径还在互相打架:7 月中旬发布的 Kimi K3 有 2.8 万亿参数,发布时的说法相当激进:在前端开发和写作等多个基准测试中直接冲到了全球第一,甚至超越了 Fable 5 和 GPT 5.6。微博但上面两份独立榜单里,第一名都是 Claude Fable 5。小红书“写作冠军”本身就有水分,最可靠的还是拿你自己常用的两三段写作任务,把候选模型实测一遍,榜单只用来缩小范围。

第二,不写代码,就别为编程订阅付费。这轮订阅是为编程场景定价的,旗舰价格已经被顶得很高:Kimi K3 输出价每百万 Token 100 元,是混元-TurboS 的 50 倍。知乎你付的是编程和智能体任务的算力溢价,和你的写作需求关系不大。K3 的热度也远超官方预期,一度因为算力不够暂停新用户订阅。微博如果你的需求是写材料、写公文、写文章,免费额度和低价通用 API 完全够用。

第三,提示词有用,但别把希望全押在“去味咒语”上。去 AI 味提示词治的是标,更有效的做法是给素材、给样例:把你以前写过的几段话丢给它模仿语气,让它基于具体材料写,而不是从一句主题开始自由发挥;与其说“写得自然一点”,不如一条条禁用——禁用“总的来说”、禁用小标题、禁用排比开场。前者的上限比后者高。

最后,留三个值得盯的信号:有没有厂商在新版本里开始发布写作、长文专项基准,那说明写作场景被看见了;“活人感”会不会变成产品卖点;后训练的下一批研究会去攻克主观评测,还是继续绕着走。三个里任何一个发生,写作用户的处境就会开始松动。

竞赛的方向由“什么能被衡量”决定,但你的需求,不必跟着榜单走。

内容由AI生成

精选参考来源

1. 实测GLM-5.3:同一个模型,为什么会像两个AI?

2. 阿里发布能在笔记本运行的全新大模型,这会如何改变AI市场格局?

3. DeepSeek V4 Flash发布以后,以单日8万亿Token的恐怖吞吐量登顶全球AI大模型调用榜首!AI界的DeepSeek斩杀线已经来临,跑得快的梁圣没有奖励,跑得慢的那真是大事不妙了~#DeepSeek登顶全球第一##DeepSeek一天消耗了8万亿# 马上谈的微博视频

4. 大模型都在卷coding,AI写作拉成一坨谁管?

5. 现在擅长写作的AI模型哪个最好?

6. 现在各种各样AI大模型层出不穷,那AI的成本什么时候才能降下来?

7. 国产大模型迈入付费时代,市场格局将如何变化?

8. #活人感写作Skill# 写内容AI感重的人可以看👀发现了一个活人感写作.skill,可以专门用来弱化文字里的AI感

9. 写作,好像是2026年的今年,被AI行业忽视的最多的场景。可我们人类世界的一切,本质都建立在文字之上。这三年,被人讨论的最多的事,可能就是怎么去除AI味。开源「活人感写作.skill」,只为帮你写出没有AI味的文字。

10. ai写文发展到现在最恶心的两点就是创作者无法证明自己不是用ai写的,和读者无法分辨眼前文字是不是用ai写的,随便哪一样都足以让两方痛苦

11. Kimi K3 的发布很可能是开源领域的又一个里程碑。作为一个拥有 2.8 万亿参数、百万 token 上下文的巨无霸模型,它在前端开发和写作等多个基准测试中直接冲到了全球第一,甚至超越了 Fable 5 和 GPT 5.6。

12. #人工智能##KimiK3# Kimi官宣:由于算力有限,暂停新用户订阅。Kimi K3 获得的喜爱远超我们的预期,我们的 GPU 也感受到了压力。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章