如果你是用 AI 主要干写作的人,这个 8 月可能会有点懵。
新模型一个接一个地发,宣传词里排在一起的关键词几乎都是同一个:编程。8 月 14 日智谱发布 GLM-5.3,官方介绍称其编码能力比上一代提升约 50%,还声称“意外涌现”出网络安全能力,在漏洞挖掘基准 CyberGym 上做到开源第一。36氪同期阿里开源 Qwen3.8 系列,还发布了一款能在笔记本上运行的全新大模型。知乎据博主统计,DeepSeek V4 Flash 发布后单日调用量达到 8 万亿 Token,登顶全球大模型调用榜首。微博

看这个阵容,大模型厂商像是集体转型成了编程工具公司。但现实是,大多数用 AI 的人根本不写代码。8 月 14 日小红书有网友直接吐槽:“讲真我用AI根本不怎么写代码,天天都在让它帮我写东西”。小红书知乎 8 月 17 日有个提问更直白:“现在擅长写作的AI模型哪个最好?”诉求只有一句——“不要那种ai味道特别浓的,更有可读性的”。知乎
一边是行业集体卷编程,一边是写作用户求“活人感”。这个落差,不是偶然发生的。
一、为什么都在卷编程:不是因为编程最重要,而是因为它最能“证明”
知乎上本周有个回答把这件事说透了:编程是少数能被清楚衡量的智力任务。代码能不能编译、程序能不能跑、测试通没通过,都有明确判定;AI 写错了,可以根据报错继续改,“生成、执行、发现错误、继续修改”形成一个完整闭环。而这个闭环,恰恰是当下主流后训练路线最重要的燃料——只有能被自动打分的任务,才能拿来大规模训练模型。资本市场需要明确的进步,产品发布需要好看的数字,代码排行榜就成了最方便的证明方式。知乎
写作恰好相反。用那位作者的话说:“一篇文章有没有灵魂,无法通过单元测试判断”。知乎GLM-5.3 反而从侧面印证了这个逻辑:它与上一代共用同一个基座,所有提升都来自后训练,编码能力就涨了约 50%——能被自动打分的任务,杠杆就是这么夸张。36氪
再加上商业逻辑。程序员是最容易接受 AI、也最愿意为效率付费的一批用户,Coding Plan 和订阅套餐自然成了大模型厂商眼下最确定的变现路径。连一向低价的 DeepSeek 都开始反向涨价:V4-Pro 的输出价格从每百万 Token 6 元涨到了高峰时段的 27 元,涨幅 350%。知乎“国产模型只会越来越便宜”的阶段,可能已经过去了。
二、但这场竞赛的代价,正落在你的写作体验上
你直观感受到的“AI 味”,其实就是这种资源倾斜的副产品。有知乎回答描述得很准:现在的模型参数更大了,推理能力更强了,编程分数也越来越高,但写出来的文章却越来越像——“开头一定要先制造一个问题,中间一定要分成几个小标题,结尾一定要进行价值升华”。知乎
围绕“去 AI 味”,甚至已经长出了一门生意。小红书上“去 AI 味提示词”帖子动辄几千上万收藏;微博上有人开源了“活人感写作 skill”,专门用来弱化文字里的 AI 感。微博AI 博主“数字生命卡兹克”8 月 5 日感慨:“写作,好像是2026年的今年,被AI行业忽视的最多的场景”。微博
更隐蔽的是信任成本。有微博用户说得扎心:AI 写文发展到现在,创作者无法证明自己不是用 AI 写的,读者也无法分辨眼前的文字是不是 AI 写的。微博当所有模型都用同一套“模范作文”模板写字,连真人写作都开始被怀疑是 AI。
说到这里要划一条边界:“写作能力全面倒退”目前没有基准证据,我不下这个结论。但有两份社区整理的“写作榜”,至少能回答一个更实际的问题:到底谁写作真的行。

第一个是 Hemingway-bench:评委是小说家、编辑、诗人,盲评 AI 写的小说、文案和邮件,打分只看品味和原创性,格式再工整也不加分。结果相当反直觉——一批在编程和推理榜上呼风唤雨的旗舰模型,在这里名次并不靠前。

第二个是 Arena 创意写作榜,尺子完全不同——纯大众盲投:同一道题,两个匿名模型各写一篇,网友选好的那篇,已经投了 117 万多次。小红书

大众投票的结果更扎心:推理能力公认顶尖的 Claude Opus 5,写作只排第 7;综合跑分第一梯队的 GPT-5.6 Sol,创意写作直接掉到第 11。小红书把两份榜单交叉对照更有意思:同一个模型,两榜名次能差出十几位。图里的总结很直白——推理最强的模型,写作不一定最强。
三、写作用户怎么办:几条能直接用的判断
第一,选模型看“写作战绩”,别看编程榜。各家口径还在互相打架:7 月中旬发布的 Kimi K3 有 2.8 万亿参数,发布时的说法相当激进:在前端开发和写作等多个基准测试中直接冲到了全球第一,甚至超越了 Fable 5 和 GPT 5.6。微博但上面两份独立榜单里,第一名都是 Claude Fable 5。小红书“写作冠军”本身就有水分,最可靠的还是拿你自己常用的两三段写作任务,把候选模型实测一遍,榜单只用来缩小范围。
第二,不写代码,就别为编程订阅付费。这轮订阅是为编程场景定价的,旗舰价格已经被顶得很高:Kimi K3 输出价每百万 Token 100 元,是混元-TurboS 的 50 倍。知乎你付的是编程和智能体任务的算力溢价,和你的写作需求关系不大。K3 的热度也远超官方预期,一度因为算力不够暂停新用户订阅。微博如果你的需求是写材料、写公文、写文章,免费额度和低价通用 API 完全够用。
第三,提示词有用,但别把希望全押在“去味咒语”上。去 AI 味提示词治的是标,更有效的做法是给素材、给样例:把你以前写过的几段话丢给它模仿语气,让它基于具体材料写,而不是从一句主题开始自由发挥;与其说“写得自然一点”,不如一条条禁用——禁用“总的来说”、禁用小标题、禁用排比开场。前者的上限比后者高。
最后,留三个值得盯的信号:有没有厂商在新版本里开始发布写作、长文专项基准,那说明写作场景被看见了;“活人感”会不会变成产品卖点;后训练的下一批研究会去攻克主观评测,还是继续绕着走。三个里任何一个发生,写作用户的处境就会开始松动。
竞赛的方向由“什么能被衡量”决定,但你的需求,不必跟着榜单走。