如果你最近在用AI写文案,大概率有过这种体验:模型更新了好几轮,代码会写了,题会做了,可一让它写商品文案、小红书图文、公众号文章,出来的东西就越来越油。词汇来回打转,句式像同一个模子刻的,改稿比自己重写还累。
我一开始以为是自己的问题,提示词退步了。于是把知乎、微博、小红书、B站上相关的讨论翻了一遍。结论是:不止你一个人这么觉得,也不止一家的模型这样。
这种感觉,是集体性的
知乎上有个问题:哪些话一出现,你就知道是AI写的。有个三千多收藏的回答,指向了平衡句。知乎
回答里还有个很具体的解释:人说"这不是X,而是Y",是因为X真的存在;AI却会在没有X的情况下,为了衬托Y先立一个靶子。知乎这种句子改起来最难,因为它不是用词问题,是生成机制的问题。
8月中旬,有知乎博主专门写了一篇文章,给AI味特征列了份清单:从高浓度双引号、顿号、破折号,到"答案可能会颠覆你的认知",编号一路排到17。他还提到,一位博主的同一篇文案里连着用了12个"真正",“都看吐了”。知乎
微博实时区的情绪更直接。有人说"看到各种ai文案只想冲进电脑里把发帖发视频的人狠狠揍一顿"。微博也有人吐槽"拿ai写文案的播客能不能都滚"。微博
还有一类人干脆放弃了AI。一位微博用户说,自己绞尽脑汁写了一小时文案,中途试过AI,“总感觉不是自己的真实体验后会表达的内容,于是还是自己发挥”。微博
而且不止一家。B站上有个视频,实测Gemini 3.1 Pro对比3.0写小说,标题就是结论:升级了,但越升级越难用。哔哩哔哩
时间线对得上:恰好是模型更新之后
把时间线捋一下。6月26日,OpenAI发布GPT-5.6,一共三档:旗舰级Sol、日常级Terra、经济级Luna。微博7月10日向公众全面开放,7月31日全系API降价,Luna降80%,Terra降20%。微博8月7日,ChatGPT免费版默认模型直接换成5.6 Luna,Chat模式取消次数限制。知乎下面是官方给出的GPT-5.6 Sol与GPT-5.5 Instant的同题回答对比。

跟着更新的人,很快开始吐槽。知乎"GPT-5.6值得购买Plus或Pro吗"的问题下,有回答说编程"感觉这是最烂的一次更新",速度还巨慢,老老实实用回了5.5。知乎有人说5.5是能偷懒就偷懒,5.6则"每次都恨不得给你造个操作系统出来"。知乎小红书上还有一篇《GPT5.6又翻车了》,作者抱怨Sol、Terra、Luna"漂移失约频发",最后切回了老版本5.4。小红书
代码确实越来越强,资源也确实倾斜了
文案变差的同时,代码能力是实打实变强的。GPT-5.6三档在官方编程测试Terminal-Bench上的成绩,全部压过GPT-5.5。

国内这边更猛。7月26日晚上,月之暗面把2.8万亿参数的Kimi K3完整权重扔上了HuggingFace,14天后,Pre-IPO估值从350亿美元冲到了500亿美元。36氪
编程基准DeepSWE上,K3与对手的成功率只差4个百分点,单位成功成本却差出4.6倍。36氪

前端代码盲测里,Kimi K3以1679分登顶全球第一,超过Claude Fable 5。微博微博上到处都是晒Kimi K3一句提示词写出小游戏的帖子,比如下面这个火箭小游戏。

为什么所有厂商都在卷编程?一位知乎博主的总结很直白:模型从文科生变成了理科生。面向企业的结构化写作,商业报告、技术文档,有人愿意付钱,能力就在显著进化;面向大众的自媒体写作、网文、聊天,赚不到钱,就显著退化,特点就是油腻,来来回回都是相同的词汇和句式。知乎
厂商的动作也在印证这一点。OpenAI早就放弃了视频模型Sora,DeepSeek和Kimi的高管都公开表示不会做视频模型,Anthropic至今没做多模态生图。知乎连张一鸣都在Seed全员会上说,编程只是眼下的热点之一,不应该完全被它牵着走,编程之外还有更多更大的机会。知乎
所以答案的前一半是:模型没有变笨,是换了专业。新版本的训练资源和优化目标都压给了编程和任务执行,"把文章写得好看"不在这次的考核范围里。
但只说这些,对新模型不公平
官方口径正好相反。OpenAI说,这次给GPT-5.6 Sol专门做了聊天体验的专精升级:回答更聚焦,会按问题调整详细程度,避免不必要的格式堆砌;在金融、医疗、法律的事实性内部评估里,Luna和Sol的回答出现至少一处事实错误的比例,比GPT-5.5 Instant分别降了约62%和68%。知乎注意,这两个数字衡量的是"更少出错",不是"更有文采"。准确和好看是两件事,模型可以同时变得更准、也更无聊。
Chat里还加了一个思考强度滑块,日常提问保持快速模式,需要规划、研究、写作、决策时拉高滑块,订阅用户可以自己分配模型的"思考量"。这对写文案的人是个实用功能:大多数文案任务根本不需要拉满推理,拉太高反而容易过度发挥。

还有一个容易被忽视的坑:你的旧提示词,可能正在拖累新模型。知乎有个百万浏览的回答提到,一位开发者把调试了50多次的系统提示词原封不动搬给GPT-5.6,效果不升反降;他花四天逐条检查,提示词砍掉66%,token消耗减少41%,评分反而涨了15%。知乎旧药方治不了新病,这句话放在这里很合适。
那写文案的人,到底该怎么办
结合社区里的讨论,我整理出三条路,可以对号入座。
第一条路:不追新,用旧的。你的主要需求是商品卖点、自媒体图文、朋友圈文案,那新模型的强项(编程、长链路任务)对你没用,弱项(油、慢、过度发挥)全砸在你脸上。社区里有的是实测之后切回老版本的案例。免费用户更省心:免费版默认已经是5.6 Luna,聊天不限次,一分钱不花,先用着,别急着为"写作升级"掏订阅费。
第二条路:用新模型,但换用法。两个动作。一是砍提示词:新模型理解力更强,越不需要你堆指令,给足事实、细节和例子,比堆形容词管用。二是直接立规矩:没有真实对照关系,不许写"不是X,而是Y";“真正”"恰恰"这类词控制频率。有知乎科普博主就是这么给自己配置写作规则的,平衡句的出现概率肉眼可见地降了。知乎
第三条路:按任务分工,别用一个模型打天下。小红书上有篇2.7万人收藏的帖子,讲的就是给AI分工:ChatGPT做结构和策略,DeepSeek做技术解读,Kimi做长文档总结,豆包写中文职场文档,文心一言起草国企政务风,Gemini管双语和图表,Perplexity负责查资料给引用。小红书具体结论可以商榷,思路值得抄:哪个模型写出来合你的胃口,就用哪个写文案,而不是谁名气大用谁。
顺便,盯住这三个信号
第一,看厂商会不会回头补C端写作。OpenAI这次专门为Chat模式优化Sol,算是个信号。有科技媒体的评论很扎心:所有模型都在打Coding,但我们好像忘了,很多人其实并没有生产力需求,他们可能只是想无聊时跟AI聊聊天。知乎如果"聊天和写作"成为下一个竞争点,受益的就是文案用户。
第二,看平台的容忍度。公众号已经开始收紧对AI写作的治理,36氪的判断是,放任AI内容肆意传播,等于毁灭微信建立起来的商业体系。36氪模型写得再好,平台限流、打标,流量端照样亏。
第三,看文案的Agent化。已经有用户在试,让ChatGPT一站式搞定发微博:构思、润色、打开微博、把内容直接填进发布框。微博当AI从"帮你写"走到"替你发",稀缺的就不再是写的速度,而是写什么、值不值得发的判断。
最后给一句总结:如果你觉得这一年"模型写文案变差了",请相信自己的体感。这不是错觉,多数情况下也不是你的提示词不行,而是模型把技能点加在了别处。应对办法也很消费主义——别盲目追新,按任务挑模型,把"去油"这件事,留给时间和厂商。