GPT-5.6写代码变强、写文案变差?扒了全网吐槽,我搞明白问题出在哪

源自18位全网作者

06:23

如果你最近在用AI写文案,大概率有过这种体验:模型更新了好几轮,代码会写了,题会做了,可一让它写商品文案、小红书图文、公众号文章,出来的东西就越来越油。词汇来回打转,句式像同一个模子刻的,改稿比自己重写还累。

我一开始以为是自己的问题,提示词退步了。于是把知乎、微博、小红书、B站上相关的讨论翻了一遍。结论是:不止你一个人这么觉得,也不止一家的模型这样。

这种感觉,是集体性的

知乎上有个问题:哪些话一出现,你就知道是AI写的。有个三千多收藏的回答,指向了平衡句。知乎

回答里还有个很具体的解释:人说"这不是X,而是Y",是因为X真的存在;AI却会在没有X的情况下,为了衬托Y先立一个靶子。知乎这种句子改起来最难,因为它不是用词问题,是生成机制的问题。

8月中旬,有知乎博主专门写了一篇文章,给AI味特征列了份清单:从高浓度双引号、顿号、破折号,到"答案可能会颠覆你的认知",编号一路排到17。他还提到,一位博主的同一篇文案里连着用了12个"真正",“都看吐了”。知乎

微博实时区的情绪更直接。有人说"看到各种ai文案只想冲进电脑里把发帖发视频的人狠狠揍一顿"。微博也有人吐槽"拿ai写文案的播客能不能都滚"。微博

还有一类人干脆放弃了AI。一位微博用户说,自己绞尽脑汁写了一小时文案,中途试过AI,“总感觉不是自己的真实体验后会表达的内容,于是还是自己发挥”。微博

而且不止一家。B站上有个视频,实测Gemini 3.1 Pro对比3.0写小说,标题就是结论:升级了,但越升级越难用。哔哩哔哩

时间线对得上:恰好是模型更新之后

把时间线捋一下。6月26日,OpenAI发布GPT-5.6,一共三档:旗舰级Sol、日常级Terra、经济级Luna。微博7月10日向公众全面开放,7月31日全系API降价,Luna降80%,Terra降20%。微博8月7日,ChatGPT免费版默认模型直接换成5.6 Luna,Chat模式取消次数限制。知乎下面是官方给出的GPT-5.6 Sol与GPT-5.5 Instant的同题回答对比。

GPT-5.6写代码变强、写文案变差?扒了全网吐槽,我搞明白问题出在哪

跟着更新的人,很快开始吐槽。知乎"GPT-5.6值得购买Plus或Pro吗"的问题下,有回答说编程"感觉这是最烂的一次更新",速度还巨慢,老老实实用回了5.5。知乎有人说5.5是能偷懒就偷懒,5.6则"每次都恨不得给你造个操作系统出来"。知乎小红书上还有一篇《GPT5.6又翻车了》,作者抱怨Sol、Terra、Luna"漂移失约频发",最后切回了老版本5.4。小红书

代码确实越来越强,资源也确实倾斜了

文案变差的同时,代码能力是实打实变强的。GPT-5.6三档在官方编程测试Terminal-Bench上的成绩,全部压过GPT-5.5。

GPT-5.6写代码变强、写文案变差?扒了全网吐槽,我搞明白问题出在哪

国内这边更猛。7月26日晚上,月之暗面把2.8万亿参数的Kimi K3完整权重扔上了HuggingFace,14天后,Pre-IPO估值从350亿美元冲到了500亿美元。36氪

编程基准DeepSWE上,K3与对手的成功率只差4个百分点,单位成功成本却差出4.6倍。36氪

GPT-5.6写代码变强、写文案变差?扒了全网吐槽,我搞明白问题出在哪

前端代码盲测里,Kimi K3以1679分登顶全球第一,超过Claude Fable 5。微博微博上到处都是晒Kimi K3一句提示词写出小游戏的帖子,比如下面这个火箭小游戏。

GPT-5.6写代码变强、写文案变差?扒了全网吐槽,我搞明白问题出在哪

为什么所有厂商都在卷编程?一位知乎博主的总结很直白:模型从文科生变成了理科生。面向企业的结构化写作,商业报告、技术文档,有人愿意付钱,能力就在显著进化;面向大众的自媒体写作、网文、聊天,赚不到钱,就显著退化,特点就是油腻,来来回回都是相同的词汇和句式。知乎

厂商的动作也在印证这一点。OpenAI早就放弃了视频模型Sora,DeepSeek和Kimi的高管都公开表示不会做视频模型,Anthropic至今没做多模态生图。知乎连张一鸣都在Seed全员会上说,编程只是眼下的热点之一,不应该完全被它牵着走,编程之外还有更多更大的机会。知乎

所以答案的前一半是:模型没有变笨,是换了专业。新版本的训练资源和优化目标都压给了编程和任务执行,"把文章写得好看"不在这次的考核范围里。

但只说这些,对新模型不公平

官方口径正好相反。OpenAI说,这次给GPT-5.6 Sol专门做了聊天体验的专精升级:回答更聚焦,会按问题调整详细程度,避免不必要的格式堆砌;在金融、医疗、法律的事实性内部评估里,Luna和Sol的回答出现至少一处事实错误的比例,比GPT-5.5 Instant分别降了约62%和68%。知乎注意,这两个数字衡量的是"更少出错",不是"更有文采"。准确和好看是两件事,模型可以同时变得更准、也更无聊。

Chat里还加了一个思考强度滑块,日常提问保持快速模式,需要规划、研究、写作、决策时拉高滑块,订阅用户可以自己分配模型的"思考量"。这对写文案的人是个实用功能:大多数文案任务根本不需要拉满推理,拉太高反而容易过度发挥。

GPT-5.6写代码变强、写文案变差?扒了全网吐槽,我搞明白问题出在哪

还有一个容易被忽视的坑:你的旧提示词,可能正在拖累新模型。知乎有个百万浏览的回答提到,一位开发者把调试了50多次的系统提示词原封不动搬给GPT-5.6,效果不升反降;他花四天逐条检查,提示词砍掉66%,token消耗减少41%,评分反而涨了15%。知乎旧药方治不了新病,这句话放在这里很合适。

那写文案的人,到底该怎么办

结合社区里的讨论,我整理出三条路,可以对号入座。

第一条路:不追新,用旧的。你的主要需求是商品卖点、自媒体图文、朋友圈文案,那新模型的强项(编程、长链路任务)对你没用,弱项(油、慢、过度发挥)全砸在你脸上。社区里有的是实测之后切回老版本的案例。免费用户更省心:免费版默认已经是5.6 Luna,聊天不限次,一分钱不花,先用着,别急着为"写作升级"掏订阅费。

第二条路:用新模型,但换用法。两个动作。一是砍提示词:新模型理解力更强,越不需要你堆指令,给足事实、细节和例子,比堆形容词管用。二是直接立规矩:没有真实对照关系,不许写"不是X,而是Y";“真正”"恰恰"这类词控制频率。有知乎科普博主就是这么给自己配置写作规则的,平衡句的出现概率肉眼可见地降了。知乎

第三条路:按任务分工,别用一个模型打天下。小红书上有篇2.7万人收藏的帖子,讲的就是给AI分工:ChatGPT做结构和策略,DeepSeek做技术解读,Kimi做长文档总结,豆包写中文职场文档,文心一言起草国企政务风,Gemini管双语和图表,Perplexity负责查资料给引用。小红书具体结论可以商榷,思路值得抄:哪个模型写出来合你的胃口,就用哪个写文案,而不是谁名气大用谁。

顺便,盯住这三个信号

第一,看厂商会不会回头补C端写作。OpenAI这次专门为Chat模式优化Sol,算是个信号。有科技媒体的评论很扎心:所有模型都在打Coding,但我们好像忘了,很多人其实并没有生产力需求,他们可能只是想无聊时跟AI聊聊天。知乎如果"聊天和写作"成为下一个竞争点,受益的就是文案用户。

第二,看平台的容忍度。公众号已经开始收紧对AI写作的治理,36氪的判断是,放任AI内容肆意传播,等于毁灭微信建立起来的商业体系。36氪模型写得再好,平台限流、打标,流量端照样亏。

第三,看文案的Agent化。已经有用户在试,让ChatGPT一站式搞定发微博:构思、润色、打开微博、把内容直接填进发布框。微博当AI从"帮你写"走到"替你发",稀缺的就不再是写的速度,而是写什么、值不值得发的判断。

最后给一句总结:如果你觉得这一年"模型写文案变差了",请相信自己的体感。这不是错觉,多数情况下也不是你的提示词不行,而是模型把技能点加在了别处。应对办法也很消费主义——别盲目追新,按任务挑模型,把"去油"这件事,留给时间和厂商。

内容由AI生成

精选参考来源

1. 哪些话一出现,你就知道是 AI 写的?

2. AI的写作能力正在大幅退化

3. 看到各种ai文案只想冲进电脑里把发帖发视频的人狠狠揍一顿

4. 拿ai写文案的播客能不能都滚

5. 我竟然为了写个好的文案绞尽脑汁想了一小时才写出来,本来尝试用ai,但是总感觉不是自己的真实体验后会表达的内容,于是还是自己发挥,果然太久不书面表达,语言的运用都变匮乏了,仿佛像个文盲

6. Gemini 3.1 Pro写小说翻车了?实测对比3.0,告诉你越升级越难用的真相。

7. OpenAI 今天(6月26日)发布了新一代模型 GPT-5.6,包含三个版本:旗舰级 Sol、日常级 Terra 和经济级 Luna。但这条新闻最值得关注的地方不在模型本身,而在发布方式:应美国政府要求,GPT-5.6 目前只向大约 20 家经过政府审批的合作伙伴开放,普通开发者和 ChatGPT 用户暂时用不上。GPT-5.6 用了一套新的命名规则:数字代表代际,Sol、Terra、Luna 代表三个固定的能力档位,灵感来自太阳、地球、月亮。Sol 是最强的旗舰,Terra 性能接近上一代 GPT-5.5 但价格砍半,Luna 主打便宜快速。Sol 新增了两个模式:max 模式让模型花更长时间深度推理,ultra 模式则调用多个子 agent 并行处理复杂任务,相当于一个 AI 自己拆分工作给一组 AI 干活。在 OpenAI 公布的 Terminal-Bench 2.1(测试命令行工作流的编程基准)上,Sol Ultra 得分 91.9%,Sol 为 88.8%,Claude Mythos 5 为 88%,Google Gemini 3.1 Pro Preview 为 70.7%。网络安全方面,Sol 在 ExploitBench 上用大约三分之一的 token 就达到了 Mythos Preview 的水平。API 定价:Sol 每百万 token 输入 5 美元、输出 30 美元;Terra 分别是 2.5 和 15 美元;Luna 是 1 和 6 美元。7 月还会上线 Cerebras 硬件加速版本,推理速度可达每秒 750 个 token。OpenAI 这次花了大量篇幅讲安全。投入超过 70 万 A100 等效 GPU 小时做自动化红队测试,专门寻找能跨场景通用的越狱攻击。模型内置了拒绝机制,实时分类器会在生成过程中检测网络安全和生物领域的滥用行为,可疑输出会被暂停,交给一个更大的推理模型复审。按照 OpenAI 自己的准备框架评估,Sol 的网络安全能力被定级为“高”,但没有达到“关键”级别。它能找到浏览器漏洞和利用原语(exploit primitive,也就是构建攻击的基础组件),但在测试条件下无法自主完成完整的攻击链。OpenAI 把这解读为一个积极信号:模型更擅长帮防守方找洞和修补,而不是帮攻击方搞破坏。但这个判断是否经得起现实世界的检验,预览期就是用来回答这个问题的。如果你是 API 用户,短期内最实际的变化是:Terra 的性价比。性能接近 GPT-5.5,价格只有一半,对跑大量推理任务的团队来说值得关注。Luna 则适合对成本极度敏感的高吞吐场景。Sol 的 ultra 模式如果真能稳定运行,意味着复杂的多步骤任务可以甩给模型自己拆解、分配、汇总,开发者不用自己搭 agent 编排框架。这跟 Anthropic 在 Claude 上做的 agent 能力、Cursor 在 IDE 里做的 background agent,方向一致,都在抢占"AI 自己管理 AI"这个位置。但眼下,大多数人还用不上。OpenAI 说几周内会扩大开放,据 Axios 报道下周就会增加更多客户。ChatGPT 用户什么时候能用,还没有明确时间表。完整报告:网页链接

8. GPT-5.6 Luna 的价格降低 80%,GPT-5.6 Terra 的价格降低 20%,并在 API 中为 GPT-5.6 Sol 提供更快的选项。============

9. 刚刚,ChatGPT免费版史诗升级!GPT-5.6可以无限白嫖了

10. GPT-5.6 值得购买 Plus 或 Pro 吗?

11. 想问问大家,新上线的GPT-5.6用下来感觉怎么样?

12. GPT5.6又翻车了

13. 中国AI企业即将扎堆上市?两周涨 150 亿美元:Kimi K3 是怎么把月之暗面估值推上 500 亿的

14. Kimi K3在前端代码盲测中以1679分登顶全球第一,超越Claude Fable 5。一句提示词就能生成完整捕鱼游戏HTML文件,3D场景光影细节明显优于Opus 4.8。但默认开启Max思考导致响应慢,Token消耗极快,199元套餐扛不住高频使用。开源策略直接打穿闭源模型价格壁垒,资本市场当天就跌了。它在编程和视觉生成上封神,综合推理体验仍差口气。 #KimiK3测评#

15. 为什么 Codex 搭载 GPT-5.6 后,越来越多用户开始弃用 Skills?

16. 才知道不同的AI竟然有不同的分工

17. 微信公众号重拳出击,AI写作彻底要凉了

18. 刚刚真的被 ChatGPT 惊到了!我只说了一句:“我想发微博,你能不能一站式帮我搞定?”它不仅帮我构思和润色文案,还能打开微博、确认登录状态,并把内容直接填进发布框。整个过程就像身边多了一位随时待命的创作与执行助手。以前觉得 AI 只是回答问题,现在才发现,它正在把“我有一个想法”变成“事情已经准备好了”。这种从对话到行动的能力,真的很强大,也让我对未来充满期待。#ChatGPT##人工智能##AI改变生活#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章