这几天,千问的评论区有点分裂。
一边,是8月26日Qwen3.8-Flash-Next发布,技术圈在为"Qwen4架构提前看"欢呼。小红书另一边,知乎、小红书上到处是"千问是垃圾中的垃圾""曾经机灵好用的千问去哪了"这样的帖子。知乎小红书同一个App,两副完全相反的口碑。
先别急着站队。我把今年2月到8月知乎、小红书、微博上关于千问"降智"的吐槽样本翻了一遍,发现这事比"好用/不好用"有意思——吐槽是真的,但原因可能不是"模型变差了"。

先看大家在骂什么。整理下来,大致5类:
第一类,记忆丢失。最典型的是知乎用户的吐槽,问个问题只要3轮对话就忘,还一本正经编假数据给你。知乎还有反方向的,小红书有人吐槽千问开个新窗口还把之前的记忆带进来。小红书该记的不记,该忘的不忘,指向的都是同一个问题:会话记忆管理。
第二类,“不如从前”。有人翻出半年前的体验对比,说刚开始用的时候千问写的代码比DeepSeek还简洁,现在写出来的代码bug一堆。小红书还有人咬得很具体,说千问3.6降智90%,怀疑上下文窗口被压到4k以下,第一轮还好,第三轮就开始露馅。知乎注意,这些都是用户体验和推测,官方没有确认过。
第三类,指名版本骂。有人直接点名:qwen-max是怎么训练的,比以前的版本差远了,就知道吹跑分。小红书也有人一句"Qwen3.7之后全是毁掉的模型",把整条版本线都否了。这类吐槽的共同点是:用户能明确感觉到某次版本切换前后的差异。
第四类,拒答与误封。最离谱的是一例:有用户问千问养鸡技术,被系统判定聊敏感词,封号一周,“懒得申诉,直接卸载”。这类情况经常被当成"降智",其实是安全过滤的问题。
第五类,限速与功能缩水。早在3月就有用户声讨,千问的coding plan限速又降智。小红书也有人说,以前方便的功能现在都躲着走。再看8月23日的积分制改版:视频生成功能原本每天有10个免费额度。知乎有用户实测,现在做一个10秒视频要40积分,等于每天只能免费做一条。小红书生图也开始扣积分。很多"变难用"的体感,其实来自功能上锁,不是模型变笨。
但另一边的证据同样真实:
微博上有人感慨,还是通义千问有人情味儿。微博知乎的对比测评里也有人说,千问胜在综合均衡,职场办公、长文档梳理、PPT制作这些贯穿工作全流程的任务,稳定性格外突出。知乎8月28日还有一位前大厂AI产品经理,在小红书晒了用千问"工作助理"处理后台数据截图的实测。数据面更直接:6月豆包收费方案曝光后,单月流失了610万月活,同期竞品千问逆势涨了千万级用户。微博用户在用脚投票,至少在那个时间点,千问是"被选择"的一方。
如果真的一无是处,这个数据对不上。所以更可能的真相是:争议来自场景差异和时间差异。有人的场景塌了,有人的场景还稳着。
那"降智"的体感到底是怎么来的?跨源整理下来,至少5条机制,大部分和"模型权重变差"无关:
第一,模型悄悄换了。8月是千问密集换模型的月份:8月7日,千问App和PC端推出办公助理等多项新功能,同时支持最新旗舰模型Qwen3.8-MAX,所有用户免费使用。IT之家8月10日,千问APP迎来大改版,引入了多个"能办事"的AI智能体。知乎8月26日,Qwen3.8-Flash-Next的开源权重和技术报告发布。小红书你用的那个入口,背后的模型可能已经换过一轮。我整理的吐槽样本和版本节奏高度相关——指名某版本的骂声,集中出现在那次切换之后。免费档模型每次切换,都是一次体验洗牌:有人抽到升级,有人抽到降级。

第二,高负载下推理不稳。这里有个很典型的行业案例:智谱5月在官方博客里承认,GLM-5大规模上线后遭遇乱码、复读、罕见字符这类异常输出,本地复现数周无果,直到模拟在线高负载,才在每一万个请求里复现出3到5个异常。知乎也就是说,不是模型的问题,是推理链路的问题,只有模拟线上高负载才能抓到。OpenAI的GPT-5.5今年5月也被用户实锤质量不稳,有人吐槽200美元月费买了个薛定谔的脑子。知乎这不是说千问有一样的bug,而是说明一件事:当几千万人同时在用,"时灵时不灵"可能是服务端工程问题,不一定是模型本身变差。
第三,上下文限制。“3轮就忘"的吐槽几乎都发生在长对话里。比如有用户怀疑,千问的上下文窗口已经被压缩到4k以内了。知乎这类说法官方没有确认,但免费入口通常对上下文长度有限制,超了之后早期内容会被截断或压缩,表现出来就是"失忆”。这个现象在各种免费AI助手里都很常见。
第四,功能积分化。视频额度、生图积分、会员专属模型,这些是收费动作,但用户感知到的是"它变抠了"。有用户在记录帖里写得很直白:Wan3.0必须订阅会员才能用,千问的吃相未免太难看了。知乎这类"降智"和智力无关,纯粹是功能闸门。
第五,心理锚定。很多人的参照系是"半年前的千问"或者"同期的DeepSeek"。对标会放大差异:同样一份80分的回答,跟别人一比,就容易觉得只剩60分。
那作为个人用户,怎么判断自己的千问是不是真出了问题?给一套5步自测,10分钟够:
第一步,基线复测。拿出一个你之前"用着正常"的问题——常用的格式整理、固定风格的文案之类——开个新会话测,不要继承旧对话。如果一个月前没问题的题,现在明显塌了,那才是真变化,不是错觉。
第二步,确认当前版本。看看App或网页端有没有模型切换入口,有就把同一道题在不同模型上各测一遍。只有一个版本塌,是版本问题;全都塌,更可能是你的场景或提问方式问题。
第三步,控制上下文。用单轮短对话(2000字以内)测一次。单轮正常、多轮崩,那就是会话记忆的问题——解法是定期开新会话、关键信息重述,而不是换模型。
第四步,交叉对比。同一道题发给DeepSeek和豆包。如果千问只在特定场景输(写代码输给DeepSeek、闲聊输给豆包),那是场景差距,不是降智;全面输,才真的该考虑迁移。
第五步,留证反馈。把时间、输入、输出截图,走应用内渠道反馈。别小看这一步——智谱那个本地复现不出来的异常,最后就是靠本地回放用户反馈、把相同请求重复运行数百次才定位到的。知乎用户上报,几乎是官方定位推理端问题的唯一线索。
最后,给三类人的决策建议:
如果你是轻度用户(聊天、作业辅导、偶尔整理文档):别付费。千问的基础对话和办公助理主力功能,即便不开通付费会员,普通用户也可使用。IT之家偶尔遇到翻车,一题多平台发,成本是零。
如果你是办公重度用户(PPT、长文档、日常写代码):先自测,再决定。自测结论是"某个版本的问题",就等Qwen3.8系列全面铺开再评估——8月是切换期,体验波动是正常的。自测结论是"这个场景全面塌",先试DeepSeek、Kimi的免费档,确认替代不行再谈付费。目前办公助理三档会员分别是19元、49元、128元一个月,视频生成单独充值,10个额度26元起。知乎这些钱解决的是额度问题,不是智力问题。
如果你是视频/生图用户:直说,这和降智无关,纯粹是收费问题。只是偶尔做视频,别充积分,先看同类产品的免费额度。这笔账我们之前算过,结论没变:低频生成不要付费。

接下来,有几个信号值得盯:
一,千问官方会不会回应"降智"争议。智谱开了官方自曝的先例,千问如果跟进,争议的风向会完全改变。二,Qwen3.8系列铺到免费入口的节奏——版本切换是体验波动最大的变量,也是挽回口碑最大的机会。三,积分争议的走向:从8月23日砍额度开始,用户的记录和吐槽就没停过,连"穷人套餐"都被吐槽涨了价,原本一天还能免费做五条10秒视频,现在只剩一条。小红书如果官方给出补偿或安抚方案,现在的舆情能挽回一截。
一句话收尾:千问的吐槽是真的,但"降智"是症状,不是诊断。卸载或者付费之前,先花10分钟把上面的自测跑一遍。让证据说话,别让评论区说话。