换GLM-5.3之前,先看这份避坑报告:上下文被偷偷砍、token烧钱、免费渠道有坑

源自13位全网作者

05:10

这周国产大模型的动静不小。8月14日,智谱正式发布GLM-5.3。知乎紧接着这个周一,DeepSeek的新价格机制生效,最新旗舰模型DeepSeek-V4-Pro高峰时段百万token输出价格从6元涨至27元。微博一边刚登顶开源,一边直接贵了4.5倍,自然有一大批用户周末转向了GLM-5.3。

换GLM-5.3之前,先看这份避坑报告:上下文被偷偷砍、token烧钱、免费渠道有坑

如果你正打算切换,或者已经切过去了,建议先看完这三个坑再动手。

一、跑分很漂亮,但要知道它是怎么来的

先说亮眼的地方:GLM-5.3沿用与GLM-5.2完全相同的743B参数基座,一个参数都没加,全靠极致后训练Scaling实现提升。哔哩哔哩在Terminal-Bench 3.0上,它从4.6分跃至28.3分,拿下开源第一。知乎DeepSWE v1.1拿到66.9分,超过了DeepSeek V4 Pro正式版的62.7分。知乎CyberGym漏洞发现任务上以84.5%登顶全球,官方口径的编程体感较5.2提升50%。

换GLM-5.3之前,先看这份避坑报告:上下文被偷偷砍、token烧钱、免费渠道有坑

但跑分要看语境。公开技术分析提到,GLM-5.3这轮后训练采用AI给AI出题的环境合成流水线,智谱引入了一个全自动的环境生成机制。知乎训练任务和Agent、终端类评测任务同源程度越高,分数涨得自然越猛。这不是说它造假,而是把跑分提升一比一映射到你自己的任务上,大概率会失望。

实测圈的口碑也很分裂。有人用6万token的输出完整复刻了马里奥。哔哩哔哩也有国外博主实测发现,跑分直逼顶级闭源,写游戏却频频翻车。哔哩哔哩小红书上还有用户说,我用ChatGPT5.6sol、DeepSeek v4flash都没解决的问题,我用GLM5.3修好了!小红书同一个模型,不同任务能得出相反结论,这正是跑分不能替代你自己活儿的原因。

说白了:你的活儿如果是终端操作、Agent长任务、代码审查,这轮提升大概率是真的,值得切;如果是前端审美、游戏创作这类发散任务,先拿自己的项目跑一遍再下结论。

二、最隐蔽的坑:你的1M上下文可能被当成200K在用

这个坑是一位做模型网关的开发者第一时间踩出来并曝光的。GLM-5.3的官方上下文窗口是1M token,但在Claude Code里接入第三方模型ID时,CC会弹出一行不认识该模型名的警告,然后保守假设上下文只有200K,并按这个数字触发auto-compact。知乎相当于1M的窗口白白浪费五分之四。

而且这事很难察觉:它不报错,只是提前压缩,你只会隐约觉得这个模型怎么老忘事、聊两轮就压缩,然后怪到模型能力头上。

解决办法就写在那行警告里:把模型ID改成claude-glm-5.3[1m]这种形式,CC就会按1M窗口来管理压缩。知乎注意两点:这个后缀是纯客户端侧的标记,需要网关层把它吃掉,上游只能收到干净的glm-5.3,否则会直接报400;另外只给确认是1M窗口的模型加,GLM-5.2/5.3、Kimi K3、DeepSeek V4-Pro这几家的1M窗口是核实过的,别自己猜。这个问题在GitHub上已经有相关讨论,它对所有在Claude Code里用第三方模型的人都适用,不只是GLM用户。

三、免费渠道鱼龙混杂,免费不一定省钱

涨价之后,很多人的第一反应是找免费渠道。截至发稿,社区反馈确实有能用的:Qoder这个软件模型最全,已经包括GLM-5.3。知乎灵犀等平台也已上线,靠新人福利或限时免费额度可以先体验(福利规则随时可能变化)。

换GLM-5.3之前,先看这份避坑报告:上下文被偷偷砍、token烧钱、免费渠道有坑

智谱官方编程工具ZCode此前还做过周末活动,新注册用户首次登录即可免费领1亿tokens。哔哩哔哩这轮福利已经结束,后续官方活动值得蹲一蹲。有两类便宜千万别占:一是二手平台和社区里已经出现的GLM账号转让、套餐换绑,套餐绑定实名,换绑风险极高,随时可能被找回;二是来历不明的公益中转站,你的API key和对话内容都可能被别人看得一清二楚。

还有一个容易被忽视的隐性成本:GLM-5.3默认会吐thinking,5.2则不吐。知乎叠加长任务之后,token消耗相当可观,有实测在生成3D场景时消耗爆炸。哔哩哔哩如果你是按token付费的API用户,先看看自己任务的消耗,再决定要不要把thinking档位调低。

换GLM-5.3之前,先看这份避坑报告:上下文被偷偷砍、token烧钱、免费渠道有坑

最后还有一条硬限制:GLM-5.3是纯文本输入输出,没有视觉能力,有实测用户直言最大缺陷是多模态缺失。小红书需要图片理解的用户,这个版本不适合你。

四、那么,现在谁适合切换?

坑讲完了,给几个简单的判断标准:

  • 建议切换:终端/Agent/代码审查类工作流的用户,尤其是原本用DeepSeek、受这次涨价影响的;Claude Code用户(修好[1m]之后,1M窗口是实打实的)。

  • 建议等等:等权重本地部署的用户,智谱承诺发布两周后开放模型权重。知乎届时第三方复测数据也会更完整;需要多模态能力的用户。

  • 值得关注:权重开放后的第三方复测潮;阿里Qwen3.8系列已开源Qwen3.8-27B视觉多模态旗舰,正式版也在路上。哔哩哔哩还有智谱的API定价,从2月开始连续三次提价,一季度累计涨幅约83%。知乎这次5.3发布没有跟涨,摩根大通因此上调智谱目标价。微博但别把它理解成以后不涨。

跑分决定热度,实测决定好用。切哪家模型之前,先拿自己的活儿跑一遍,比任何推荐都靠谱。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章