这两天,同一家公司的两条消息先后砸进AI编程圈。先是好消息:Cursor悄悄上线了智谱的GLM-5.3和GLM-5.3-Flash,模型在CursorBench 4.0上拿下42.6%,是开放权重模型里的最高分。微博上#智谱GLM5.3海外走红#的话题也跟着起来了,剧情是标准的出海三连:先是匿名盲测代号Ox-Alpha冲上海外模型平台榜首,后来揭晓是GLM-5.3-Flash;然后有德国AI公司训练自家模型,也选用GLM产出数据。微博微博
第二条是市场面的注脚:9月底OpenRouter的周token榜单上,GLM-5.3-Flash以16.3万亿token稳居第二名,整个中国模型阵营把平台周token处理量顶到了62.22万亿,是美国模型的4倍还多。资本市场也跟着用脚投票,10月5日智谱港股股价持续上涨,涨幅一度逼近7%,截至收盘,回落至6.15%。微博微博

但把时间往回拨半个月,同一家公司正在经历成立以来最大的信任危机。9月18日,技术博主ferstar爆料:智谱自家编程工具ZCode的桌面客户端,会在登录状态下把整个工作区打包加密上传到阿里云OSS,默认开启、没有关闭入口,加密私钥只保存在云端。被传走的不只是源码,逆向分析显示打包内容还包括完整的Git版本历史、LFS大文件缓存、reflog记录以及部分全局开发配置文件,几乎覆盖了项目的全部核心研发资产。9月21日,太原承明科技正式发函追责,称上传内容里包含数据库访问口令、云服务权限凭证和员工个人信息,列出12项书面答复要求,保留索赔与诉讼权利。智谱三天内道了歉、推了v3.14.0修复、请信通院和绿盟科技做了首轮核查,承诺开源ZCode、每月公布安全审计报告。36氪

所以此刻最纠结的一群人很具体:正被Cursor/Claude订阅限额挤得难受、看到GLM-5.3走红心动想切的付费用户。模型是真的强、真的便宜,但这家公司的客户端两周前刚被实锤偷传代码。到底换不换?这事得拆成三笔账算,不能靠情绪站队。
第一笔账:成本——你的20美元,已经不是20美元了
想切GLM的人多半是被订阅制逼的,这边刚好有个实锤:10月4日StartupFortune的行业分析捅破了窗户纸——Cursor的20美元Pro计划被一小撮重度用户干到亏本,他们一个月烧掉的API成本,远超交的那20美元。对应的动作就是规则收紧:20美元只给你20美元的额度,用完要么切免费的自动模式,要么按API原价交超量费。根源很简单:Opus级模型的token单价约是Haiku级的25倍,你拿旗舰模型当免费劳动力使,额度几天就见底。dev.to在10月3日的价格解析里算过,Pro用户要是让agent从早跑到晚,月账单能从20美元涨到40至80美元;Hacker News上更有人晒出一周350美元的超量账单。知乎
那GLM有多便宜?智谱官网定价页给了个直观的对比:GLM-5.3输入8元、输出28元(每百万token),GLM-5.3-Flash只要0.8元和2.8元,上下文都是1M,官方口径是Flash部分能力对齐Claude Opus 4.8、价格只有对方的1/40。海外社区流传的一个帖子给了实测样本:开源CMS Wagtail的核心开发者给自己立了规矩,九月一整月日常开发只用GLM-5.3-Flash。挑战本身失败了——20亿token烧完只有一半给了目标模型,剩下一半是团队跑各家基准测试忍不住试新模型——但账单很说明问题:认认真真用Flash干了半个月活,只花68美元,四度电,三百六十五克碳排放。评论区一堆海外开发者在晒组合:GLM写方案、Flash干活、DeepSeek做备用,有人说靠智谱加通义这两家,已经把美国那两家大厂的订阅停了。知乎

但同一个帖子里藏着最重要的一条反例:这位老兄挂了个AI智能体跑原型,模式选错没留意,一觉醒来烧掉四亿五千万token,一百五十美元,五度电——比认真干活半个月的68美元还贵一倍多。所以成本这笔账的结论不是"GLM便宜",而是:模型单价降一个数量级之后,账单的瓶颈从"用什么模型"变成"有没有人盯着自动化"。切之前先把用量统计和支出上限配好,不然省下的订阅费会以另一种方式还回去。知乎
第二笔账:能力——42.6%的成色,和"输的不是模型"
CursorBench 4.0开放权重第一、Ox-Alpha盲测登顶,这些成绩成色如何?有个意想不到的背书来源:Anthropic前沿红队9月29日的评估报告。报告本意是拉响安全警报,但数据顺手证明了能力——GLM-5.3在ExploitBench上打Chrome V8引擎里已知的漏洞,410次尝试成功50次,而Anthropic自家五个月前因为攻击能力太强、只敢给审核过的防守方用的Claude Mythos Preview,是56次。NIST下属CAISI的定性更直接:这是迄今发布的最具网络攻击能力的开放权重模型,落后美国前沿大约四个月。36氪有篇文章的标题说得损但准:《Anthropic,你是来给智谱打广告的吧》。知乎36氪
日常编程侧的数据也能对上:在Z.ai自家的Code Bench上,GLM-5.3拉满努力档的任务准确率约34.5%,还没追上Claude Fable 5的39.4%,但输出token只花了约7.4万,比对方的11.4万少了三成多。而那位Wagtail开发者烧完20亿token后翻遍失败清单,找不到一条"模型不行"——界面调整、文档写作、测试评估什么都干了一圈,评价是"非常好"。

但两个真实短板也别装看不见。一是高峰期算力顶不住——恰恰因为性价比曲线上的位置太好、用的人太多,那位开发者不得不临时切到DeepSeek和通义的同级模型救急。二是它擅长的是"给定明确目标后高速产出",目标本身对不对、边界条件全不全,还是得人管。用那篇知乎文章的标题说:只用GLM一个月,输的不是模型。知乎
第三笔账:信任——ZCode道过歉了,但你要分清三件事
第一件:在Cursor里用GLM-5.3,和装智谱自家客户端,不是一回事。Cursor接入GLM走的是标准API调用,你的代码上下文由Cursor发给智谱的推理接口;ZCode风波的问题出在客户端本地行为——整仓库打包上传、默认开启、私钥不在你手里,两者风险边界完全不同。当然,"API收到的数据留不留存"依然是个问题,智谱为此掏出了"数据不留存、用完即焚"的承诺和一版叫Trust.patch的整改:快照上传链路移除、涉事云端数据删除、“你不发起,不上云”、客户端开源同步,外加付费用户重置卡补偿和全体用户token赠送期。中国信通院和绿盟科技的首轮核查结论是:涉事OSS存储桶当前云端零数据,全部数据对象及存储桶本身已删除,v3.14.0已移除RepoWiki入口及相应生成链路。这个结论你可以采信到什么程度,取决于你愿不愿意等它承诺的"每月定期安全审计报告"真正兑现第一期。36氪

第二件:开放权重的"强"和"险"是同一枚硬币。Anthropic报告里最值得普通人记住的数字是:GLM-5.3开箱状态下直接让它帮忙策划网络攻击,服从率0%;给它编个"自主红队智能体"的身份,64%;预填它的推理过程让它看起来已经答应,92%;用abliteration把权重里的拒绝方向抹掉,100%——抹完之后,标准有害请求基准上的拒绝率从90%以上掉到2%,能力几乎无损。Anthropic自己第一次做花了大约2200 GPU小时,折合4400美元,熟练团队只要600 GPU小时、1200美元。同样这四招用在Claude身上,四个条件都是0%——差别就在权重在谁手里。如果你盘算的是"下载权重本地跑",记住一句话:模型的安全对齐是减震器,不是刹车,能执行命令、能碰生产环境、能出公网的工具权限,别给它。知乎
第三件:别把股市反弹当技术信号。9月21日风波正盛时,智谱港股低开低走、单日跌超4%,本周又靠Cursor接入的消息收复失地,中间还垫着一篇《三个月,智谱跌没1万亿》。股价的三个月曲线,和"你的代码交给它安不安全"是两个独立问题,前者不构成后者的证据。36氪

到底换不换:分人群说
个人开发者、副业项目用户:现在就可以试。便宜是实锤——半个月68美元的干活账单,对上一周350美元的超量费;能力有Anthropic报告反向背书;在Cursor里切换成本几乎为零。两条安全线:先在非敏感项目上跑两周再决定要不要迁主力;用量统计常开、给自动化任务设支出上限,那个150美元的通宵,恰恰发生在便宜模型上。
企业用户、生产代码:别急着迁,等两样东西。一是智谱承诺的每月安全审计报告第一期是否如期公布、内容是否有实质;二是承明科技那12项函件要求——数据销毁证明、私钥保管、是否跨境传输——有没有公开回音。在合同层面拿到数据留存和销毁条款之前,"用完即焚"只是公关语言。过渡期如果真想用GLM的能力,走Cursor或OpenRouter这类第三方API通道,比装原厂客户端多一层隔离。36氪
想本地部署开放权重的人:能力最强的那款,恰好也是被研究得最透的那款。CAISI的定性摆在那里,abliteration的成本已经降到1200美元,报告发布几天内网上就出现了抹掉拒绝的改版。本地跑可以,但工具权限的边界按上面说的管住——这不是GLM特有的问题,是所有开放权重模型的共同前提。
纯订阅党(Claude Pro/Cursor Pro还在正常用):不用切,但该把"额度+超量"当成趋势理解。订阅制死于agent,不是谁黑心,是账算不过来;以后你用的每个agent工具,都会长成"额度+超量"的样子。Replit已经走了同一条路,国内还在烧钱补贴的工具迟早跟上。今天GLM-5.3是你的备胎选项,明天可能是所有人的默认选项——提前学会给AI用量做预算,比纠结切不切更保值。知乎
接下来值得盯的信号:智谱首期月度审计报告是否兑现;CursorBench榜单上GLM-5.3的分数能不能站住,还是会被Gemini 4和Opus的新版本挤下去;高峰期Flash的响应速度有没有随供应商扩容改善;以及Ox-Alpha盲测这类"先匿名后揭晓"的营销玩法,下次还能不能骗到真实口碑。
一句话收尾:这周的GLM-5.3,像极了性价比极高、但刚出过一次品控事故的新供应商——产品本身可以买,第一单别押上全部身家,合同条款看清楚了,再签长约。