GLM-5.3 API开放第3天:编程提升50%价格不变是真的,账单膨胀35倍的坑也是真的

源自239位全网作者

11:00

GLM-5.3的API开放第3天。如果你正在犹豫要不要把编程任务迁过来,或者已经领了key准备上手,这篇值得花三分钟。

这两天社区实测的结论比较一致:能力是真的,价格不变也是真的,但API里藏着一个大多数人不会去传的参数,它恰好能让你的账单膨胀35倍。

能力什么水平,一段说完

GLM-5.3在AA综合智能指数里拿到60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰处于同一水平,并与Kimi K3并列开源模型第一。网易而且它没换底座:和GLM-5.2同款约743B参数MoE,每次推理只激活约40B,提升全部来自更长周期的后训练强化学习,官方口径编码能力比上代提升50%。微博

GLM-5.3 API开放第3天:编程提升50%价格不变是真的,账单膨胀35倍的坑也是真的

不换底座也能涨分,路线押在后训练上:智谱自研Code Bench上,GLM-5.3在Max effort下以每任务约75K输出tokens做到34.5%的通过率,上一代GLM-5.2是96K tokens只有23.4%,token效率同步改善。知乎

社区上手反馈也大体吻合:限流和断连基本只在发布头两天出现过,bug修复能力被反复点名。小红书当然也有实测翻车的声音,后面冷静部分再聊。

坑一:推理恒开,默认还是max档

这是最大的坑。GLM-5.3只支持thinking.type: "enabled",reasoning_effort支持low、high、max三档,默认是max。知乎看一组开发者实测数据:短分类任务上,low档输出中位数3个token,max档105个,而两档给出的答案是同一个单词,跑18次三档全对。折算成钱:同样100万次分类调用,low是84.60美元,max是533.40美元,模型一样、prompt一样、答案一样,差别就是一个字符串。知乎

high档是最容易被跳过、但大概不该被跳过的一档:它比low贵26%,代码任务上中位延迟反而更短,8.6秒对11.6秒;只有max是断崖,代码任务要花5.5倍的墙钟时间。知乎我的档位建议按任务来:

  • 分类、抽取、格式转换这类交互轻任务,选low

  • 日常写码、小功能开发,选high

  • 复杂重构、跨文件agent任务、安全审计,再上max

另外别手滑传medium或none,这两样在别家模型上是常规写法,在这里直接400报错,别去排查一个你根本没设过的thinking参数。重试封装、评测harness、任何帮你拼请求体的框架,都要显式带上这个参数——少写一处,不是少了个功能,是一张max档的账单。

坑二:迁移之前查三件事

第一,base URL有点乱:模型页写的官方地址是open.bigmodel.cn/api/paas/v4/,同一页往下的Quick Start示例,请求打的却是api.z.ai,一个页面两个答案,发布当天预告的又是另一个版本。知乎发布24小时内写的教程,引用的几乎都不是最终落地的地址,遇到404先换另一个试,别急着查key。

第二,订阅历史会影响协议:如果你之前订阅过GLM Coding Plan,包括已经过期的订阅,目前模型API只能通过OpenAI Chat Completion兼容协议访问。知乎Responses、Anthropic协议在这类账号上会直接失败,定接入方案前先查账号。

第三,迁移顺序:先改effort参数,再换模型ID。带着thinking.type: "disabled"的请求,会在换模型ID的瞬间失败。

价格和渠道:存在两个口径,以你用的渠道为准

Z.ai定价表和OpenRouter挂牌都是输入1.40美元、输出4.40美元每百万token,与GLM-5.2同价。知乎

GLM-5.3 API开放第3天:编程提升50%价格不变是真的,账单膨胀35倍的坑也是真的

官方也在主推成本这张牌:同等智能下,其单任务成本为前沿旗舰模型中最低。网易缓存输入0.26美元,只有冷读价的19%,促销期存储费还免费,一段重复使用的system prompt基本是白捡的便宜。知乎还有个细节值得留意:Artificial Analysis周报(8月19日口径)给GLM-5.3标的是输入0.68美元、输出1.88美元,和官方价表对不上。知乎不用纠结这个出入,原则只有一条:算成本以你实际调用渠道的价表为准,别拿第三方榜单的数字直接做预算。

重度用户可以看看Coding Plan的新规则:改成积分制配额,低峰时段消耗50%标准积分,周末全天也算低峰。知乎有社区成员统计了新Pro套餐的账:叠加ZCode目前额外50%额度的活动,周均消耗约10亿token,大约相当于旧版Max的80%,选季包或年包折算下来每亿token成本约10元。小红书

尤其是DeepSeek涨价后,第一梯队里GLM反而显得性价比更突出了。小红书批量生成、自动化测试修复、异步agent这类能调度的活儿,尽量丢到低峰时段跑。

冷静部分:60分不等于全能

  • 实测翻车的案例存在,企业级项目里,大规模代码迁移、框架升级这种长链路任务,GLM也能做,但需要更多人工确认和纠偏,它的真正强项在中文注释理解、国产生态适配和价格。知乎

  • max档的方差很宽:同一实测里,单词类答案47到160个token,代码任务2807到10596个token,拿它定预算之前,先跑一遍你自己的prompt。知乎

  • 模型之间讲分工:长文档精读K3更合适,大批量低价跑量是DeepSeek V4 Pro的地盘,它的输入价只要0.05美元每百万token,混合调用通常比单一模型更省钱。知乎

已经有人用统一任务、统一提示词、统一评分标准,把前端、3D、网站、游戏开发四类场景完整跑过一遍。网易榜单测的是上限,项目里拼的是匹配度。

GLM-5.3 API开放第3天:编程提升50%价格不变是真的,账单膨胀35倍的坑也是真的

行动清单

  1. 查请求体:显式传reasoning_effort,按任务档位映射;

  2. 查账号:是否订阅过Coding Plan,决定走哪种协议;

  3. 查地址:以官方文档最新的base URL为准;

  4. 先小流量跑一周算账,核对usage里的reasoning_tokens和缓存字段,再放量;

  5. 值得盯的信号:官方已确认模型权重下周五开源,届时本地部署的账会重新算。网易另外可以留意DeepSeek V5的动静,以及国产编程模型的价格战节奏。

一句话:这个模型值得试,但记住,贵的不是模型,是默认配置。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章