先说清楚这篇是写给谁的:每个月花 100–300 块、手里捏着 GLM 编程套餐加一两个对家订阅、日常在 OpenCode/ZCode 这类工具里自己接模型的中度用户。GLM-5.3、Flash、FlashX 是什么,ZCode 风波怎么道歉补偿的,你大概率比我熟——这些一个字不重复。今天只算一件事:10 月这张订阅单,怎么配才对得起你烧的 token。
一、本周真正改变决策的两个变量
变量一:今早 OpenAI DevDay 发了 GPT-6.1-Sol。 官方 API 定价上,旗舰 Astra 输入输出每百万 token 各 10 和 50 美元,Sol 直接砍到 2 和 10,同样的钱能跑五倍的量。它只比上一代 Sol 多活了 7 天就完成换代,Intelligence Index 得分比 Astra 低 1 分、每任务成本不到四分之一。同场发布的还有 24 小时后台干活的智能体 Dots、协作产品 Space 和 Pages,以及每月 500 美元的 Pro500 档位。微博微博微博
变量二:智谱的免费窗口进入最后倒计时。 按补偿方案,9 月 28 日至 10 月 7 日面向全体用户连续每日发放十万份 1 亿 GLM-5.3-Flash Token。付费用户则到账 8 张额度重置卡,9 月 28 日 10 时 30 分生效。但已有用户实测吐槽:一亿 Token 到次日凌晨就清零了,还频繁遇到"当前系统繁忙,请切换模型"的提示。也就是说,"10 月 7 日结束"不是给你一个月白嫖期,是每天一张当日作废的票。微博微博微博
顺带三个背景变量:9 月 18 日智谱上线 GLM-5.3-FlashX,最高 200 tokens/s,轻量模型竞争升维。唐杰口径里,GLM-5.3 两周内把国产卡推理吞吐调高 3.2 倍,这才是 Flash 低价能撑住的底座。而 9 月 10 日发布的 DeepSeek V4.1 Flash,已被第三方 Agent 平台标出 0.03x 的消耗倍率,是除免费模型之外最便宜的一档。知乎知乎知乎
二、同一件事,三张实测账单互相打架
我把 B 站、知乎、小红书本周的交叉实测扒了一遍,结论先给:没有一份实测能替你定选择,但它们互相矛盾的地方,恰好暴露了真成本在哪。
实测来源 | 样本/热度 | 纸面结论 | 评论区的反证 |
|---|---|---|---|
B 站"经济适用鹈鹕对比"(9-23):满血 Luna、Sol、DS4.1Flash、GLM-5.3 | 1 万播放、79 条评论 | DS4.1F 图形测试强于 Luna | 同一评论区内:“实际跑任务 Luna 比 DS 好,DS 雷霆大思考”“Luna max 基本动不了”“Sol 跑自动化反复卡住” |
知乎 WorkBuddy 五题实测(9-17):GLM-5.3-Flash vs DS4.1Flash | 5 个真实任务 | Coding 综合 GLM-5.3-Flash 领先,前端网页 DS 又快又省 | 关键成本细节:GLM-Flash 中途触发调用上限,切 GLM-5.3 旗舰接力,额外花 98 积分、约 Flash 的 5 倍;DS 一题 34 分钟 18.5 积分 |
B 站"四模型账单测试"(9-28):M3.1F/DS4.1/GLM5.3F/GPT6-Luna | 361 播放,小样本 | MiniMax M3.1F 略胜 | 热度太低,不足以做选购依据,仅留档 |
另有一条 567 赞、268 收藏的性价比排行笔记值得留档:作者发现 OpenCode Go 悄悄把 GLM-5.3-Flash 调进了 60 美元档位,“所以突然变得又稍微划算了一点点”。小红书
三、替你筛掉的三个噪音:月付党最容易算错的三笔账
第一笔:拿 API 价对比包月价。 今早各群里刷屏的"$2 输入、五分之一"是 API 口径,不是订阅体验价。Codex 那头的量价关系,评论区已经有人算过:跑一次效果好的鹈鹕自行车要烧 30M token,有人按五小时窗口的口径对账"30m 得把五小时额度用光吧,我就用了五小时 2% 左右"。自助餐吃回本靠频次,点菜省钱靠控制量,两套账根本不能直接横比。哔哩哔哩
第二笔:把"免费 1 亿"当成一个月粮。 有用户领完之后直接开帖:你在逗我么?24小时过期?按前面那笔 30M token 的单价账,1 亿额度看着多,真要在限流提示下把它烧完并不轻松。正确姿势是把 10 月 7 日前的每天当成一次压力测试:用当天额度跑你自己的真实任务,烧不烧得完、在哪断、限不限流,账本直接告诉你 10 月该续哪家。小红书
第三笔:把鹈鹕当工作能力。 第二节的表已经演示过了:鹈鹕测试排名和真实长任务体验可以完全相反,同一评论区的原话是"ds 鹈鹕测试比 luna 强很多,但是实际跑任务感觉 luna 比 ds 好"。真正会咬你账单的不是模型智力,是上限、截断、接力——WorkBuddy 实测里,GLM-5.3-Flash 在中途触发调用上限,切旗舰接力后"额外花了 98 积分,接近 Flash 的 5 倍了"。你的活儿是"多次短调用"还是"一次长任务",比任何榜单排名都重要。哔哩哔哩知乎
四、10 月怎么配:按人群给三条路
A. 只养一个主力、纯写代码:GLM 编程套餐继续,别升级 max。 白天用 Flash 中档跑日常,夜里还有 CodingPlan 用户的"夜场"窗口——晚上十一点到第二天九点可以使用 GLM-5.3-Flash。10/7 前把每天的 1 亿额度当压力测,测完再决定 10 月档期。适用:单人全栈、任务短平快。不适用:一次要跑很长输出、或者最怕中途换模型接力的人——上限触发的那一笔账第三节算过了。知乎
B. 月预算 200 上下、组合党:短任务主力 + 长任务外协。 有用户晒出自己的盘子就是 4 个模型、一个月 200 块怎么搭配,评论区里非研发岗的实测是纯文本类工作只用 DeepSeek、一个月 150–300 块。如果主要写前端,DeepSeek V4.1 Flash “又快又好”、消耗倍率又全场最低;如果综合 Coding,“GLM-5.3-Flash 仍旧领先”。风险照旧:社区价目和倍率变化极快,一切以当天订单页为准。小红书知乎
C. 追新党:先 API 试水,别急着上车 Pro500。 6.1 Sol 的官方定位确实是"旗舰 Astra 用来攻坚最难任务,而日常开发、批量智能体调用交给 Sol"的甜品档,纸面很香。但它的前代才活了 7 天,而且订阅资格本身还在晃——同一批鹈鹕视频底下就有人问"为啥我的 plus 官方账号的 codex 里边没有 gpt6 的 Luna 和 sol 啊"。先用 $2/$10 的 API 跑一周你自己的活儿,等出现第二批晒完整账单的实测再谈月付。微博哔哩哔哩
五、值得继续盯的三个信号
GLM-6.0 的"完全自训练"路线:唐杰在 8 月 31 日半年度业绩发布会上把 GLM-6.0 定义为 Full Self-Training,9 月 13 日公司又完成约 50 亿美元融资。如果 6.0 年内发布,现在这批"5.x 档期"的套餐定价大概率重洗,重订长约的人把周期想短一点。微博
ZCode 整改进度:官方口径是 ZCode 将开源并接受第三方审计,敏感仓库用户在做去留决定前,先等这项落地核验。36氪
Sol vs GLM-5.3-F 的第二批实测:今早发完,明后两天各平台一定会出新一批对比。看的时候只挑一样东西——有没有晒完整长任务账单,晒鹈鹕的不算数。
最后交代证据边界:本文实测全部来自单个 UP 主、单组任务,样本量小、且价目与倍率一周内多次变动,它们提供的是"成本会藏在哪"的方向,不是结论。你的那笔账,用第四节的方法自己测,三天就能出来。