Grok 4.6“1/3价格追平Sol”不能全信:实测任务成本只省32%,Cursor用户的双倍额度周该怎么用

源自7位全网作者

12:57

这两天应该是 AI 编程圈入夏以来最热闹的 48 小时:8 月 12 日 xAI 发布 Grok 4.6,隔了不到一天,DeepSeek 也把 V4 Pro 正式版推上了 API。今早一刷手机,满屏基本就两类标题:“跑分登顶"和"1/3 价格追平 Sol”。

偏偏 Cursor 还给上了首周双倍额度。这时间点卡得太巧了。

于是不少人来问同一个问题:主力模型要不要换?双倍额度要不要赶紧薅?

我把过去 24 小时的官方发布、第三方评测、社区复现和各站实测视频都翻了一遍。先说结论:Grok 4.6 值得一试,但宣传话术要打折扣,双倍额度这周更适合当 A/B 测试窗口,别直接换主力。

先分清哪些数字是真的,哪些是营销话术。

可以直接信的部分:Artificial Analysis 智能指数 61 分,与 GPT-5.6 Sol Max 持平、比 Claude Fable 5 低 1 分。知乎GDPval-AA v2 拿 1753 Elo,官方表里压过 Sol Max(1728)和 Fable 5 Max(1741),Artificial Analysis 全榜也稳居第二、仅次于 Claude Opus 5 (max)(上一代只有 1526,提升幅度不小)。36氪价格输入 $2/百万 token、输出 $6/百万,上下文 500K。渠道也铺全了:Cursor、Grok Build、OpenRouter、API 同步接入。知乎Cursor 付费用户首周额度翻倍(Ultra 和 Premium Teams 档优先)。

Grok 4.6“1/3价格追平Sol”不能全信:实测任务成本只省32%,Cursor用户的双倍额度周该怎么用

要打折扣的部分有三条。

第一,"等效 Sol 5.6"出自 xAI 自家基准,测试集没公开。知乎上有人直接开怼:翻遍全网找不到测试题、找不到评分脚本,甚至不知道它具体测了什么。知乎社区有 IT 人不信邪自己做了复现实验,在中立基准 MATH 上,Grok 4.6 拿 81.3 分,Sol 5.6 同项是 94.1,差了一个身位还多,而 xAI 官方至今没回应这个差距。注意,这是社区复现数据,不是官方口径,但"自己出题自己判卷、测试集不公开"这件事本身,就足够让"等效"两个字打折了。

第二,"1/3 价格"是单价故事。看牌面单价,Grok 4.6 输入比 Sol 低 60%、输出低 80%,夸张得不像话。但有做模型网关的开发者按同一套评测负载算了任务账:Grok 4.6 每任务约 $0.84,Sol 约 $1.23,实际只省 32% 左右。36氪而且这一代的缓存输入价从 4.5 时代的 $0.30 悄悄涨到了 $0.50,对重缓存的长 Agent 场景,这是笔隐形开销。

Grok 4.6“1/3价格追平Sol”不能全信:实测任务成本只省32%,Cursor用户的双倍额度周该怎么用

第三,最出圈的那张跑分背后有关联方。Grok 4.6 在 CursorBench 上和 Fable 5 打得难分难解(Extra High 档 70.8% 对 70.5%),单任务成本 $2.81 对 $17.32,后者看着是真香。知乎但 CursorBench 的运营方是 Cursor,而 SpaceX 在 6 月 16 日已经和 Cursor 母公司 Anysphere 签了合并协议,隐含估值 600 亿美元,目前还在等监管批准。这层关系不能证明榜单造假,但交叉验证是必须的。

再看 Grok 4.6 强在哪、不强在哪。

按 xAI 自己给的分项:知识工作、CursorBench、法律任务上比 Sol 强;DeepSWE(代码仓库修复)65.9%,比 Sol Max 低 7 个百分点,终端类任务也是 Sol 占优。36氪官方主推方向是"长程 Agent",新增了 xhigh 推理档位,训练也往长流程任务倾斜,官方案例里模型出现了更多"先自查再继续"的行为。知乎

Grok 4.6“1/3价格追平Sol”不能全信:实测任务成本只省32%,Cursor用户的双倍额度周该怎么用

翻译一下:它提升的是"长时间跑任务不跑偏"的能力,不是"当场写码更快"的能力。你的主力场景如果是一次性短代码生成,体感提升可能有限。

最后说最实际的:谁适合试,怎么试。

最适合试的是 Cursor 付费用户,这周的双倍额度相当于免费窗口。别拿 demo 玩,直接把你手上现成的任务拿来做 A/B:同一个需求,Grok 4.6 跑一遍、你现在的主力模型跑一遍,记三件事——用了几轮对话、你手动改了多少行、最后有没有真的合并。知乎这比任何跑分都靠谱。

适合的场景有个边界:价格敏感、上下文 200K 以内、验收标准清楚。为什么强调 200K?超过这个长度会进入 $4/$12 的阶梯计价,输入价优势从低 60% 收窄到低 20%,任务账又是另一个算法。36氪

Grok 4.6“1/3价格追平Sol”不能全信:实测任务成本只省32%,Cursor用户的双倍额度周该怎么用

不建议立刻换主力的:重度终端操作、超长上下文(Sol 官方窗口 105 万 token,Grok 是 50 万)、需要严格审计的场景。知乎另外发布才一天多,独立生产样本还不够,长任务可靠性要看工具失败后的恢复、中断后的续接、最终返工量,这些问题现在谁也给不出答案。

给自己设个观察阈值:先用路由的方式切一部分流量,跑满 30 个任务后看两个数——一次成功率有没有掉、通过验收的结果总成本是不是更低(算上重试和返工,不是只看 token 账单)。都满足,再扩大路由;重试吃掉了价差,就让它留在合适的位置。

顺手留两个后续观察信号:马斯克说 Grok 4.7 会在 3-4 周后到来,这个迭代速度意味着没必要急着在 4.6 上押重注。36氪同窗口发布的 DeepSeek V4 Pro,输出价 6 元/百万 token(Grok 4.6 输出折合约 43 元,差了约 7 倍)。知乎终端 Agent 测试 87.9 分逼近 Fable 5 的 88.0——预算敏感的路由党,国产这边也多了一个可选。

跑分是厂商的卷子,你的任务才是你的题。双倍额度别浪费,但用它来验证,而不是用它来换队。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章