Grok 4.6“一夜追平”但“1/3价格”只算对一半:切API前先算三本账

源自8位全网作者

01:44

美东8月12日这个晚上,AI圈再度经历“不眠夜”:DeepSeek V4 Pro突袭上线、千问3.8开源2.4T旗舰、马斯克旗下SpaceXAI甩出Grok 4.6,三颗炸弹同日引爆,不少测评博主和从业者直呼“又是一个不眠夜”。第一财经三个模型里,最改变市场预期的是Grok 4.6:Artificial Analysis综合智能指数与GPT-5.6 Sol同为61分,API定价每百万token输入2美元、输出6美元,不到Sol(5/30美元)的一半,连英伟达都第一时间在评论区留言“恭喜发布”。智东西但翻遍评测博主和开发者社区,口碑明显分裂:有人说“一夜重回一梯队”,也有人说“依旧棋差K3半步”。这篇内容写给平时在用Cursor、调API、正在纠结“接下来给哪个模型付钱”的人:把三个问题掰扯清楚——它是不是真强、是不是真便宜、现在要不要切。

Grok 4.6“一夜追平”但“1/3价格”只算对一半:切API前先算三本账

这次为什么突然变强:不是版本突变,是整合兑现

先说清楚一件事:Grok 4.6重回一梯队,不是某一个模型版本的突然变异,而是“SpaceX+xAI+Cursor”这条整合线跑了大半年的结果。今年2月,SpaceX以全股票方式收购xAI;6月16日,也就是SpaceX在纳斯达克完成750亿美元IPO几天之后,双方正式敲定了这笔600亿美元的全股票收购,这是风投支持的初创公司历史上金额最大的一笔收购。量子位7月,马斯克把两块业务对外品牌统一改成SpaceXAI。数据端更直接:Grok 4.5是xAI和Cursor首次联合训练的成果,训练数据里包含Cursor积累的海量真实开发者交互记录,4.6则是在4.5基础上继续加训——模型自生成的推理数据、高质量工程数据、优化器调整,再叠加知识工作、通用编码、内核优化、Web开发、CAD等环境的智能强化学习。训练目标明显对准“长程agent”:研究陌生领域、跨代码库修改、搭出第一版、跟着反馈改很多轮,中途不用打断重来。12日凌晨先发布的Grok Bot就是这套能力的产品形态:每个Bot配一台持久化云端电脑,能登录没有开放API的工具,24小时并行干活,还会旁观用户操作、把步骤存成可复用的routine。换句话说,这不再是“一个模型追分”,而是算力(Colossus超算)、数据(Cursor)、产品(Grok Bot)被马斯克拧成了一股绳。

跑分:一梯队门票是真的,偏科也是真的

看官方成绩表,Grok 4.6 High的AA综合智能指数61分,与GPT-5.6 Sol Max打平,只比Fable 5 Max少1分;衡量真实工作能力的GDPVal-AA v2拿到全场最高1753分,AA-Briefcase、Harvey LAB同样第一。但同一张表上,短板也写得明明白白:Terminal-Bench v3.0上,它只拿到26%,GPT-5.6 Sol是34.6%。量子位这项测的是纯命令行环境下的多步agent操作,出一次错就可能中断整条链路,恰恰是“数字员工”最硬的场景之一。再看第三方盲测,在最新披露的Code Arena代码竞技场WebDev测试结果中,Grok 4.6 (High)以1618分数排名第七,与GPT-5.6 Sol (xHigh)、GLM-5.2 (Max)、Claude Fable 5分数十分接近。智东西翻译成人话:它前面还站着Claude Opus 5 Max、Kimi K3 Max、千问3.8 Max,后面贴着GLM-5.2和DeepSeek V4 Flash——确实站进了一梯队群像,但谈不上“全面登顶”。

Grok 4.6“一夜追平”但“1/3价格”只算对一半:切API前先算三本账

社区实测:口碑分裂在哪

比官方表格更值得看的,是发布一天后涌出来的真实反馈。同一个“用模型从零构建吃豆人游戏”的测试,Grok 4.6耗时28分15秒、完成率100%、消耗约257k token;DeepSeek V4 Pro-0813跑到207分钟、10轮迭代仍未完成。B站实测视频的评论区里,有人同一晚对比后得出结论:“grok完成度更高,而且速度是ds的4倍”。哔哩哔哩也有高赞评论坚持“依旧棋差k3半步”。再叠加知乎、微博上的零散反馈:写小说不太行、Cursor里4.6 xhigh档偶尔偏慢不稳定;但另一面,“不封号、量足、速度快”又是不少Grok老用户最在意的点。把这些信号合在一起看:Grok 4.6的长板是“把一个想法做成能跑的第一版”这类长流程agent任务,短板是纯终端操作、硬核代码修复和创作类写作——偏科,但偏的方向正好是当下最热的“干活”场景。

Grok 4.6“一夜追平”但“1/3价格”只算对一半:切API前先算三本账

Grok 4.6“一夜追平”但“1/3价格”只算对一半:切API前先算三本账

“1/3价格”这话,只算对了一半

这次传播最广的口号是“1/3价格追平GPT-5.6”。看牌面价,这话成立:输入便宜60%、输出便宜80%,对比Claude Opus 5的5/25美元同样压制。但模型成本至少要算三本账:牌面单价、完成同一套任务的真实消耗、生产环境总成本。在第二本账上,Artificial Analysis的同一评测负载里,Grok 4.6每项任务约0.84美元,Sol约1.23美元,Grok只省约32%。知乎从“省80%”到“省32%”,落差来自token结构和推理档位——“1/3”只能描述特定token组合,不能概括所有任务。第三本生产账还要再叠重试、工具调用、人工复核和返工:价签便宜的模型如果一次成功率低,价差会被迅速吃掉。

价目表里还有几行容易被忽略的小字。一旦单次请求的上下文超过20万token,输入输出价格会同时翻倍,涨到4美元和12美元,而且这不是只算超出部分,整条请求都按高价结算。量子位即便翻倍后仍比Sol便宜,但优势明显收窄:在200k到272k区间,Grok已进入4/12美元的长上下文价,Sol仍是5/30美元,输入价优势从低60%收窄到低20%。另外,缓存输入价从Grok 4.5的0.3美元涨到了0.5美元,低延迟版本价格再乘2。还有一层利益关系要看清:被不少人引用“70.8%对70.5%、成本差6倍”的CursorBench v3.2,运营方Cursor如今已是SpaceX旗下资产,Cursor 运营 CursorBench,SpaceX、合并子公司与 Cursor 母公司 Anysphere 已在 6 月 16 日签署合并协议。知乎这份关系不会自动推翻榜单,但交叉验证的必要性提高了。横向对比国产阵营,压力更直观:DeepSeek V4 Pro输出价只有0.87美元/百万token,不到Grok的七分之一;千问3.8-Max也以开源旗舰的身份贴身紧逼。正如一位知乎作者的评价,它和同日上线的DeepSeek V4 Pro,一美一中、一前沿一普惠,把闭源高价护城河又挖松了一块。知乎

Grok 4.6“一夜追平”但“1/3价格”只算对一半:切API前先算三本账

谁现在可以试,谁再等等

现在值得试的人很明确:Cursor订阅用户首周直接拿到双倍用量。智东西等于官方请你白嫖一周做AB测试;API用户里,价格敏感、短中上下文、工具链可控的任务,最适合先试 Grok 4.6。知乎试法也别全量切流:路由一部分流量跑30个任务,只看两个数——成功了多少次、为每个通过验收的结果付了多少钱;如果重试和返工吃掉价差,就把它留在适合的任务层。再等等的人同样明确:依赖终端多步恢复的任务(Terminal-Bench 26%对34.6%的差距是实打实的)、需要500k以上超长窗口的任务(Grok 4.6是500k,Sol官方标1.05M)、写小说做创作的人。接下来盯三个信号:马斯克已经放话:Grok 4.7三周左右发布,要超越当前世界上所有大模型。微博现在all in任何一个模型,都有“三周后重洗牌”的风险;600亿美元Cursor交易仍待监管批准交割,交割前后CursorBench的独立性值得重新审视;以及发布刚一天,独立生产环境里长程agent的可靠性样本还太少,两周后的复盘评测会比今天的首测更可信。

写在最后

这一夜真正值得记住的,不是某张榜单上谁第一,而是“前沿能力+中档定价”正在成为新的锚点:Grok 4.6用Sol四成的价格站进同一梯队,DeepSeek用不到一成的价格在另一侧挖墙脚,夹在中间的闭源高价模型,护城河每一天都在变浅。对普通AI爱好者和开发者来说,这反而是最好的时间窗口——不必急着站队,让模型们先卷起来,你只需要守住自己的任务清单和成本表,谁便宜好用,就把流量路由给谁。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章