这周马斯克连扔两个炸弹,正在为 AI 工具付费的朋友,值得停一下。
8月12日凌晨,SpaceX AI 发布 Grok Bot——一群能登录你账号、24小时替你干活的"AI同事";不到24小时后,Grok 4.6 模型上线,官方跑分反超 GPT-5.6 Sol 和 Claude Fable 5,价格却只有两者的一半不到。36氪

这不是 xAI 的常规更新。今年2月 SpaceX 合并 xAI,6月用600亿美元全股票收购 Cursor——风投支持的创业公司史上最大收购,7月统一改名 SpaceX AI。36氪Grok Bot 和 Grok 4.6,是马斯克把这一摊子整合完之后,打出的第一套组合拳。
热度确实大:有B站博主统计,Grok 4.6 发布24小时内 X 平台相关话题曝光2700万,好评率约67%。哔哩哔哩同一时间,DeepSeek V4 Pro 正式版、阿里 Qwen3.8-Max 也在48小时内先后落地,全都押注"长程自主 Agent"。知乎
但越热闹越要看仔细。我把跑分、报价单小字和全网社区实测都翻了一遍,给大家说点通稿里不写的。
跑分强在哪,虚在哪
先说结论:Grok 4.6 在"干活能力"上是真强,但不是没有短板,而且有一块跑分要打折看。
先看硬成绩:
综合智能指数 AA Intelligence Index:61分,和 GPT-5.6 Sol 打平,比上代 Grok 4.5 高5分,只比 Fable 5 Max 少1分;
衡量真实工作能力的 GDPVal-AA v2:1753分,全场第一,GPT-5.6 Sol(1728)和 Fable 5 Max(1741)都被它反超;
AA-Briefcase(1577分)和 Harvey LAB(15.8%)同样是第一。
短板在 Terminal-Bench v3.0,测的是纯命令行环境下的 Agent 操作:Grok 4.6 只拿到26%,GPT-5.6 Sol 是34.6%。36氪你主要让 AI 在终端里跑多步任务的话,它还不是最强。

更要留个心眼的是:xAI 说 Grok 4.6 在自家 AGI 基准上"与最强对手持平",但这个基准的测试集没公开——找不到题目,也没有评分脚本。知乎知乎上已经有质疑:"AI厂商自己出题自己判卷,能信几分?"相对来说,前面那些第三方基准更值得参考。
社区实测也印证了这一点。知乎用户反馈普遍是"亲测没有跑分那么玄",但大家都承认 Grok 在生图领域确实异军突起——Grok Imagine 2.0 刚拿下文生图、图生图双榜第二。知乎另外注意:Grok 4.6 的知识截止日期是2026年2月1日,它的"实时资讯"能力来自搜索接入,不是训练数据新。知乎
价格真香?报价单上有三行小字
明面价格确实能打:每百万 token 输入2美元、输出6美元。同级的 GPT-5.6 Sol Max 是5美元/30美元,Claude Opus 5 是5美元/25美元——Grok 4.6 直接腰斩还多。36氪
但报价单上有三行小字,不仔细看看不到:
第一,缓存涨价了。有知乎用户翻出来,缓存价格从 Grok 4.5 的0.3美元涨到了0.5美元,涨幅67%,官方宣传里只字未提。知乎评论区有用户直接吐槽:说好的价格战,结果偷偷把缓存价格涨了,难怪消耗变快了。知乎
第二,长上下文整单翻倍。单次请求上下文超过20万 token,不是超出部分加价,而是整条请求都按双倍结算:输入4美元、输出12美元。36氪
第三,低延迟版本再加一倍。

为什么这三行字重要?因为 Grok 4.6 这次主打的就是"长程 Agent 任务"——这种场景恰恰是上下文最长、缓存吃得最多的。也就是说,2美元/6美元是短对话价,你真拿它跑 Agent,实际成本会往上走。翻倍之后依然比 GPT 和 Claude 便宜,但别按"半价"去预期。
Grok Bot:能干真活,门槛也不低
Grok Bot 可以理解为"一队 AI 员工":每个 Bot 有专属云电脑,你合上笔记本它照干;能登录你在用的网站,包括没有 API 的老系统;你操作一遍,它记下来存成流程,下次自动跑;多个 Bot 还能分工协作,甚至自己招新 Bot。它的原型其实是 Cursor 内部代号为"Sand"的 Agent 项目,xAI 内部先用了一段时间才放出来。36氪

但门槛很现实:最低要 Cursor Teams Premium 120美元/月/席位,个人订阅 Cursor Ultra 200美元/月或 SuperGrok Heavy 300美元/月,而且目前只能跑 Grok 自家模型。36氪对比一下,Claude Pro 每月20美元。
还有一个不太被提的风险:同一个用户名下所有 Bot 共享一台云电脑,文件、浏览器、登录状态全共用。把账号权限交给24小时自主干活的 Agent,Hacker News 上的高赞总结是"托管版 OpenClaw,但考虑到 Grok 在内容审核上的前科,持保留态度"。有篇评价说得形象:如果半夜某个环节出了微小偏差,你早上醒来审批的,是一颗已经滚起来的雪球。36氪
到底要不要换?分人说
已经是 Cursor / GrokBuild 订阅用户:别犹豫,Grok 4.6 这周双倍用量,先白嫖试用,看它适不适合你的任务类型再说;
API 开发者:值得拿长程、知识工作类 Agent 任务测一下,尤其上下文能控制在20万 token 以内的场景;纯终端操作密集的话,先等社区更多实测;
想花两三百美元月费上 Grok Bot 的:先问自己有没有高频、重复、规则明确的任务流,比如客户跟进、工单、报销。有,值得排候补;只是觉得"AI同事很酷",这钱够雇个真兼职了;
纯看热闹的:马斯克已经放话 Grok 4.7 三到四周内发布,还要"超越当前所有模型"。36氪AI圈立 flag 不要钱,等 4.7 落地再看 4.6 的成色也不迟。
最后一个值得盯的信号:Grok 4.6 上线48小时内,DeepSeek V4 Pro 和谷歌 Gemini 3.7 Flash 已经先后发起价格反击。马斯克这个"价格屠夫"能不能当稳,还得看下一轮。他们神仙打架,省钱的是我们这些掏钱用 AI 的。