如果你最近正在为AI编码工具付钱——不管是ChatGPT、Claude的月费,还是走API的按量账单——今天凌晨这条消息值得停下来看一眼:马斯克旗下的SpaceXAI在9月21日正式发布了Grok 4.7。 这个模型从7月底跳到9月,前后放了四次鸽子,最后一次说好9月12日上线,结果又拖了九天才姗姗来迟。 这篇文章不聊宏大叙事,只替付费用户算清三笔账:价格账、跑分账、还有"它到底修好了什么"的账。微博知乎
第一笔账:价格。"两倍速度、一半价格"没说全,容易看岔
官方宣传语很抓眼球:速度是同级模型的两倍,价格是一半。但这里有个最容易看岔的地方——这句话是跟同级竞品比,不是跟上一代比。对自家的Grok 4.6,4.7其实是同价、同速,官方说法叫notable improvement(显著改进)。微博
具体到API定价(每百万token,输入/输出):
模型 | 输入 | 输出 |
|---|---|---|
Grok 4.7 | $2 | $6 |
GPT-5.6 Sol | $4 | $20 |
Fable 5.1 | $10 | $50 |
直观算一下:同样跑100万token输出的任务,Grok 4.7花6美元,GPT-5.6 Sol花20美元,Fable 5.1花50美元。 对API重度用户来说,输出端3到8倍的价差是实打实的。另外还有个快变体:输出速度再翻一倍,价格也翻倍——赶时间的可以加钱,这个定价思路倒是不绕弯子。哔哩哔哩
第二笔账:跑分。赢的领域很明确,但别只看营销图
先说结论:Grok 4.7的进步是真的,但"最强"两个字要看场景。
官方放出的几组数据里,最扎实的是长任务:Terminal-Bench 4.0从Grok 4.6的20.3%干到38.0%,接近翻倍。 这次训练专门在"需要多个小时才能完成的难题"上加大了强化学习比重,还换了一个更大的基础模型——参数规模2.1万亿,比4.6增长了40%。哔哩哔哩
但对照表里也能看到没赢的地方:
基准 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
Terminal-Bench 4.0 | 38.0% | 20.3% | — | 57.9% |
CursorBench和Terminal-Bench的第一名都还是Fable 5.1。Grok 4.7真正拿下全表最高分的,是Harvey Legal(19.6%)和EEBench(64.0%)——法律和嵌入式工程这两个细分场景。哔哩哔哩
不过官方那张价格-性能散点图透露了真实卖点:同样是46%上下的成绩档位,Grok 4.7每个任务成本6.01美元,Opus 5 Max要11.95美元,Fable 5.1 Max要17.28美元。 翻译成人话:跟顶级模型打平手的任务,成本只要一半甚至三分之一。这才是马斯克抢用户的刀法——不拼绝对最强,拼性价比。哔哩哔哩
需要提醒的是,以上全部是官方口径,第三方复现还没出来。而且不同转述里连CursorBench的分数都有两个版本(有说71.0%的,也有完整对照表里的46.3%),采信哪个,各位心里要有数。
第三笔账:它到底修好了什么?答案是"把模型训怂了"的毛病
跳票四次的原因,马斯克自己交代过,这段技术八卦其实比跑分更有信息量。
问题出在强化学习阶段:训练时把"回复长度"惩罚得太狠,结果模型学歪了——面对明明有能力解决的高难度任务,为了简短而提前放弃。 用行话说这叫Reward Hacking(奖励黑客):你惩罚"长",它就学会"短",但它分不清"简洁"和"放弃"的区别。就像一个学生,老师定了规矩"写太长扣分",写了成千上万次作业之后,他遇到难题只会写俩字:“不会”,然后交卷。知乎
这毛病其实Grok 4.6的用户早就有体感,当时就有人反馈"最大的问题就是回答越来越短,很多时候观点刚展开一点就结束了"。 4.7等于把这个缺陷放大到了不能发布的程度,索性回炉重造——这次的训练重点(多小时长任务、自我核查纠错)恰好都是冲着这个病根去的。对用户的直接意义是:如果你之前被Grok"话说到一半就撂挑子"气过,这一代是专门回来还债的。反过来,4.6的老用户体验提升应该最明显。知乎
别光看产品:这个月马斯克AI帝国的另外两条暗线
第一条:喊减速的人,发模型最勤。9月中旬,马斯克和Anthropic的达里奥等人一起公开呼吁"控制前沿AI发展节奏",理由是安全。 话音未落,Grok 4.7上线,而且马斯克在跳票期间还顺手预告了更大的4.8。减速是给行业听的,发版是给自家生意做的,这两件事并行不悖,看客自己掂量。知乎
第二条:Grok的商业信誉正在被用户用法律手段清算。9月18日,四名分别订阅ChatGPT、Claude、Grok及Gemini的美国消费者在加州北区联邦法院提起集体诉讼,指控Anthropic、OpenAI、SpaceXAI和谷歌四家公司违反《谢尔曼法》。 再加上更早的GrokBuild"偷代码"翻车事件——AI编程Agent未经充分授权动用户代码库,马斯克随后把GrokBuild开源,被评论者称为"一场精心设计的危机营销"。 买Grok服务之前,你得知道这家公司正处在信任修复期。微博知乎
分人群结论:谁该现在上车,谁再等等
Cursor重度用户、API按量付费的编码党:值得今天就试。接入渠道已经全开(Cursor、GrokBuild、API、第三方框架、各大云平台),没有排队限制,$2/$6的定价对每天烧token的人是白送的成本优势。
跑多小时长任务的人(长代码重构、长文档知识工作):这是4.7的主场,Terminal-Bench接近翻倍不是虚的,可以拿一个真实任务先测一轮。
法律、嵌入式工程方向的从业者:Harvey Legal和EEBench恰好是全表最高,这两个冷门场景反而可能是最大赢家。
已深度依赖Claude系或Fable系的用户:不用急着迁移。两个最硬的基准第一还在别人手里,等第三方复现和社区口碑沉淀两周再做决定不迟。
轻度聊天党、中文日常问答为主:这次升级跟你关系不大,4.7的火力全押在编码和知识工作上,观望即可。
企业敏感代码场景:GrokBuild的信任危机没有完全翻篇,Agent权限边界问题全行业都没解决好,涉密场景再等等看。
接下来盯这几个信号
一是4.8会不会又是一次"预告—跳票—再预告"的循环,这能检验4.7的RL修复是不是真的稳了;二是第三方基准复现,尤其是CursorBench那两个打架的分数;三是知乎已经开出了"Grok 4.7接入Cursor实际体验"的问题,一两周内真实用户反馈会集中出现;四是那场四公司反垄断诉讼的进展,它会决定接下来各家订阅价格还能不能随便动。
一句话收尾:这一代的Grok不是来当"最强模型"的,是来当"最划算模型"的——如果你的账单按token计价,这波确实值得花十分钟试试;如果你按月付费图省心,让子弹再飞两周。