Grok 4.7实测祛魅,长任务能力提升明显但综合实力仍逊于GPT和Claude

源自202位全网作者

16:02

精选参考来源

全部
来源
内容由AI生成

精选参考来源

1. #SpaceXAI发布Grok4.7模型#Grok 4.7 更擅长持续执行复杂任务、自我检查结果,并改善了长上下文管理能力。在 Terminal-Bench 4.0 上,Grok 4.7 从 4.6 的 20.3% 直接提升到 38.0%;CursorBench 4.0 从 40.4% 提升到 46.3%。这类 Benchmark 更值得关注的地方,是它考察的不只是「会不会写代码」,而是模型能不能持续使用工具、修改代码、验证结果并把任务真正做完。另外,这次 4.7 还明显强化了专业知识工作。AA Briefcase 多小时办公任务达到 1657,高于 GPT-5.6 Sol 的 1487;EEBench 电气工程达到 64.0%,GPT-5.6 Sol 为 39.4%;Harvey Legal Agent Benchmark 法律任务则达到 19.6%。同时,Grok 4.7 还针对 Grok Bot 的运行框架进行了原生训练,进一步加强对话和通用知识工作能力。要升仙了都?

2. #SpaceXAI发布Grok4.7模型#AI圈又迎来重磅更新,SpaceXAI终于放出跳票许久的Grok4.7模型。 这次没有主打花式闲聊,核心瞄准编程与专业知识工作,升级更大基座模型,强化长耗时任务处理,还新增自我校验能力,输出结果靠谱度大幅提升。同等速度下维持原有定价,性价比直接拉满,现已接入Cursor、Grok Build以及API接口开放使用。 当然也并非全能,部分综合跑分依旧还有提升空间,更适合开发、工程、文档处理这类硬核场景。

3. #SpaceXAI发布Grok4.7模型#刚刚,SpaceXAI正式发布Grok 4.7,简单聊聊这次更新。Grok 4.7的定位非常清晰,主打代码与长时间专业知识工作,不是颠覆性换代,属于务实的迭代升级。相比Grok 4.6,基座模型更大,强化多小时长任务训练,增加自我校验能力,256k标准上下文,最高支持500k窗口,长文档处理稳定性提升明显。代码能力进步可观,长周期编程评测CursorBench 4.0超过GPT‑5.6 Sol,仅次于Fable 5.1,适合复杂项目迭代、大库修改这类开发场景。模型新增effort档位调节,xhigh模式允许模型投入更多算力深度思考任务,普通场景用默认high即可,兼顾效果与成本。API定价维持上代水平,输入2美元/百万token,输出6美元/百万token,同级别里价格优势突出,还有加速版本可选,对开发者友好。安全对齐完整重构,拒答、越狱抵抗是目前SpaceXAI模型里最好水平,网络安全、生物方向专项评测有亮眼表现。客观看短板,它没有实现全面碾压竞品。部分综合推理、多模态能力依旧存在差距,马斯克也公开承认,部分场景占优,部分场景落后对手,下一代Grok5才瞄准更高目标。它更偏向工程向,适合编程、长时间专业文档处理,创意、通用对话体验没有爆发式提升。总结一下,Grok4.7是工程师向的前沿模型,不追求全能,把代码、长任务、成本三个点做扎实。如果你做开发、处理大量长文档,值得接入体验;普通日常使用,感知不会特别强烈。AI大模型竞争已经从单纯跑分,走向任务落地、成本控制的综合比拼。#热点跨界共创##老张聊科技# #SpaceXAI发布Grok4.7模型#

4. #SpaceXAI发布Grok4.7模型#SpaceXAI推出Grok4.7,AA榜单46分,重点强化长任务Agent与编程能力,主打低价策略。对标国内来看,它跑分和小米MiMo‑V2.6‑Pro持平,属于第一梯队开源水准,整体略高于Kimi K3、Qwen3.8 Max。Grok4.7优势在长程智能体、复杂代码任务;短板是多模态能力偏弱。国产模型在中文理解、本地化场景、开源部署上有明显优势。跑分只能做参考,实际落地表现还需要大量实测验证。

5. #SpaceXAI发布Grok4.7模型#马斯克这边又更新大模型了,SpaceXAI推出Grok 4.7,定位是编码、知识工作专用模型。官方给的数据很抓人:推理速度是同类竞品两倍,价格直接砍半。#微博视频号续航计划# 对比上一代Grok4.6,它做了不少升级。长上下文能力变强,能扛住耗时很久的复杂任务,还会主动自检输出结果。在代码、电气工程、法律文书这些专业测试里,分数都明显上涨,不再只是简单聊天模型。安全层面也做了强化,抵御提示词越狱的能力提升,同时不会过度拦截正常的网络安全相关工作。 价格方面,每百万输入token仅2美元,输出6美元。现在可以通过API、Cursor编辑器、Grok Build直接调用。 它的优势集中在代码、长时间办公任务,不是全能模型。AI行业现在卷得厉害,一边提速一边降价,对开发者来说是好事,成本更低、效率更高。但普通用户日常刷内容,感知可能没那么强烈。 大模型赛道已经从单纯比拼参数,转向速度、成本、垂直能力的综合较量。你们觉得,这种主打高性价比的专业模型,会改变开发者的使用习惯吗? IT九熙的微博视频

6. Grok4.7来了!马斯克吹得震天响,实测一看:便宜快是真的,碾压对手是吹的! 我跟大伙聊聊刚出来的Grok4.7,马斯克这边吹得动静可不小。 对外宣传说得天花乱坠,号称做编程、干脑力活最强,速度翻倍,价格直接砍一半。 新版本模型做大了,专门对付那种要连续干几小时的复杂活儿,处理长篇资料、自己查错纠

7. 两块钱盲写 GTA 开放世界?Grok 4.7 实测:这代把干活成本算穿了

8. Grok 4.7 同价换代:今晚只换一条长任务

9. Grok4.7号称价格减半速度翻倍,拆完价目表我懂了

10. 刚刚,SpaceXAI最强Grok 4.7发布!价格杀疯,跑分令人失望

11. Grok 4.7 今天上线:同样的价格,代码和终端到底进步了多少?

12. 刚刚,马斯克交卷 Grok 4.7,但这次吹牛吹大了

13. Grok 4.7来了,不用官方工具,升级可能变退步?

14. Grok 4.7 今天发布了 太拉胯了

15. 马斯克又提价了,Grok 4.7 这次到底快在哪

16. 马斯克迎来复仇时刻? Grok 4.7 爆刷榜单价格腰斩, 有 DeepSeek 味儿了

17. Grok 4.7的升级重点:从单点答题到持续工作

18. 马斯克SpaceXAI发布旗下最强大编码和知识处理模型Grok 4.7

19. Grok 4.7 发布,证明其没有资格进入御三,基本上还是4.5 / 4.6 那个1.5T的水平,没看出哪里有2T的本质提升,也就是通过强化学习进一步提升了编码的benchmark分数。 Grok 在吃了 Cursor 的一波红利后,似乎搞不动了。目前还是御二高出一等,Fable 和 Astra。 GPT-5.6-Sol 和 Opus 5 已经成了所有其他家的天花板,想越过去不容易,只能等更强的模型发布借鉴之后.... 就看 Gemini 4 Pro 能否再次雄起了。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章