Grok 4.7实测祛魅,长任务能力提升明显但综合实力仍逊于GPT和Claude
源自202位全网作者
16:02
精选参考来源
1
#SpaceXAI发布Grok4.7模型#Grok 4.7 更擅长持续执行复杂任务、自我检查结果,并改善了长上下文管理能力。在 Terminal-Bench 4.0 上,Grok 4.7 从 4.6 的 20.3% 直接提升到 38.0%;CursorBench 4.0 从 40.4% 提升到 46.3%。这类 Benchmark 更值得关注的地方,是它考察的不只是「会不会写代码」,而是模型能不能持续使用工具、修改代码、验证结果并把任务真正做完。另外,这次 4.7 还明显强化了专业知识工作。AA Briefcase 多小时办公任务达到 1657,高于 GPT-5.6 Sol 的 1487;EEBench 电气工程达到 64.0%,GPT-5.6 Sol 为 39.4%;Harvey Legal Agent Benchmark 法律任务则达到 19.6%。同时,Grok 4.7 还针对 Grok Bot 的运行框架进行了原生训练,进一步加强对话和通用知识工作能力。要升仙了都?
2
#SpaceXAI发布Grok4.7模型#AI圈又迎来重磅更新,SpaceXAI终于放出跳票许久的Grok4.7模型。 这次没有主打花式闲聊,核心瞄准编程与专业知识工作,升级更大基座模型,强化长耗时任务处理,还新增自我校验能力,输出结果靠谱度大幅提升。同等速度下维持原有定价,性价比直接拉满,现已接入Cursor、Grok Build以及API接口开放使用。 当然也并非全能,部分综合跑分依旧还有提升空间,更适合开发、工程、文档处理这类硬核场景。
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
最新文章
热门文章
-
净水器到底要不要装,先看这三点0 0
-
亲密炒菜中途疲软、核心不稳?七个凯格尔运动,让你找回自信108 44 -
在闲鱼12万卖掉特斯拉!当天手牵手过户,比贱卖给车商爽多了109 132 -
洁柔艺术油画抽纸测评|美的不像话!颜值能打,更扛得住娃!230 43
已收藏
去我的收藏夹