Grok4.6半价,Agent编程反超GPT5.6
源自21位全网作者
06:05
精选参考来源
1
Grok 4.6正式发布,多项基准测试逼近顶尖模型8月12日,SpaceXAI正式发布Grok 4.6。官方表示,新模型在Grok 4.5基础上进行了进一步升级,重点强化长时间运行的Agent任务,以及更复杂的交互式和视觉类工作。相比上一代,Grok 4.6更加注重处理需要多步骤持续执行的复杂任务,包括信息研究、数据分析、代码库开发,以及从一个产品创意直接构建出可运行的应用或工作成果。SpaceXAI表示,在较长任务链中,Grok 4.6还展现出更强的自我测试和验证能力,会在继续执行前主动检查工作结果。在性能方面,Grok 4.6在多项Agent编程和知识工作基准测试中达到前沿水平。其中,Artificial Analysis Intelligence Index综合九项基准测试,Grok 4.6获得61分,与GPT-5.6 Sol持平;在GDPVal-AA v2、CursorBench v3.2、DeepSWE v1.1、FrontierCode v1.1等测试中,也展现出较强竞争力。不过,在部分编码测试中,Grok 4.6仍落后于GPT-5.6 Sol或其他顶尖模型。训练方面,Grok 4.6进行了比Grok 4.5更长的补充训练,加入模型生成的推理和高级技术数据、高质量工程数据,并改进优化器和训练方案。随后,SpaceXAI利用Grok 4.5重新生成不同推理强度、Agent框架以及STEM、软件工程和知识工作领域的SFT训练轨迹,并进一步进行筛选和强化学习训练。值得关注的是,Grok 4.6此次明显强化了“从想法到产品”的能力。SpaceXAI表示,用户给出一个较为宽泛的产品创意后,模型可以自行研究陌生领域、规划应用结构、实现核心交互,并根据反馈持续迭代。对于视觉和交互式项目,其首轮生成效果也较Grok 4.5明显提升。目前,Grok 4.6已经登陆Cursor、Grok Build,同时开放API,并支持OpenRouter、Vercel和Cloudflare等合作平台。API价格从每百万输入Token 2美元、每百万输出Token 6美元起,快速版本价格为其两倍。SpaceXAI还宣布,Grok Build和Cursor首周提供两倍的包含用量。从此次升级来看,Grok 4.6并非单纯追求聊天和推理能力,而是进一步把重点放在“长任务Agent”和“直接完成工作”上。随着AI竞争从模型能力逐渐转向实际执行能力,Grok 4.6能否凭借更强的持续工作能力,在Agent赛道进一步追赶OpenAI、Anthropic等竞争对手,值得持续关注。
2
这个试验很有意思:100万美元预算,让给20多人的团队不限量 Token 使用 AI。结论是:人更累,AI 的成本比人高,效率提升有明显天花板。从数据上看,每天的 Token 费用的中位数有 $2000 美元,超过大部分人的工资。最受欢迎的模型是 GPT-5.6 Sol Fast 和 Fable 5 Fast。1. 人更累,为了不浪费时间并行多个 session 操作,需要不停切换上下文,还要审查 AI 产出的海量内容,工作更累待遇没涨。2. 便宜模型未必省钱,简单任务给 Grok 4.5,结果迭代次数更多,总费用比直接使用规模性更高3. 人的思考都外包给 AI 了,对项目细节掌控下降,需要问 AI 才能回复别人的问题。4. AI 真正的增长空间可能不是无限 Token,而在于更多组织能从 0 到 1 开始使用 AI。5. 现在 AI 落地困难,很大程度上是因为公司的组织架构还是为人设计的,就算有无限 Token,效率提升上也有明显天花版。
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹