Grok4.6半价,Agent编程反超GPT5.6

源自21位全网作者

06:05

精选参考来源

1
Grok 4.6正式发布,多项基准测试逼近顶尖模型8月12日,SpaceXAI正式发布Grok 4.6。官方表示,新模型在Grok 4.5基础上进行了进一步升级,重点强化长时间运行的Agent任务,以及更复杂的交互式和视觉类工作。相比上一代,Grok 4.6更加注重处理需要多步骤持续执行的复杂任务,包括信息研究、数据分析、代码库开发,以及从一个产品创意直接构建出可运行的应用或工作成果。SpaceXAI表示,在较长任务链中,Grok 4.6还展现出更强的自我测试和验证能力,会在继续执行前主动检查工作结果。在性能方面,Grok 4.6在多项Agent编程和知识工作基准测试中达到前沿水平。其中,Artificial Analysis Intelligence Index综合九项基准测试,Grok 4.6获得61分,与GPT-5.6 Sol持平;在GDPVal-AA v2、CursorBench v3.2、DeepSWE v1.1、FrontierCode v1.1等测试中,也展现出较强竞争力。不过,在部分编码测试中,Grok 4.6仍落后于GPT-5.6 Sol或其他顶尖模型。训练方面,Grok 4.6进行了比Grok 4.5更长的补充训练,加入模型生成的推理和高级技术数据、高质量工程数据,并改进优化器和训练方案。随后,SpaceXAI利用Grok 4.5重新生成不同推理强度、Agent框架以及STEM、软件工程和知识工作领域的SFT训练轨迹,并进一步进行筛选和强化学习训练。值得关注的是,Grok 4.6此次明显强化了“从想法到产品”的能力。SpaceXAI表示,用户给出一个较为宽泛的产品创意后,模型可以自行研究陌生领域、规划应用结构、实现核心交互,并根据反馈持续迭代。对于视觉和交互式项目,其首轮生成效果也较Grok 4.5明显提升。目前,Grok 4.6已经登陆Cursor、Grok Build,同时开放API,并支持OpenRouter、Vercel和Cloudflare等合作平台。API价格从每百万输入Token 2美元、每百万输出Token 6美元起,快速版本价格为其两倍。SpaceXAI还宣布,Grok Build和Cursor首周提供两倍的包含用量。从此次升级来看,Grok 4.6并非单纯追求聊天和推理能力,而是进一步把重点放在“长任务Agent”和“直接完成工作”上。随着AI竞争从模型能力逐渐转向实际执行能力,Grok 4.6能否凭借更强的持续工作能力,在Agent赛道进一步追赶OpenAI、Anthropic等竞争对手,值得持续关注。
2
这个试验很有意思:100万美元预算,让给20多人的团队不限量 Token 使用 AI。结论是:人更累,AI 的成本比人高,效率提升有明显天花板。从数据上看,每天的 Token 费用的中位数有 $2000 美元,超过大部分人的工资。最受欢迎的模型是 GPT-5.6 Sol Fast 和 Fable 5 Fast。1. 人更累,为了不浪费时间并行多个 session 操作,需要不停切换上下文,还要审查 AI 产出的海量内容,工作更累待遇没涨。2. 便宜模型未必省钱,简单任务给 Grok 4.5,结果迭代次数更多,总费用比直接使用规模性更高3. 人的思考都外包给 AI 了,对项目细节掌控下降,需要问 AI 才能回复别人的问题。4. AI 真正的增长空间可能不是无限 Token,而在于更多组织能从 0 到 1 开始使用 AI。5. 现在 AI 落地困难,很大程度上是因为公司的组织架构还是为人设计的,就算有无限 Token,效率提升上也有明显天花版。
全部
来源
内容由AI生成

精选参考来源

1. Grok 4.6正式发布,多项基准测试逼近顶尖模型8月12日,SpaceXAI正式发布Grok 4.6。官方表示,新模型在Grok 4.5基础上进行了进一步升级,重点强化长时间运行的Agent任务,以及更复杂的交互式和视觉类工作。相比上一代,Grok 4.6更加注重处理需要多步骤持续执行的复杂任务,包括信息研究、数据分析、代码库开发,以及从一个产品创意直接构建出可运行的应用或工作成果。SpaceXAI表示,在较长任务链中,Grok 4.6还展现出更强的自我测试和验证能力,会在继续执行前主动检查工作结果。在性能方面,Grok 4.6在多项Agent编程和知识工作基准测试中达到前沿水平。其中,Artificial Analysis Intelligence Index综合九项基准测试,Grok 4.6获得61分,与GPT-5.6 Sol持平;在GDPVal-AA v2、CursorBench v3.2、DeepSWE v1.1、FrontierCode v1.1等测试中,也展现出较强竞争力。不过,在部分编码测试中,Grok 4.6仍落后于GPT-5.6 Sol或其他顶尖模型。训练方面,Grok 4.6进行了比Grok 4.5更长的补充训练,加入模型生成的推理和高级技术数据、高质量工程数据,并改进优化器和训练方案。随后,SpaceXAI利用Grok 4.5重新生成不同推理强度、Agent框架以及STEM、软件工程和知识工作领域的SFT训练轨迹,并进一步进行筛选和强化学习训练。值得关注的是,Grok 4.6此次明显强化了“从想法到产品”的能力。SpaceXAI表示,用户给出一个较为宽泛的产品创意后,模型可以自行研究陌生领域、规划应用结构、实现核心交互,并根据反馈持续迭代。对于视觉和交互式项目,其首轮生成效果也较Grok 4.5明显提升。目前,Grok 4.6已经登陆Cursor、Grok Build,同时开放API,并支持OpenRouter、Vercel和Cloudflare等合作平台。API价格从每百万输入Token 2美元、每百万输出Token 6美元起,快速版本价格为其两倍。SpaceXAI还宣布,Grok Build和Cursor首周提供两倍的包含用量。从此次升级来看,Grok 4.6并非单纯追求聊天和推理能力,而是进一步把重点放在“长任务Agent”和“直接完成工作”上。随着AI竞争从模型能力逐渐转向实际执行能力,Grok 4.6能否凭借更强的持续工作能力,在Agent赛道进一步追赶OpenAI、Anthropic等竞争对手,值得持续关注。

2. 这个试验很有意思:100万美元预算,让给20多人的团队不限量 Token 使用 AI。结论是:人更累,AI 的成本比人高,效率提升有明显天花板。从数据上看,每天的 Token 费用的中位数有 $2000 美元,超过大部分人的工资。最受欢迎的模型是 GPT-5.6 Sol Fast 和 Fable 5 Fast。1. 人更累,为了不浪费时间并行多个 session 操作,需要不停切换上下文,还要审查 AI 产出的海量内容,工作更累待遇没涨。2. 便宜模型未必省钱,简单任务给 Grok 4.5,结果迭代次数更多,总费用比直接使用规模性更高3. 人的思考都外包给 AI 了,对项目细节掌控下降,需要问 AI 才能回复别人的问题。4. AI 真正的增长空间可能不是无限 Token,而在于更多组织能从 0 到 1 开始使用 AI。5. 现在 AI 落地困难,很大程度上是因为公司的组织架构还是为人设计的,就算有无限 Token,效率提升上也有明显天花版。

3. 马斯克旗下的Grok发布了新一代的图片模型Imagine 2,试用了一下,确实挺能打的,在AI竞技场Arena.AI已经排到了第2名。我还是来做一轮对比测试,选用当前在我心中地表最强的三大图片模型,SOTA级的GPT-Image-2、国产之光Seedream 5.0 Pro和Grok Imagine 2,用同样的提示词出题,看看它们的表现如何,同时附上我的锐评。还是3张图片为1组,从左到右的顺序依次是GPT-Image-2、Seedream 5.0 Pro、Grok Imagine 2:第1组 / 以【北京】为主题做一个纪念邮票收藏页GPT的美学造诣依然是没得说,不过Grok的色彩一致性我也很喜欢;第2组 / 为【西施】制作一张华丽张扬的国风图鉴体感很强烈,GPT和Grok的调教路径非常接近,Seedream的光影更加明亮;第3组 / 给【草船借箭】设计一张成语释义的海报GPT侧重意境,Seedream偏向留白,Grok是个话唠,这题算是各有所长;第4组 / 用【微距】镜头捕捉一场残酷的昆虫搏斗GPT为了追求惊心动魄的视效,似乎牺牲了空间的合理性,而Seedream的干净和Grok的污脏又正好是两个极端;第5组 / 在【高铁】上拍摄一个美女乘客的侧颜题目看起来简单,其实要同时兼顾箱子、座位和人体的空间结构,其实很容易犯错;第6组 / 把【绝命毒师】的角色制作成可视化的卡片清单主要想测还原度和群像细节,GPT这次完胜,版权素材的训练很齐全;最后再补充一些经验或者说心得吧:- GPT我已经习惯了在Codex里和它一起写提示词,好吧主要是它写我盯着,然后再去ChatGPT生成,因为Codex好像很不适合直接出图,画质降得厉害,图片大小往往都只有网页生图的不到一半;- Seedream很特别的是,它的最近几个大版本,从4.0到4.5再到5.0,并不是简单的线性升级,有不少提示词,低版本的出图效果反而能比最强的5.0 Pro还好,这是用起来很困扰的一个地方,另外就是Seedream很吃通过降画质来实现去AI味这套,直接在提示词里强调就行;- Grok的优点是比较均衡,生成速度是这「御三家」里最快的,新版本主要在真实性上追了上来,克服了以前挥之不去的塑料感,而且性价比也足够,开通了x会员就能一鱼两吃,在Grok里还能一键图转视频,相当实惠。所以,你们觉得如何?

4. GPT-5.6全面免费开放/DeepSeek预告将大幅涨价/张一鸣:不走蒸馏捷径,要从底层构建壁垒

5. OpenAI突然放开GPT-5.6,免费聊天,不限次数

6. Grok 4.6 今天就发!1.5 万亿参数还没捂热,4.7 已经在门口排队

7. 明天周五,2026-08-07当天发生的金融信息预告! 1、马斯克:Grok 4.6预计8月7日发布,,参数规模为‌1.5万亿‌,核心优化方向是大幅提升监督微调(SFT)和强化学习(RL)能力,让模型指令遵循度、任务完成质量表现更出色。Grok 4.7预计在几周后推出,,参数规模升级至‌2.1万亿‌,综合能力全面优于Grok 4.6,仅推理响应速度会稍慢,但token使用效率会更高,能以更低成本完成复杂任务。同期马斯克还公布了后续路线图,Grok 5计划在2026年年内发布,会首次完整注入SpaceX创立25年积累的全量工程数据进行训练,打造面向航空航天、复杂制造领域的专业级AI能力。Grok最初是X平台(原Twitter)专属的AI聊天机器人,现在已发展为覆盖网页、移动端、车载等多端的独立产品,核心特色是支持实时调取X平台的公开内容,不会像其他AI助手那样出现训练数据过时的问题,主打“实时性+强推理”的AI助手定位。 2、宇树科技公告,网上路演将于2026年8月7日14:00-17:00举行,本次拟公开发行新股4044.64万股,占发行后总股本的10%;其中初始战略配售808.93万股,网下初始发行2588.62万股,网上初始发行647.10万股,后续将根据回拨机制调整最终发行数量。作为全球人形机器人出货量第一的具身智能企业,市场普遍关注其IPO定价与估值,机构投资者会重点评估其模型能力、商业化落地成色、长期运营能力等核心维度。 3、深圳国际家纺布艺暨家居装饰展览会将于8月7日至9日举办,现场设置四大核心产业场景:实景软装联展、20余场行业主题分享、精准供需私密洽谈、「织・境」全案软装设计大赛启动仪式,内容覆盖全案落地、跨境外贸、青年设计师培育等行业热点议题。 4、第三届能源与光电技术会议将于8月7日至9日在新疆乌鲁木齐举办,本次会议是能源与光电领域的专业学术盛会,将集中展示钙钛矿太阳能电池、各类新型储能电池、发光二极管、光电探测器、激光器、传感器等方向的最新科研成果,深入探讨领域内的机遇、挑战与未来发展路径。

8. Grok 4.6 明天发布:1.5 万亿参数,马斯克亲自官宣

9. 疯狂堆参数只是幌子,马斯克借Grok布局庞大商业闭环

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章