2026年AI助手生态分化:Claude深耕Agent路线,ChatGPT转向全能执行者

源自116位全网作者

03-14 09:33

内容由AI生成

精选参考来源

1. GPT-5.4:OpenAI做了个Kimi K2.5 +MiniMax M2.5?

2. Claude Opus 4.6 vs GPT-5.3-Codex,到底谁更强?

3. 连Claude死忠粉都换GPT-5.4了,OpenClaw省47%,Token半价碾压Opus!

4. GPT-5.4深夜发布,最适合OpenClaw的天选模型登场了。 深夜凌晨2点,我刚准备睡觉。 然后,GPT-5.4,突然发布。 一下子激动的睡不着了。 真的,这真不是我天天咋咋呼呼啥的,我真的也很少会用激动的睡不着觉这种表述。 这是因为,我一直在等正式版的GPT-5.3或者GPT-5.4,来作为我的OpenClaw的首选模型。 理由特别简单,因为现代世界三十年,本质上基层都是代码,我们现在看到的关于计算机和互联网的一切,几乎都建立在代码的基础之上。 所以你可以理解为,代码能力,在很多时候,就代表着Agent能力的一根粗壮的腿。 一个优秀的Agent基座模型,在我的理解里,一般来说,需要三种都很强: 代码能力、世界知识、多模态理解。 当你这三个都能SOTA的时候,你几乎必然就是最牛逼的Agent模型,当然,还有一个重要的因素,就是价格。 在过去,Claude Opus 4.6,几乎就是Agent模型的代名词,因为代码、世界知识都很强,多模态能力虽然比不过Seed 2.0和Gemini 3.1 Pro,但是在一些场景里面,也够了,因为现在的Agent,跟现实物理交互还没有那么多,那个已经是具身智能的范畴了。 而我过去很喜欢的GPT-5.3-Codex,代码能力确实强,在做任务执行的时候,那简直就是指哪打哪。 但是最大的问题,这玩意是一个编程特化模型啊,世界知识就是一坨屎,连GPT-5.2都不如,所以OpenAI当时也是没办法,为了跟Claude打一打,只能加个Codex的后缀给放出来了。 所以你会发现,在规划能力上,是完全比不过Claude Opus 4.6的,但是最大的问题,其实还是因为世界知识的问题,就导致这玩意。 它说天书,讲的那些话,真的,我不是程序员出身,我看那个话,看的就真的超级费劲。 就比如说,我让他之前对我的一个AI热点网站的项目进行审查,主要就是review一下我的文档规范和我整个代码库。 然后,这哥们写的文档,我尼玛。。。 你再对比一下Claude Opus 4.6写的。 对比起来应该一目了然。。。 就是因为这玩意不说人话,世界知识也不行,所以,只是在Codex里面用用还好,但是你要是把它接到你的OpenClaw里面,去当做默认模型,你就知道啥叫灾难了,这哥们几乎没有人味,说起话来我想揍他。 所以我当时试了一下,就直接弃了,还是在我的OpenClaw里面,用的Claude Opus 4.6和Sonnet 4.6,做了一下场景调用。 那为啥说,我很期待GPT-5.4呢。 因为,Claude哪都好,但是,它贵啊!!! 它真的好贵啊!!!!!! 而且因为Anthropic这个呆逼,它把OpenClaw给疯了,所以我订阅的Claude的Max Plan的额度,是完全不能给OpenClaw用的,只能在Claude Code用,你想在OpenClaw上用,只能硬接API Key用。 但是大家都知道,Claude的API有多贵,那根本不是我们这种穷逼团队能用的起的,小规模用用还好,大规模用那公司直接破产了。 之前还有一条路是用反代,把Google家的Antigravity里面的Claude额度用插件代理出来,扔给OpenClaw用。 但是后面Google开始大批量封号,导致也没办法用了。 我过年的时候Google账号还被封了,被迫用AI去给Google写了一份声泪俱下的邮件。 我说我错了,我再也不会了。 后面Google才给我解封,但是反代肯定是用不了了。 而OpenAI就不一样了,最开始Claude疯狂封OpenCode账号的时候,OpenAI大手一挥,就站了出来,说我们不封,大家全力使用。 这是御三家里,唯一一个这么支持态度的,可以用第三方的工具,调用Codex的额度的。 那对OpenClaw自然也不例外了,也是几个顶级模型里面,为数不多的,可以直接走登录的,其他的都得用API。 真的,OpenAI这回真的是大善人。 还疯狂的给Codex加额度。 所以啊,Claude在OpenClaw里用,好是好,但是不能用订阅额度,只能用API,贵的一笔。 OpenAI的模型倒是可以用订阅额度,但是GPT-5.2代码又不行,GPT-5.3-codex又不说人话。 你看,要多别扭有多别扭。 而这一次,GPT-5.4来了!!! 终于把这个短板给补上了! 代码能力跟GPT-5.3-Codex齐平,世界知识比GPT-5.2还要强,还能使用订阅额度,20刀就可以用的超级爽。 你就说,这不是最适合OpenClaw的天选模型,还有谁是?嗯? 从今天开始,用OpenClaw的,都把默认模型切换到GPT-5.4去,真的,信我。 回到GPT-5.4,老规矩,先看跑分。 就很爽。 先看最关键的几个。 GDPval:83.0% 这个是测AI在真实工作任务中表现的,包括金融、法律等44种职业的知识工作。 GPT-5.4 Thinking拿了83.0%,Claude Opus 4.6是78.0%,GPT-5.3 Codex是70.9%。 在真实业务场景里,GPT-5.4不只是会写代码,它还能跟你聊业务、聊金融、聊法律、聊各种专业领域的东西。 而且是用人话聊,不是用天书聊。 SWE-Bench Pro:57.7% 这个是测AI解决真实软件工程问题的,不只是Python,而是测四种编程语言。 GPT-5.4 Thinking拿了57.7%,GPT-5.3 Codex是56.8%。 基本持平。 这就是我最想看到的结果。 代码能力保住了GPT-5.3 Codex的水平,世界知识又补上来了。 OSWorld-Verified也是,75.0%。这个是测AI操作电脑的能力的,就是让AI像人一样,用鼠标点击、用键盘输入、在不同应用之间切换,完成各种任务。 GPT-5.4 Thinking拿了75.0%,超过了Claude Opus 4.6的72.7%,也保持了跟GPT-5.3-Codex的持平。 而且,GPT-5.4操作电脑的速度,快的离谱。 看下这个没有加速过的视频,会更直观。 ToolAthlon:54.6% 这个是测AI使用工具的能力的,也就是Agent能力的核心指标之一。 GPT-5.4 Thinking拿了54.6%,Claude Sonnet 4.6是44.8%。 差了将近10个点。 至于学术知识之类的,跟GPT-5.3-codex就没法比了,因为OpenAI自己也知道,所以,直接当时就没跑。 总之,翻译成大白话就是。 GPT-5.4 = GPT-5.3 Codex的代码能力 + 比GPT-5.2还强的世界知识 + 更强的工具使用能力 + 超级便宜的codex额度。 这四样加在一起,就是一个完美的OpenClaw天选基座模型。 然后还有几个很棒的特性更新: 1. 100万token的上下文窗口。 这是GPT-5.4的一个大升级。 之前GPT-5.3的上下文窗口是40万token,GPT-5.4直接翻了一倍多,到了100万。 这对Agent来说太重要了。 因为Agent在执行任务的时候,需要保持对整个任务的上下文理解。如果上下文窗口不够大,Agent干着干着就会忘事儿,前面说的东西后面就不记得了。 100万token,基本上足够应对绝大部分的Agent任务了。 当然,OpenAI也不傻,他们说,超过27万token之后,你的额度就算两倍了。 不过因为Codex给的额度实在是太多太多了,所以即使是2倍,其实也还好。 2. 原生计算机使用能力。 这个是GPT-5.4的另一个大卖点。 OpenAI说,GPT-5.4是他们第一个内置原生计算机使用能力的主线模型。 它在编写通过Playwright等库操作计算机的代码方面表现非常的出色,同时也能根据屏幕截图发出鼠标和键盘命令。 也就是代码和视觉齐飞,我感觉,这个小龙虾接入以后,就真的可以,直接用视觉,操控你电脑上绝大多数的软件了,真的,原生操控,想想都激动。 他们基于此,还发布了一个新的skills,叫playwright-interactive。 允许Codex同时以代码和视觉的两种方式,调试Web和Electron应用。 网址在此,大家可以自行安装。 http://t.cn/AXVAqO5O 3. 支持了工具搜索。 以前呢,当模型被赋予工具时,所有工具定义都会预先包含在提示中。 对于拥有大量工具的系统,这可能会为每个请求增加数千甚至数万个token,而且绝大多数的时候,都毫无意义,平白无故的导致成本上升、响应变慢,并在上下文中充斥模型可能永远不会使用的信息。 所以呢,这次他们也支持了工具搜索,就是GPT‑5.4不再直接接收完整工具定义,而是接收一份可用工具的轻量列表以及工具搜索功能。 当模型需要使用某个工具时,它可以查找该工具的定义并在当时将其追加到对话中。 就非常像Skills渐进式呈现的方式,目的很简单,还是优化上下文工程。 OpenAI在自己测试完以后,发现工具搜索配置在保持相同准确率的同时将总体token使用量减少47%,这个就非常牛逼了。 GPT-5.4 Thinking大概就是这样。 这次他们其实还发了个GPT-5.4 Pro,我就不细说了,反正就是一切都更牛逼了,但是对于大多数人来说,太贵了,也没啥大用,必须得200刀的Pro会员才能用。 API的整体价格还是得说一下,虽然大家大概率用的都会是订阅的额度。 相比于GPT-5.2,价格是涨了的,但是还是比Claude Opus 4.6,便宜不少,Claude Opus 4.6的价格是$5/$25每百万token(输入/输出),GPT-5.4只有他们一半。 目前ChatGPT已经上线了。 Codex也已经支持了,我自己在Codex里面粗浅体验了一下。 首先扑面而来的,那自然是清新沁人的人话。。。 比如我让它去把OpenAI官网的视频给扒拉下来,你看看这个发言:“这种活最烦”,“省的跟Cloudflare互相折寿”。。。 还有这个。 真的,Codex的输出,我真的能看得懂了。。。 做出来的东西,前端审美有了不错的进步,但还是不如Opus 4.6和Gemini。 写作粗略测了一下,还是一股子莫名其妙的爱用排比句的诡异的味道。 奇奇怪怪。 然后有点可惜的就是,我等到了凌晨6点多,OpenClaw目前使用Codex登录的方式,还是没有支持GPT-5.4。 这就导致,我还是没有机会测GPT-5.4在小龙虾上的效果。 不过估计今天小龙虾就支持了。 因为社区里已经看到很多用户在催了,而且先行官们,都普遍反馈效果很好。 坐等支持,我真的已经迫不及待了。 又是开心的一晚。 如果你也在用OpenClaw,那记得OpenClaw支持了以后,把默认模型切换到GPT-5.4。 如果你还没用过OpenClaw,那正好,现在是一个很好的开始时机。 毕竟,有了GPT-5.4这个天选模型,体验只会更好。 2026年,真是疯狂的一年啊。 #how i ai##AI[超话]##科技先锋官##ChatGPT[超话]##gpt5# http://t.cn/AXVAqYKj

5. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

6. OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了

7. GPT-5.4深夜发布,最适合OpenClaw的天选模型登场了。

8. 刚刚,奥特曼砸场发布 GPT-5.4!网友:一句 Hi 烧掉 80 美元

9. 刚刚,GPT-5.4核心内幕炸裂剧透!或拥有永久记忆,极限推理狂飙

10. GPT-5.4 到底变强了多少?三大核心能力+电脑操控Codex上手实测!

11. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

12. 春节6天,我找到了各个领域最强的大模型。 这个春节,快快乐乐的在老家vibe coding了近6天。我做了一个还蛮有趣的东西,就是一个18个大维度、近100个小维度,一共970道题的原创大模型评测集。做这个东西的想法其实特别简单,就是我希望任何一个新模型一出来,就能用这套评测集直接过全自动过一遍,再配合我自己的实测,大概就能在3个小时里,就对新模型的能力比较清楚了,以方便我更好更快的对模型进行评测,同时也能避开一些刷分怪。人啊,就是不知者无畏,想的很简单,但是没想到做起来,有这么的麻烦,4天几乎用光了我御三家大模型最高档Coding plan的额度,也真的踩了无数的坑。比如Skill迭代,一开始我做了出题和审查skill之后,我发现,模型出的还是一坨屎,因为缺了太多的经验和约束条件。所以没办法,只能各个顶级模型互相出题再互相审查,然后再把经验迭代回skills,就这么迭代了2天,这个skills才算稳定可用。就比如上下文管理,这1000道题的信息量过于恐怖,没有一个Agent能直接生成出来,更别提很多原创素材,我甚至写了3本15万字的小说作为评测集的素材之一。像Claude Code,一次性生成一个小类的10道题,就已经是最佳上下文的极限了。不过这些坑归坑,但是也意外的帮我找到了各个维度里目前体感最强的模型。毕竟出题模型的能力上限,几乎也影响出题的质量和未来评测的质量,毕竟出题的拉了,那未来评测必拉。所以,也给大家分享一下,不保证对,只是我自己的体感:1. 软件工程与代码生成:GPT-5.3 codex2. 代码理解、推理与质量:GPT-5.3 codex3. 调试、测试与维护:GPT-5.3 codex4. 数据工程与后端服务:Claude Opus 4.65. 前端与产品工程:Claude Opus 4.66. Agent工具调用:Claude Opus 4.67. Web与桌面自动化(静态) :Claude Opus 4.68. 研究与知识工作Agent(静态):GPT-5.2 Pro9. 数学与形式推理:Gemini 3.1 Pro10. 逻辑与规划:Gemini 3.1 Pro11. 知识广度与事实核验:Gemini DeepThink12. 阅读理解与信息抽取:GPT-5.2 Thinking13. 长上下文记忆与多轮一致性:GPT-5.2 Thinking14. 指令遵循与对齐:Claude Opus 4.615. 多模态理解与视觉推理:GPT-5.2 Thinking16. 情商与协作沟通:GPT-4.517. 创作表达与审美:Claude Opus 4.6以上,希望能帮大家节省一点时间。哦对了,再额外提一句,在搜索上如果你想搜关于AI的最新的信息,比如OpanClaw的最新玩法之类的。相信我,用Grok 4.2,有奇效。#how i ai#AI#大模型##科技先锋官# #过个有AI年#

13. OpenAI 正式发布 GPT-5.3-Codex,与其他版本相比,它在哪些方面有所改进?

14. OpenAI 正式发布 GPT-5.3-Codex,与其他版本相比,它在哪些方面有所改进?

15. GPT-5.4据传下周上线!200万上下文窗口+持久化状态,告别频繁遗忘

16. GPT-5.4 thinking 写作能力怎么样?

17. 硬碰硬!刚刚,Claude Opus 4.6与GPT-5.3-Codex同时发布

18. 早,一觉醒来又发布两个模型。1、Opus 4.62、ChatGPT 5.3 Codex Opus 这次的升级:• 上下文窗口:Opus系列首次提供100万token(1M) 上下文窗口(测试版)。• 定价:保持不变,输入每百万token5美元,输出每百万token25美元。• 能力升级:提升代码规划/调试/审查、智能体任务续航与自主纠错能力,Office工具(Excel、PowerPoint)和Claude Code同步升级。GPT 5.3 Codex 的升级:• 定位:编程智能体,非通用大模型,整合GPT-5.2推理与GPT-5.2-Codex编程能力。• 速度与效率:单token推理提速25%,同任务token用量减半,上下文 400 万 token(4M,比 Opus 4.6 强)• 基准表现:SWE‑Bench Pro56.8%、Terminal‑Bench 2.077.3%、OSWorld‑Verified64.7%。• 可用性:ChatGPT付费用户已可用(Codex应用/CLI/IDE插件/Web),API访问即将开放。• 安全:OpenAI首个网络安全维度获高等级评级的模型。目前感觉 5.3 更吸引人一些。晚点试试看。

19. GPT-5.4突袭上线:能直接操控电脑,全能无短板,就是有点费钱?

20. Claude Opus 4.6和GPT-5.3-Codex同日发布,谁是编程之王?

21. OpenAI连夜爆出GPT-5.4! 紧急上新GPT-5.3反击谷歌, AI爹味治好了

22. 刚刚,GPT-5.4 突袭上线!百万上下文,AI 操作电脑,首次超越人类!

23. 实测 GPT-5.3-Codex,OpenAI 史上第一个高危模型,连 API 都还不敢给我们

24. AI编程大战白热化:Claude Opus 4.6和GPT-5.3-Codex同一天发布,谁才是真正的王者?

25. 硅谷一夜两弹! GPT-5.3-Codex狙击Claude 4.6, 奥特曼真急了

26. GPT-5.3-Codex突然登场!AI能自己造自己了

27. 【AI前沿】GPT 5.4 有多强?看看vibecoding作品

28. 正面硬刚Claude Opus 4.6,OpenAI 当天发布GPT-5.3-Codex,谁强?

29. 目前的做大需求的工作流:1. 使用 Claude Opus 4.6 编写技术方案文档2. 使用 GPT-5.3-Codex 将文档拆解成一系列小需求3. 使用 GLM-5 逐个开发小需求4. 所有需求开发完毕后,再次使用 GPT-5.3-Codex 进行整体 Review、兜底

30. Anthropic 发布 CS 4.5,在编码基准测试中击败 GPT-5 和 Gemini 2.5 Pro

31. Claude 发布会的全景速览

32. GPT-5.3-Codex实测

33. [Alan の分享] Claude Opus4.6 vs Codex 5.3

34. Claude Opus 4.6 vs GPT-5.3 Codex完全对比

35. 2026 AI 变局

36. 2026 Al 巅峰对决

37. Claude Opus 4.6。每天拆解一个AI大模型

38. 【熟肉】Claude Opus 4.6 对决 GPT-5.3 Codex: 谁是更好的 AI 开发助手? - Greg Isenberg

39. 三款主流AI编程工具对比

40. 72 小时实测 Claude Code 和 Cursor,AI 编程工具选对不踩坑

41. 计算机大学生福利!2025最强AI编程助手ClaudeCode,国内终于能用了!

42. 上手ClaudeCode,看这篇就够了!

43. Claude code用后感

44. Claude Opus 4.5

45. AI编程神器对决

46. GPT-5.3 Codex VS Claude Opus 4.6

47. GPT-5.1-Codex vs Claude Sonnet 4.5

48. 我用Claude Opus 4.6和GPT-5.3 Codex的真实感受

49. 炸裂!凌晨2点两大AI巨头GPT-5.3-Codex vs Claude Opus 4.6 巅峰对决,程序员看完彻底失眠

50. GPT-5.3 Codex vs Claude Opus 4.6

51. Claude、Gemini、ChatGPT 到底谁更强?2026 实测对比

52. 使用 ChatGPT、Claude 和 Gemini 一年后,我的看法是什么?

53. 订阅了4个AI工具只保留了2个——我的多智能体研究工作流分享(Gemini vs Claude)

54. ChatGPT、Claude、Gemini,到底该选哪一个?

55. OpenAI与Anthropic

56. 同在 AI 赛道 两种命运剧本

57. OpenAI 与 Anthropic

58. OpenAI与Anthropic

59. Advisor vs Agent

60. Claude vs ChatGPT

61. 2026 AI 编程实录

62. 两份报告,两种 PMF

63. Burger's AI Notes 10

64. 新研究揭穿Claude底裤,马斯克盖棺定论

65. 豆包打响AI助手“突围战”

66. Claude崩了,全球AI因何“熔断”?

67. 豆包打响AI助手“突围战”:与其孤军挺进,不如抱团协作

68. Claude

69. 为什么说Claude3.5 sonnet好于GPT4O?实为网友们的无耐选择

70. ChatGPT与Claude的对决:7个测试告诉你谁是AI聊天机器人之王!

71. Claude

72. 免费、支持中文、无需注册、直接可用的「ChatGPT最强竞品」——Claude发布!

73. 为什么很多人认为ChatGPT最好的替代工具是Claude?

74. 外媒实测比较ChatGPT与Claude 哪个比较实用?

75. ChatGPT与Claude对比分析

76. Claude与ChatGPT哪家强?Claude 可以做,ChatGPT 却做不到的 4 件事

77. Claude Opus 4.6 vs GPT-5.3-Codex!谁才是新王!

78. Anthropic 2028年盈利,OpenAI同年亏740亿:两家AI巨头的命运分叉

79. 🔥 2026年AI编程王炸对决:Claude Opus 4.6 vs GPT-5.3-Codex,开发者该怎么选?

80. 重磅!Claude Opus 4.6 和GPT-5.3 Codex 同一天发布,龙虎斗,谁更强?

81. AI盈利战大反转!Anthropic2028年收支平衡,OpenAI亏780亿?

82. 2026年AI多模态能力实测:GPT-5.2 vs Claude 4.5 vs Gemini 3图像/视频/音频处理全方位对比

83. 2026编程模型:GPT-5.3-Codex还是Claude Opus 4.6?最全实测报告

84. 重磅发布!Claude Opus 4.6 亮点解析

85. OpenAI和Anthropic年终报告对比:企业AI的两种未来

86. AI霸主之争:OpenAI赢下普罗大众 Anthropic却率先征服了企业钱包?

87. OpenAI 卖货做视频,Anthropic 专心写代码,谁能赢?

88. 2026 年 AI 大混战Claude、GPT、Gemini 谁才是真王者?看完你就懂了

89. Claude Opus 4.6 发布,全线碾压 GPT-5.2,一文详解

90. Claude Code 重磅更新:Sonnet 4.5 登顶编码基准,Claude Code 2.0 赋能下一代 Agent

91. Claude Opus 4.6:Anthropic 最强模型的又一次飞跃

92. Gemini、ChatGPT、Claude、Grok对比与镜像推荐

93. ChatGPT 5.4:9项实测 vs Claude|到底该用哪个?

94. OpenAI深夜放出「编程核弹」:GPT-5-Codex 正式发布,能独立爆肝7 小时

95. OpenAI发布其最强模型GPT-5.4,直指Anthropic核心市场

96. Claude Opus 4.6 完整指南|Agent团队功能实测,6分钟构建项目管理系统

97. 以Anthropic为例|AI行业共性风险:隐性成本会稀释收入价值,收入规模不代表盈利能力,AI公司的盈利路径比想象中更复杂

98. OpenAI砸5000亿自建数据中心,Anthropic靠500亿云计划:AI【中英字幕】

99. Claude 4.5 vs ChatGPT:2026年AI助手终极对决,谁更适合你?

100. OpenAI的低调对手,或许手握更优商业模式

101. ChatGPT、Gemini、Claude 到底怎么选?

102. Claude Opus 4.6震撼登场:超越人类程序员,成本降低70%

103. LLM测试2026:五大实战新趋势深度解读

104. OpenAI 和 Anthropic 拥抱不同的商业模式

105. 【2025年11月】Claude Sonnet 4.5 国内最新使用指南|Anthropic 世界上最好的编码模型

106. Anthropic Claude Opus 4.5 重夺编程王冠

107. Claude真的比ChatGPT香!实测对比来了

108. Claude4.5发布,首款AI操作系统上线!实测

109. DeepSeek V4:中国AI在编程领域超越ChatGPT和Claude?

110. OpenAI推出更擅长AI代理编码的GPT-5-Codex,与Claude code有何区别?国内怎么使用到Codex呢?

111. claude-code 国产glm替代方案

112. GPT-5-Codex剑指coding王座,Claude何去何从

113. Claude的含金量还在上升

114. OpenAI为Codex升级,推出新版GPT-5

115. GLM4.6发布,Coding Plan居然可直接使用!

116. GPT‑5-Codex 发布:OpenAI 的 Claude Code

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章