Grok 4数学推理首超GPT-5,但日常对话错误率翻倍:2026年三款大模型谁更值得选?

源自129位全网作者

04-09 11:58

内容由AI生成

精选参考来源

1. 硅谷一夜两弹! GPT-5.3-Codex狙击Claude 4.6, 奥特曼真急了

2. 如何评价OpenAI最新发布的GPT-5.4 mini和GPT-5.4 Nano?

3. GPT-5.4 mini——让AI从“奢侈品”变“快消品” OpenAI的GPT-5.4 mini/nano是AI界的“价格屠夫”——把AI从顶级会所搬到便利店,从82年拉菲变罐装快乐水。 价格表震撼:GPT-5.4旗舰输出15美元/百万token,mini只要4.5美元(三折),nano仅1.25美元(骨折价)。以前用大模型钱包发抖,现在用nano像刷短视频流量——便宜到任性。 性能几乎没缩水。mini在编程基准SWE-bench Pro拿54.4分,仅比旗舰57.7差3.3点——差距小如米其林和大牌档,价格差十倍。OSWorld测试中,mini拿72.1分近人类基线72.4,能当“数字白领”。 技术是动态稀疏架构:只激活任务所需参数,算力用在刀刃。像大厨做饭,以前整支团队动,现在只动手,其他休息省电。 AI服务分层明码标价:免费层(ChatGPT用mini)、经济层(API调用nano)、尊享层(旗舰深度推理)。AI像手机流量包按需用:轻度用户“5元包月”,重度“无限流量”。 边缘设备AI化是新蓝海。nano小到塞进智能手表、扫地机器人、车载系统,AI从云端走向指尖。想象手表回消息,扫地机避拖鞋——本地运行,隐私无忧。 但快消化带来AI过载焦虑。以前担心用不起,未来担心忍不住乱用——每天刷百万token,月底账单如流量超支。可能出“AI省流助手”,提醒“今日用20万token,切文字模式?” GPT-5.4 mini/nano标志AI从“实验室奢侈品”转“大众快消品”。当算力成本非门槛,创造力才是稀缺资源。未来考验的不是你有没有AI,而是你如何用好AI。 数据来源:OpenAI发布文档,SWE-bench Pro、OSWorld-verified基准测试,API定价公开数据。#微博影像年##微博旅行家##ai创造营#

4. 盘点一周AI大事(11月23日)|AI自己画CAD图纸 Google发布最强大模型Gemini 3、最强图像模型Nano Banana Pro OpenAI发布最强编码模型GPT-5.1-Codex-Max 马斯克升级Grok 4.1,情商最强 字节开源最强空间重建模型Depth Anything 3 腾讯发布最强开源视频模型HunyuanVideo-1.5 Meta开源最强对象分割模型SAM 3,最强3D分割模型 SAM 3D Autodesk研发出最强CAD智能体VideoCAD AI2发布最强开源深度研究智能体Deep Research Tulu Google发布最强AI天气预报WeatherNext 2 Maxima推出AI会计智能体 头号玩家套装问世 #AI新星计划 #人工智能 #AIGC #OpenAI #大模型

5. OpenAI 发布 GPT-5.4,定位为专业工作场景的旗舰模型,同步推出面向高复杂任务的 GPT-5.4 Pro 版本。这次发布的最大亮点是 GPT-5.4 成为 OpenAI 首个原生支持"电脑操控"(Computer Use)的通用模型——也就是说,它可以像人一样通过截图、点击鼠标、敲击键盘来操作真实的电脑界面。在 OSWorld-Verified 桌面操控测试中,GPT-5.4 以 75% 的成功率超过人类(72.4%),而上一代 GPT-5.2 只有 47.3%。在知识类工作方面,GPT-5.4 在涵盖 44 种职业的 GDPval 基准测试中,与行业专业人士打平或胜出的比例达到 83%,GPT-5.2 的这一数字是 70.9%。投行建模任务的内部评测得分从 68.4% 跳升到 87.3%,生成演示文稿的效果在人工评审中有 68% 的概率优于前代。编程能力上,GPT-5.4 整合了此前专为写代码设计的 GPT-5.3-Codex 的能力,在 SWE-Bench Pro 上得分 57.7%,与 GPT-5.3-Codex 的 56.8% 相当,但延迟更低。另一个实用改进是"工具搜索"(Tool Search):以往给模型配备大量外部工具时,所有工具定义都要塞进提示词里,动辄消耗数万个 token。GPT-5.4 改为按需查找工具,在测试中将 token 消耗减少了 47%,对于依赖大量 MCP 工具的开发者来说成本节省明显。在 ChatGPT 中,GPT-5.4 Thinking 将支持在生成过程中展示思考计划,用户可以中途介入调整方向——不用等模型跑完再重新来过。定价方面,API 输入价格从 GPT-5.2 的每百万 token 1.75 美元涨至 2.50 美元,输出价格从 14 美元涨至 15 美元。GPT-5.4 今天起向 ChatGPT Plus、Team、Pro 用户开放,取代 GPT-5.2 Thinking 成为默认推理模型,GPT-5.2 Thinking 将在三个月后于 2026 年 6 月 5 日正式退役。

6. OpenAI大溃败!GPT-5「换皮」GPT-4o,两年半预训练0突破

7. GPT-5.4:OpenAI做了个Kimi K2.5 +MiniMax M2.5?

8. GPT-5.4深夜发布,最适合OpenClaw的天选模型登场了。 深夜凌晨2点,我刚准备睡觉。 然后,GPT-5.4,突然发布。 一下子激动的睡不着了。 真的,这真不是我天天咋咋呼呼啥的,我真的也很少会用激动的睡不着觉这种表述。 这是因为,我一直在等正式版的GPT-5.3或者GPT-5.4,来作为我的OpenClaw的首选模型。 理由特别简单,因为现代世界三十年,本质上基层都是代码,我们现在看到的关于计算机和互联网的一切,几乎都建立在代码的基础之上。 所以你可以理解为,代码能力,在很多时候,就代表着Agent能力的一根粗壮的腿。 一个优秀的Agent基座模型,在我的理解里,一般来说,需要三种都很强: 代码能力、世界知识、多模态理解。 当你这三个都能SOTA的时候,你几乎必然就是最牛逼的Agent模型,当然,还有一个重要的因素,就是价格。 在过去,Claude Opus 4.6,几乎就是Agent模型的代名词,因为代码、世界知识都很强,多模态能力虽然比不过Seed 2.0和Gemini 3.1 Pro,但是在一些场景里面,也够了,因为现在的Agent,跟现实物理交互还没有那么多,那个已经是具身智能的范畴了。 而我过去很喜欢的GPT-5.3-Codex,代码能力确实强,在做任务执行的时候,那简直就是指哪打哪。 但是最大的问题,这玩意是一个编程特化模型啊,世界知识就是一坨屎,连GPT-5.2都不如,所以OpenAI当时也是没办法,为了跟Claude打一打,只能加个Codex的后缀给放出来了。 所以你会发现,在规划能力上,是完全比不过Claude Opus 4.6的,但是最大的问题,其实还是因为世界知识的问题,就导致这玩意。 它说天书,讲的那些话,真的,我不是程序员出身,我看那个话,看的就真的超级费劲。 就比如说,我让他之前对我的一个AI热点网站的项目进行审查,主要就是review一下我的文档规范和我整个代码库。 然后,这哥们写的文档,我尼玛。。。 你再对比一下Claude Opus 4.6写的。 对比起来应该一目了然。。。 就是因为这玩意不说人话,世界知识也不行,所以,只是在Codex里面用用还好,但是你要是把它接到你的OpenClaw里面,去当做默认模型,你就知道啥叫灾难了,这哥们几乎没有人味,说起话来我想揍他。 所以我当时试了一下,就直接弃了,还是在我的OpenClaw里面,用的Claude Opus 4.6和Sonnet 4.6,做了一下场景调用。 那为啥说,我很期待GPT-5.4呢。 因为,Claude哪都好,但是,它贵啊!!! 它真的好贵啊!!!!!! 而且因为Anthropic这个呆逼,它把OpenClaw给疯了,所以我订阅的Claude的Max Plan的额度,是完全不能给OpenClaw用的,只能在Claude Code用,你想在OpenClaw上用,只能硬接API Key用。 但是大家都知道,Claude的API有多贵,那根本不是我们这种穷逼团队能用的起的,小规模用用还好,大规模用那公司直接破产了。 之前还有一条路是用反代,把Google家的Antigravity里面的Claude额度用插件代理出来,扔给OpenClaw用。 但是后面Google开始大批量封号,导致也没办法用了。 我过年的时候Google账号还被封了,被迫用AI去给Google写了一份声泪俱下的邮件。 我说我错了,我再也不会了。 后面Google才给我解封,但是反代肯定是用不了了。 而OpenAI就不一样了,最开始Claude疯狂封OpenCode账号的时候,OpenAI大手一挥,就站了出来,说我们不封,大家全力使用。 这是御三家里,唯一一个这么支持态度的,可以用第三方的工具,调用Codex的额度的。 那对OpenClaw自然也不例外了,也是几个顶级模型里面,为数不多的,可以直接走登录的,其他的都得用API。 真的,OpenAI这回真的是大善人。 还疯狂的给Codex加额度。 所以啊,Claude在OpenClaw里用,好是好,但是不能用订阅额度,只能用API,贵的一笔。 OpenAI的模型倒是可以用订阅额度,但是GPT-5.2代码又不行,GPT-5.3-codex又不说人话。 你看,要多别扭有多别扭。 而这一次,GPT-5.4来了!!! 终于把这个短板给补上了! 代码能力跟GPT-5.3-Codex齐平,世界知识比GPT-5.2还要强,还能使用订阅额度,20刀就可以用的超级爽。 你就说,这不是最适合OpenClaw的天选模型,还有谁是?嗯? 从今天开始,用OpenClaw的,都把默认模型切换到GPT-5.4去,真的,信我。 回到GPT-5.4,老规矩,先看跑分。 就很爽。 先看最关键的几个。 GDPval:83.0% 这个是测AI在真实工作任务中表现的,包括金融、法律等44种职业的知识工作。 GPT-5.4 Thinking拿了83.0%,Claude Opus 4.6是78.0%,GPT-5.3 Codex是70.9%。 在真实业务场景里,GPT-5.4不只是会写代码,它还能跟你聊业务、聊金融、聊法律、聊各种专业领域的东西。 而且是用人话聊,不是用天书聊。 SWE-Bench Pro:57.7% 这个是测AI解决真实软件工程问题的,不只是Python,而是测四种编程语言。 GPT-5.4 Thinking拿了57.7%,GPT-5.3 Codex是56.8%。 基本持平。 这就是我最想看到的结果。 代码能力保住了GPT-5.3 Codex的水平,世界知识又补上来了。 OSWorld-Verified也是,75.0%。这个是测AI操作电脑的能力的,就是让AI像人一样,用鼠标点击、用键盘输入、在不同应用之间切换,完成各种任务。 GPT-5.4 Thinking拿了75.0%,超过了Claude Opus 4.6的72.7%,也保持了跟GPT-5.3-Codex的持平。 而且,GPT-5.4操作电脑的速度,快的离谱。 看下这个没有加速过的视频,会更直观。 ToolAthlon:54.6% 这个是测AI使用工具的能力的,也就是Agent能力的核心指标之一。 GPT-5.4 Thinking拿了54.6%,Claude Sonnet 4.6是44.8%。 差了将近10个点。 至于学术知识之类的,跟GPT-5.3-codex就没法比了,因为OpenAI自己也知道,所以,直接当时就没跑。 总之,翻译成大白话就是。 GPT-5.4 = GPT-5.3 Codex的代码能力 + 比GPT-5.2还强的世界知识 + 更强的工具使用能力 + 超级便宜的codex额度。 这四样加在一起,就是一个完美的OpenClaw天选基座模型。 然后还有几个很棒的特性更新: 1. 100万token的上下文窗口。 这是GPT-5.4的一个大升级。 之前GPT-5.3的上下文窗口是40万token,GPT-5.4直接翻了一倍多,到了100万。 这对Agent来说太重要了。 因为Agent在执行任务的时候,需要保持对整个任务的上下文理解。如果上下文窗口不够大,Agent干着干着就会忘事儿,前面说的东西后面就不记得了。 100万token,基本上足够应对绝大部分的Agent任务了。 当然,OpenAI也不傻,他们说,超过27万token之后,你的额度就算两倍了。 不过因为Codex给的额度实在是太多太多了,所以即使是2倍,其实也还好。 2. 原生计算机使用能力。 这个是GPT-5.4的另一个大卖点。 OpenAI说,GPT-5.4是他们第一个内置原生计算机使用能力的主线模型。 它在编写通过Playwright等库操作计算机的代码方面表现非常的出色,同时也能根据屏幕截图发出鼠标和键盘命令。 也就是代码和视觉齐飞,我感觉,这个小龙虾接入以后,就真的可以,直接用视觉,操控你电脑上绝大多数的软件了,真的,原生操控,想想都激动。 他们基于此,还发布了一个新的skills,叫playwright-interactive。 允许Codex同时以代码和视觉的两种方式,调试Web和Electron应用。 网址在此,大家可以自行安装。 http://t.cn/AXVAqO5O 3. 支持了工具搜索。 以前呢,当模型被赋予工具时,所有工具定义都会预先包含在提示中。 对于拥有大量工具的系统,这可能会为每个请求增加数千甚至数万个token,而且绝大多数的时候,都毫无意义,平白无故的导致成本上升、响应变慢,并在上下文中充斥模型可能永远不会使用的信息。 所以呢,这次他们也支持了工具搜索,就是GPT‑5.4不再直接接收完整工具定义,而是接收一份可用工具的轻量列表以及工具搜索功能。 当模型需要使用某个工具时,它可以查找该工具的定义并在当时将其追加到对话中。 就非常像Skills渐进式呈现的方式,目的很简单,还是优化上下文工程。 OpenAI在自己测试完以后,发现工具搜索配置在保持相同准确率的同时将总体token使用量减少47%,这个就非常牛逼了。 GPT-5.4 Thinking大概就是这样。 这次他们其实还发了个GPT-5.4 Pro,我就不细说了,反正就是一切都更牛逼了,但是对于大多数人来说,太贵了,也没啥大用,必须得200刀的Pro会员才能用。 API的整体价格还是得说一下,虽然大家大概率用的都会是订阅的额度。 相比于GPT-5.2,价格是涨了的,但是还是比Claude Opus 4.6,便宜不少,Claude Opus 4.6的价格是$5/$25每百万token(输入/输出),GPT-5.4只有他们一半。 目前ChatGPT已经上线了。 Codex也已经支持了,我自己在Codex里面粗浅体验了一下。 首先扑面而来的,那自然是清新沁人的人话。。。 比如我让它去把OpenAI官网的视频给扒拉下来,你看看这个发言:“这种活最烦”,“省的跟Cloudflare互相折寿”。。。 还有这个。 真的,Codex的输出,我真的能看得懂了。。。 做出来的东西,前端审美有了不错的进步,但还是不如Opus 4.6和Gemini。 写作粗略测了一下,还是一股子莫名其妙的爱用排比句的诡异的味道。 奇奇怪怪。 然后有点可惜的就是,我等到了凌晨6点多,OpenClaw目前使用Codex登录的方式,还是没有支持GPT-5.4。 这就导致,我还是没有机会测GPT-5.4在小龙虾上的效果。 不过估计今天小龙虾就支持了。 因为社区里已经看到很多用户在催了,而且先行官们,都普遍反馈效果很好。 坐等支持,我真的已经迫不及待了。 又是开心的一晚。 如果你也在用OpenClaw,那记得OpenClaw支持了以后,把默认模型切换到GPT-5.4。 如果你还没用过OpenClaw,那正好,现在是一个很好的开始时机。 毕竟,有了GPT-5.4这个天选模型,体验只会更好。 2026年,真是疯狂的一年啊。 #how i ai##AI[超话]##科技先锋官##ChatGPT[超话]##gpt5# http://t.cn/AXVAqYKj

9. OpenAI连夜爆出GPT-5.4! 紧急上新GPT-5.3反击谷歌, AI爹味治好了

10. GPT‑5.4深夜发布,百万网友“养”的龙虾,终于有了灵魂

11. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

12. Gemini 3实现智能水平断层碾压。Artificial Analysis智能指数73分(行业平均42分),在Humanity's Last Exam等基准测试中刷新纪录。核心突破在于生成式UI,可创建交互式界面和微型应用,从"回答问题"跃升至"生成体验"。原生多模态能力无缝处理文本、图像、视频、音频,并集成Nano Banana图像模型;支持100万token超长上下文。智能体能力实现自主规划与多工具协同,代码生成在SWE-bench达76.2%,搭配Antigravity平台构建自动化编码代理。响应速度达128 tokens/秒,但输出成本较高。Gemini 3无疑是当前最强大脑,适合需要顶尖推理和企业保障的场景;Grok 4.1以2M上下文和超低成本称王,适合海量文本处理;ChatGPT 5.1仍是均衡的通用选择,生态最成熟;国内Kimi K2在开源和Agentic方向独具特色,适合定制化部署#Gemini3凭什么被称为最强AI#

13. 中门对狙!Claude Opus 4.6和GPT-5.3 Codex同时发布,这下真的AI春晚了。

14. #Google发布Gemini3.1Pro##过个有AI年##HOW I AI#美国AI大模型也加入春节大战!科技巨头Google更新了自家的大模型——Gemini 3.1 Pro,距离Gemini 3 Pro 上线仅三个月。Gemini 3.1 Pro这次升级的核心卖点是推理能力翻倍,但价格不变。在评估模型解决全新逻辑模式的ARC-AGI-2测试中,Gemini 3.1 Pro得分达77.1%,较Gemini 3 Pro的31.1%提升超一倍,显著领先Claude Opus 4.6(68.8%)和GPT-5.2(52.9%)。定价与 Gemini 3 Pro 完全一致。200k token 以内输入 $2/百万 token,输出 $12/百万 token;超过 200k 则为 $4/$18。能力大幅提升但价格不变,性价比明显提高。对比参考:Claude Opus 4.6 为 $5/$25,GPT-5.2 为 $1.25/$10。不过,Gemini 3.1 Pro被部分用户反馈性能不均衡,基准测试和真实体验有落差。不过考虑到目前仅是预览版,后面稳定版将会进一步优化。#老张聊科技#

15. 双冠封神!Grok 4.1横扫大模型竞技场​,1483 Elo高分,写作能力直逼GPT 5.1

16. #Google发布Gemini3.1Pro# 几乎同时马斯克旗下xAI发布Grok-3和谷歌DeepMind发布Gemini 3.1 Pro。这两款模型之间不知道新秀的乱拳厉害还是老师傅的筋骨更坚韧,不过当前AI市场格局正在悄然的变化着已经是越发明显了。谷歌凭借生态优势抢占全场景赛道,xAI则以免费策略和马斯克的影响力快速圈粉。Gemini 3.1 Pro主打多模态全能性,集成视频、音乐生成功能,深度适配移动端,交互流畅,但在专业推理场景的针对性不足。Grok-3依托十万级H100 GPU集群,思维链推理能力突出,数学、科研场景表现优于前者,且具备DeepSearch实时检索功能,不过多模态稳定性欠佳,图像处理能力有限。Gemini 3.1 Pro聚焦复杂问题解决者,主打全场景落地,兼顾消费级与专业级需求,侧重软硬件生态联动。Grok-3以追求事实真相为核心,主打免费开放的普惠路线,深度绑定X平台,侧重实时信息整合与高效推理,瞄准大众用户与科研爱好者。#过个有AI年##HOW I AI#

17. 硬碰硬!刚刚,Claude Opus 4.6与GPT-5.3-Codex同时发布

18. #Gemini3有哪些新功能#从“回答问题”到“搞定一切”,谷歌这款新模型直接把实用度拉满!原生支持文字、图像、视频、音频全模态输入,100万token超长上下文能装下700页书,不管是解析学术论文、生成交互式学习卡片,还是分析比赛视频出训练计划,都能轻松hold住。 推理力更是断层领先!GPQA Diamond 91.9%准确率+MathArena 23.4%高分,Deep Think模式连博士级难题都能拆解得明明白白,日常办公算贷款、做科研析数据都靠谱。开发者狂喜的是全新AI IDE Antigravity,一句话就能生成完整航班追踪APP,代码自动验证还能跨工具协同,SWE-bench Verified 76.2%的修复率堪比专业程序员👏

19. Claude Opus 4.6 vs GPT-5.3-Codex,到底谁更强?

20. #Google发布Gemini3.1Pro#Gemini3.1 Pro在核心推理能力上更进一步。 在ARC-AGI-2(一个评估模型解决全新逻辑模式能力的基准测试)测试中,3.1 Pro获得了77.1%的验证分数,在推理表现上达到3 Pro的2倍。 其他专业领域都有突破: 学科知识:在 GPQA 钻石级测试中得分为 94.3%; 编码:在 LiveCodeBench Pro 上 Elo 得分为 2887,在 SWE-Bench Verified 上得分为 80.6%; 多模态理解:在 MMMLU 测试中达到了 92.6%。 即日起,3.1 Pro 将陆续上线。#过个有AI年##HOW I AI#

21. OpenAI 推出了 GPT-5.4 mini 和 nano,这是我们迄今为止功能最强大的小型型号。GPT-5.4 mini 的速度比 GPT-5 mini 快 2 倍以上。针对编码、计算机使用、多模态理解和子智能体进行了优化。对于较轻的任务,GPT-5.4 nano 是我们最小、最便宜的 GPT-5.4 版本

22. Claude Opus 4.6和GPT-5.3-Codex同日发布,谁是编程之王?

23. 干翻 GPT-5.4!MiroThinker 升级「重型推理」,AI 学会了自我验证

24. OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了

25. #Google发布Gemini3.1Pro# 2 月 19 日,Google 就发布了 Gemini 3.1 Pro,从第三方评测机构 Artificial Analysis 的数据看,Google 重新拿回了综合智能指数的榜首。3.1 Pro 最大的亮点在推理。ARC-AGI-2(测试模型解决全新逻辑模式的能力)得分从 Gemini 3 Pro 的 31.1% 跳到 77.1%,翻了一倍多。对比竞品:Claude Opus 4.6 得分 68.8%,GPT-5.2 为 52.9%。Humanity's Last Exam(高级学术推理)上 3.1 Pro 得分 44.4%,也高于 GPT-5.2 的 34.5% 和 Claude Sonnet 4.6 的 33.2%。GPQA Diamond(科学知识)拿到 94.3%,同样是所有模型最高。#过个有AI年##HOW I AI#

26. OpenAI要跳过5.3,直接迈向GPT-5.4了?

27. Google 发布 Gemini3.1Pro 模型,它在技术上有哪些亮点和突破?

28. 刚刚,奥特曼砸场发布 GPT-5.4!网友:一句 Hi 烧掉 80 美元

29. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

30. AI编程大战白热化:Claude Opus 4.6和GPT-5.3-Codex同一天发布,谁才是真正的王者?

31. 刚刚,GPT-5.1发布,OpenAI开始拼情商

32. 【#GPT5.4mini与nano登场#:低延迟、性能逼近满血版】#OpenAI发布最强AI小模型# OpenAI 公司昨日(3 月 17 日)发布公告,宣布推出迄今最强大的小型模型 GPT-5.4 mini 与 GPT-5.4 nano,专为高频且对延迟敏感的任务设计。官方强调,在代码助手、系统截图解析以及实时图像推理等对延迟要求极高的场景中,响应迅速且能可靠调用工具的小型模型往往比大型模型更具优势。这两款模型不仅继承了 GPT-5.4 的诸多优势,还专门针对高频工作负载优化,目的通过更快的响应速度和更高的效率,来提升产品体验。GPT-5.4 mini 在编写代码、逻辑推理、多模态理解以及工具调用方面的表现远超 GPT-5 mini,同时运行速度提升了 2 倍以上。此外,它在 SWE-Bench Pro 和 OSWorld-Verified 等多项基准测试中,成绩已经逼近体积更大的 GPT-5.4 模型。凭借极低的延迟,GPT-5.4 mini 特别适合需要快速迭代的代码工作流,能够高效处理精准编辑、代码库导航及前端生成等任务。在多模态领域,它也能迅速解析密集的电脑用户界面截图,出色完成各类计算机操作任务。GPT-5.4 nano 则是目前体积最小、价格最亲民的版本。作为 GPT-5 nano 的重大升级版,它专为将速度和成本视为首要考量的任务而生。开发者可以将其广泛应用于文本分类、数据提取、内容排序,以及处理简单辅助任务的代码子代理(Subagents)中。(IT之家)

33. 早,一觉醒来又发布两个模型。1、Opus 4.62、ChatGPT 5.3 Codex Opus 这次的升级:• 上下文窗口:Opus系列首次提供100万token(1M) 上下文窗口(测试版)。• 定价:保持不变,输入每百万token5美元,输出每百万token25美元。• 能力升级:提升代码规划/调试/审查、智能体任务续航与自主纠错能力,Office工具(Excel、PowerPoint)和Claude Code同步升级。GPT 5.3 Codex 的升级:• 定位:编程智能体,非通用大模型,整合GPT-5.2推理与GPT-5.2-Codex编程能力。• 速度与效率:单token推理提速25%,同任务token用量减半,上下文 400 万 token(4M,比 Opus 4.6 强)• 基准表现:SWE‑Bench Pro56.8%、Terminal‑Bench 2.077.3%、OSWorld‑Verified64.7%。• 可用性:ChatGPT付费用户已可用(Codex应用/CLI/IDE插件/Web),API访问即将开放。• 安全:OpenAI首个网络安全维度获高等级评级的模型。目前感觉 5.3 更吸引人一些。晚点试试看。

34. 【阿里发布新旗舰模型Qwen3-Max-Thinking 真的可以媲美GPT-5.2么?】阿里发布新模型Qwen3-Max-Thinking 称媲美GPT-5.2 AI应用入口争夺升温之际,阿里更新大模型。1月26日,阿里发布旗舰级文本模型Qwen3-Max-Thinking,总参数量超万亿(1T),预训练数据量达36T Tokens,已开放企业API调用、个人用户PC端和网页端试用,后续将接入千问APP。据介绍,Qwen3-Max-Thinking采用“测试时扩展”(Test-time Scaling,简称TTS)机制,相比于此前重复并行推导得出最优结果,TTS机制下,模型会总结提取历史推理内容作为经验素材,用于下一步结果输出,提升推理能力。阿里提供的测试结果显示,考虑到TTS情况下,Qwen3-Max-Thinking在科学知识测试“GPQA Diamond”、数学推理测试“IMO-AnswerBench”、代码编程测试“LiveCodeBench”、搜索工具调用测试“Humanity’s Last Exam(with Search)”上表现均领先于GPT-5.2、Gemini 3 Pro,但在函数调用测试“τ²-Bench”和综合知识测试“Humanity’s Last Exam”上仍逊于Gemini 3 Pro,在代码排错测试“SWE-bench Verified“上弱于GPT-5.2。

35. 更会聊天、主打情绪价值,OpenAI 发布 GPT-5.1

36. GPT-5.4 到底变强了多少?三大核心能力+电脑操控Codex上手实测!

37. #GPT5.4来了#这款新模型最牛的是解锁原生电脑使用能力,能像人一样操控键鼠、识别UI,发邮件、填表格、做报表样样行,OSWorld-Verified成功率75%超人类,直接把办公效率拉满。视觉感知也拉满,支持千万级像素图像输入,文档解析、图像理解能力大幅提升,幻觉率还暴降33%,是OpenAI最讲事实的模型。不过实力配得上身价,GPT-5.4定价大涨,Pro版聊句嗨就能花80美元。但它真正恐怖的是全维度无短板,推理、编程、视觉、办公全拉到顶尖,向AGI大步迈进。OpenAI这波操作,直接把AI办公卷到新高度,看来打工人的职场危机,真的来了! #科技先锋官# gpt5.4来了

38. OpenAI凌晨发布GPT-5.1, 全网呼唤的人味儿回来了

39. GPT-5.4突袭上线:能直接操控电脑,全能无短板,就是有点费钱?

40. OpenAI发布GPT-5.4 mini与nano,以更低成本逼近旗舰模型性能

41. 刚刚,GPT-5.4 突袭上线!百万上下文,AI 操作电脑,首次超越人类!

42. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

43. 年底的大模型圈,从来不是收官,而是互相加码。就在大家还在消化上一波发布时,谷歌又丢出一个新模型:Gemini 3 Flash。现在 Gemini 的路线已经分得很明白:3 Pro 负责低频但极复杂的深度推理,3 Flash 则是高频、低延迟、偏 Agent 和工程场景的小模型,用来跑大量实时任务。但它不是 Pro 的缩水版,而是另一条线。在 SWE-bench Verified 这类偏真实工程测试里,Gemini 3 Flash 拿到 78%,不仅明显甩开 2.5 系列,在部分工具调用和指令遵循维度,甚至逼近甚至反超 3 Pro。放到更大的战局看,这已经是 GPT vs Gemini 的路线分歧:一边继续堆顶级智能,一边用速度、成本和生态压到默认层。接下来就看谁更受用户欢迎了。你现在更常用谁,GPT 还是 #gemini# ?

44. 谷歌发布 Gemini3.1Pro,能否重夺 AI 领域「王座」?

45. 今天很多人都在发 Claude Mythos Preview 的 SWE-bench 跑分,记得前一阵 Cursor 那篇 benchmark 文章,其实已经把 SWE 局限性说得比较清楚了。SWE-bench 这类指标的参考价值正在下降,因为它和真实代码场景的差距越来越明显。SWE dataset 本质上还是高度结构化、边界清晰的修复题,和真实开发中那种要读上下文、跨文件修改、理解历史代码、排查环境问题的工作,不是一回事。而且它主要关注 bug 修复和测试跑通,但真实工程的关注点远不止这些,还包括性能、安全、可维护性等。再加上数据污染 / benchmark leakage 的风险一直存在,模型分数未必能真实反映它在陌生工程环境中的泛化能力。

46. 【AI前沿】GPT 5.4 有多强?看看vibecoding作品

47. #谷歌Gemini3.1Pro正式发布# 谷歌于今日正式推出升级核心模型Gemini 3.1 Pro。其实现了推理能力的跨越式升级,ARC-AGI-2测试得分达77.1%,较上代翻倍且大幅领先竞品。学术科研能力行业登顶,GPQA Diamond科学测试拿下94.3%高分,博士级专业处理能力突出。 与此同时,Gemini 3.1 Pro编程与智能体能力跻身第一梯队,竞赛级编程表现领跑,工程代码修复比肩顶尖水平,长链任务能力近翻倍。同时支持百万token上下文,全模态原生理解,可高效适配科研、开发等全场景复杂任务。

48. #GPT5.4来了#GPT-5.4正式上线,百万上下文+原生电脑操控,推理、代码、工具调用全面拉满,AI从“聊天工具”变成了“数字员工”。 未来普通人也能用AI完成跨软件全流程工作,效率翻倍,但门槛与成本依然偏高,国内大模型若能在易用性、本土化上追上,完全有机会错位竞争。AI不是取代人,而是帮人把时间花在真正有价值的事上。

49. GPT-5.4 从 25.6 万个词元增加到 100 万个词元时,检索准确率下降了 54%。Opus 4.6 下降了 15%。现在,各大人工智能实验室都声称拥有百万级令牌上下文窗口。GPT-5.4 八天前发布时就宣称拥有百万级令牌上下文窗口。Gemini 3.1 Pro 也已经实现了这一目标。但是,规格表上的数字和实际可用的数字却是两回事。此图表使用 OpenAI 自家的基准测试工具 MRCR v2。它将 8 条相同的信息隐藏在一段庞大的对话中,并要求模型找到其中一条特定的信息。这本质上是对“能否在 75 万字的文本中找到所需信息”的压力测试。在 25.6 万代币的情况下,各模型的准确率相当接近。Opus 4.6 的准确率为 91.9%,Sonnet 4.6 为 90.6%,GPT-5.4 为 79.3%(根据图表脚注,平均值取自 12.8 万至 25.6 万代币)。但当代币数量增加到 100 万时,各模型的准确率曲线就出现了显著差异。GPT-5.4 的准确率骤降至 36.6%,正确率约为三分之一。Gemini 3.1 Pro 的准确率也降至 25.9%。Opus 4.6 的准确率则保持在 78.3%。研究人员称之为“上下文腐化”。Chroma 在 2025 年测试了 18 个前沿模型,发现随着输入长度的增加,每个模型的性能都下降了。大多数模型的性能呈指数级衰减,而 Opus 几乎不受影响。接下来是定价问题。今天的公告彻底取消了长上下文溢价。现在,一个 90 万个代币的 Opus 4.6 请求与一个 9 千个代币的请求的单价相同,即每百万个代币 5 美元/25 美元。而 GPT-5.4 对超过 27.2 万个代币的请求仍然收取 2 倍输入费用和 1.5 倍输出费用。也就是说,你为了一个在完整上下文中只有大约三分之一的概率能正确检索信息的模型支付了更高的费用。对于任何构建需要运行数小时、处理数百页法律文件或在单个会话中加载整个代码库的代理程序的人来说,唯一重要的数字是模型是否真的能找到你输入的内容。当令牌数量达到 100 万时,这些模型之间的差距就变得非常大了。

50. 谷歌Gemini 3.1 Pro推理分数翻倍,幻觉率继续下降,价格不变,又要重回王座?市值一夜上升超千亿元2025年11月,谷歌发布的Gemini 3 Pro曾短暂封王,但很快就被OpenAI和Anthropic的新模型挤下了宝座。AI世界的王座更替,比手机发布会还快。就在2026年2月19日深夜,谷歌带着名为“Gemini 3.1 Pro”的新模型杀了回来。官方数据看着挺吸引人:在一项衡量AI解决全新逻辑问题能力的“怪考题”ARC-AGI-2上,Gemini3.1 Pro的得分直接翻了一倍多,冲到77.1%。第三方机构Artificial Analysis的测试也显示,Gemini3.1 Pro的综合智能指数已经悄悄爬到了第一,把Claude Opus 4.6甩在了身后。#人工智能 #

51. Grok 4.20与 GPT-5.4 family对比(latest as of April 2026)

52. GPT-5.4 vs Opus 4.6 vs Gemini 3.1

53. OpenAI 祭出 GPT-5.4,可直接用!

54. GPT-5.4 vs Claude 4.6 vs Gemini 3.1 Pro

55. Anthropic发布Claude Opus 4.6

56. Claude-Opus-4.6中文测评出炉

57. Claude Opus 4.6

58. Claude Opus 4.6 发布

59. Anthropic发布了Claude Opus 4.6,支持100万标记的上下文

60. 马斯克旗发布最新AI对话模型Grok 4.1,主打情感智能,位居第一

61. xAI最新模型Grok 4.1代理API

62. grok4.1 🆚 GPT5.1

63. Grok 4.1 发布!霸榜各大榜单

64. 刚刚,马斯克悄悄干了件大事

65. Grok 4.1 双模式设计

66. 刚刚、Grok 4.1登顶大模型排行榜

67. Grok 4.1 正式发布:情感智能与创意写作的新标杆

68. Grok 4.1强势上线!超越所有对手,拿下LMArena排行榜第一,事实性幻觉大幅下降

69. 更新|xAI低调免费推出Grok4.1登顶测试榜,马斯克

70. xAI发布Grok 4.1

71. 刚刚!OpenAI推出GPT-5.4 Thinking与GPT-5.4 Pro

72. GPT-5.4炸场

73. 最新GPT-5.4

74. GPT5.4来了,好用是真好用,贵也是真贵

75. 白热化:GPT-5.4、Gemini 3.1、DeepSeek 3.2谁才是2026年真正赢家?

76. 2026年AI模型全面横评

77. 2026年AI大模型混战

78. 大模型实战指南(2026年新春版)

79. 3.29 科技早报

80. Gemini-3.1-Pro中文测评结果发布 | 全球第二!

81. 炸场对决!Gemini 3.1 Pro vs Claude Sonnet 4.6谁是2026年AI真顶流?

82. 2026 AI 大模型技术前沿

83. 还只是单 agent 模式,Grok 4.20 就拿下了搜索第一

84. GPT-6即将到来

85. 突发!OpenAI与Claude同日“开战”:GPT-5.3 Codex硬刚Opus 4.6,谁才是AI编程的终结者?

86. 🔥 2026年AI编程王炸对决:Claude Opus 4.6 vs GPT-5.3-Codex,开发者该怎么选?

87. “Claude Code更新废了”!思考深度降67%,无法胜任复杂工程任务

88. 重磅发布!Claude Opus 4.6 亮点解析

89. GPT5.2 和 Gemini 3 Pro 谁更强

90. Grok-4-1-fast-non-reasoning实测

91. GPT-5.4 vs Claude 4.6 硬核对比:开发者该选谁?实测结果很意外

92. 测了10件工作任务,Claude和GPT-5差距在这

93. 别看跑分了!GPT-5.3 和 Claude 4.6 同时炸场,咱们小白到底该抱哪条大腿?

94. 国内如何使用 Claude Opus 4.6?2026年最新接入方案

95. 深度解析GPT-5.4 与 GPT-5.4 Pro,AI进入"全能特工"时代!

96. “Claude Code更新废了”!思考深度降67%,无法胜任复杂工程任务

97. Claude Opus 4.6杀死编程比赛!挖出500个0day漏洞,生成k线成交量分布,还有PPT直出

98. GPT-5.4 vs Claude Opus深度对比:AI模型的性价比革命

99. 2026年大模型编程能力深度对比

100. GPT-5.4和Claude Opus 4.6谁更强?

101. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

102. Claude与GPT上演“神仙打架”,AI格局一夜变天,DeepSeek V4能否突破!

103. Claude Opus 4.6 & GPT-5.3-Codex深夜震撼发布!前端叕死了?

104. 巅峰对决:Opus4.6又赢了,GPT5.4还差点意思!

105. 马斯克不甘寂寞!GPT-5.1刚发布,Grok 4.1 马上就来“炸场”

106. Claude Opus 4.6 技术报告

107. 中门对狙!Claude Opus 4.6和GPT-5.3 Codex同时发布,这下真AI春晚了

108. 同日双旗舰发布:GPT-5.3-Codex vs Claude Opus 4.6,开发者该怎么选?

109. GPT-5.4 vs Claude Opus 4.6:2026年最强模型对决

110. 2026编程模型:GPT-5.3-Codex还是Claude Opus 4.6?最全实测报告

111. Claude Opus 4.6、GPT-5.3-Codex 正面交锋

112. AI巅峰对决:Claude 4.6与GPT-5.3编程博弈 - 哔哩哔哩

113. 今日AI工具测评 - OpenAI GPT-5.4

114. 调研解读|OpenAI GPT5.2:Agentic、专业知识工作能力迎来能力质变

115. Claude Opus 4.6 深度测评:究竟比Opus 4.5强在哪?

116. Opus 4.6 vs. Codex 5.3

117. AI 编程双雄同日对决:Claude Opus 4.6 vs GPT-5.3-Codex 深度解析

118. 2026 AI 变局:Claude Opus 4.6、GPT-5.3-Codex 相继发布,国产 AI 还有机会吗?

119. Claude 4.6 Opus 霸榜发布:是生产力神作,还是开发者的“破产陷阱”?

120. 2026 Al 巅峰对决:GPT-5.4 vs Claude Opus 4.6

121. 2026年科研AI神仙打架,GPT-5.2和Gemini 3.0你到底该梭哈谁?

122. 马斯克Grok系列有新进展,好像4.2版公测快了, AI学习速度要被刷新

123. 如何调用Grok 4.1?xAI官方API接入示例与最佳实践 - 哔哩哔哩

124. Claude Code4.6国内中转|低价稳定 保真官方模型国内直连不用魔法支持Opus 4.6/ Sonnet 4.6全版本 原生API直连,不逆向,不降智,超稳定 超高性价比 不限次数。无日限额。额度可囤消费明细实时可查,透明无套路 带详细教程 多节点负载均衡,高峰期不掉线 支持官方终端/vscode/cursor等第三方ide#个人开发者#大模型#ai编程#claude 适合:编程开发/代码调试/长文本/高频调用

125. GPT-5.4 mini 与 GPT-5.4 nano 登陆 Microsoft Foundry (国际版) | 免费试用

126. GPT-5.4发布3周,我逃回Claude的真实原因

127. 别当冤大头了!Claude 4.6满血版国内直连,稳定不封号,成本暴降90%!

128. Grok4.1发布,面向所有用户开放

129. GPT-5.2 翻车内幕曝光:技术团队没走「歪路」,但用户成了大冤种

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章