GPT-5.4原生操控电脑:办公效率革命还是安全隐患?全网观点大PK

源自155位全网作者

03-10 19:31

内容由AI生成

精选参考来源

1. OpenAI发布GPT-5.4

2. OpenAI发布GPT-5.4

3. GPT-5.4正式上线

4. 具备“原生计算机使用能力”,OpenAI推出GPT-5.4

5. 前沿资讯|GPT-5.4正式发布

6. GPT-5.4深夜发布!与OpenClaw的技术共振

7. GPT-5.4!「Agent 原生」大模型来了?

8. GPT-5.4发布

9. OpenAI发布GPT-5.4内置原生电脑操控,OpenClaw 3.2更新权限关闭致功能失效

10. 实测精选 OpenAI 发布 GPT-5.4 具备计算机原生操作能力,在推理、编码与 Agent 三合一

11. OpenAI 最强模型 GPT-5.4 正式登场

12. GPT-5.4 深度解析

13. GPT-5.4 炸裂发布

14. ChatGPT-5.4属实“动手王者”,一句话征服微信,但是我却被气笑了

15. GPT-5.4震撼上线!原生操作电脑,工作方式全面革新

16. GPT5.4正式发布!AI长出了双手,能直接看屏幕点鼠标键盘?#ai #科技 #chatgpt #gpt5 #科技下一站

17. AI办公工具

18. 2026办公效率革命

19. GPT-5.4实战指南-让你的电脑自己完成工作效率提升3倍!

20. 告别复杂函数!GPT-5.4重磅发布

21. GPT-5.4登场,职场巨变!数字员工时代生产力飞跃开启!

22. GPT-5.4+OpenClaw能替代人类办公吗?全网观点大PK

23. 7款前沿大模型安全大考

24. GPT-5.2 封神,Grok 垫底?复旦最新测评揭露 AI 安全的“至暗时刻”!

25. OpenAI推出GPT-5.4并披露多项重大进展,AI公司的风险控制分析

26. Gemini 3.1 Pro更懂中文语境,GPT-5.4胜在自动化办公

27. GPT-5.4重磅上线!对比4代/5.0差在哪?普通人直接受益

28. GPT-5.4发布

29. GPT-5.4 最新情报

30. 深度解析|GPT-5.4"超越83%员工"背后的真相

31. GPT 正在悄悄改变一切

32. GPT-5.4有多强?Agent能力的颠覆性进化,抢占AI办公的制高点

33. OpenAI发布GPT-5.4

34. GPT-5.4发布了,它是怎样自己点鼠标填表格的?

35. 办公本还值得买吗?2025年值得入手的办公本推荐!

36. 人人都能炼专属Agent,上海交大开源端侧Agent全栈工具链,真实场景性能超GPT-5!

37. 连Claude死忠粉都换GPT-5.4了,OpenClaw省47%,Token半价碾压Opus!

38. GPT-5.4深夜发布,最适合OpenClaw的天选模型登场了。 深夜凌晨2点,我刚准备睡觉。 然后,GPT-5.4,突然发布。 一下子激动的睡不着了。 真的,这真不是我天天咋咋呼呼啥的,我真的也很少会用激动的睡不着觉这种表述。 这是因为,我一直在等正式版的GPT-5.3或者GPT-5.4,来作为我的OpenClaw的首选模型。 理由特别简单,因为现代世界三十年,本质上基层都是代码,我们现在看到的关于计算机和互联网的一切,几乎都建立在代码的基础之上。 所以你可以理解为,代码能力,在很多时候,就代表着Agent能力的一根粗壮的腿。 一个优秀的Agent基座模型,在我的理解里,一般来说,需要三种都很强: 代码能力、世界知识、多模态理解。 当你这三个都能SOTA的时候,你几乎必然就是最牛逼的Agent模型,当然,还有一个重要的因素,就是价格。 在过去,Claude Opus 4.6,几乎就是Agent模型的代名词,因为代码、世界知识都很强,多模态能力虽然比不过Seed 2.0和Gemini 3.1 Pro,但是在一些场景里面,也够了,因为现在的Agent,跟现实物理交互还没有那么多,那个已经是具身智能的范畴了。 而我过去很喜欢的GPT-5.3-Codex,代码能力确实强,在做任务执行的时候,那简直就是指哪打哪。 但是最大的问题,这玩意是一个编程特化模型啊,世界知识就是一坨屎,连GPT-5.2都不如,所以OpenAI当时也是没办法,为了跟Claude打一打,只能加个Codex的后缀给放出来了。 所以你会发现,在规划能力上,是完全比不过Claude Opus 4.6的,但是最大的问题,其实还是因为世界知识的问题,就导致这玩意。 它说天书,讲的那些话,真的,我不是程序员出身,我看那个话,看的就真的超级费劲。 就比如说,我让他之前对我的一个AI热点网站的项目进行审查,主要就是review一下我的文档规范和我整个代码库。 然后,这哥们写的文档,我尼玛。。。 你再对比一下Claude Opus 4.6写的。 对比起来应该一目了然。。。 就是因为这玩意不说人话,世界知识也不行,所以,只是在Codex里面用用还好,但是你要是把它接到你的OpenClaw里面,去当做默认模型,你就知道啥叫灾难了,这哥们几乎没有人味,说起话来我想揍他。 所以我当时试了一下,就直接弃了,还是在我的OpenClaw里面,用的Claude Opus 4.6和Sonnet 4.6,做了一下场景调用。 那为啥说,我很期待GPT-5.4呢。 因为,Claude哪都好,但是,它贵啊!!! 它真的好贵啊!!!!!! 而且因为Anthropic这个呆逼,它把OpenClaw给疯了,所以我订阅的Claude的Max Plan的额度,是完全不能给OpenClaw用的,只能在Claude Code用,你想在OpenClaw上用,只能硬接API Key用。 但是大家都知道,Claude的API有多贵,那根本不是我们这种穷逼团队能用的起的,小规模用用还好,大规模用那公司直接破产了。 之前还有一条路是用反代,把Google家的Antigravity里面的Claude额度用插件代理出来,扔给OpenClaw用。 但是后面Google开始大批量封号,导致也没办法用了。 我过年的时候Google账号还被封了,被迫用AI去给Google写了一份声泪俱下的邮件。 我说我错了,我再也不会了。 后面Google才给我解封,但是反代肯定是用不了了。 而OpenAI就不一样了,最开始Claude疯狂封OpenCode账号的时候,OpenAI大手一挥,就站了出来,说我们不封,大家全力使用。 这是御三家里,唯一一个这么支持态度的,可以用第三方的工具,调用Codex的额度的。 那对OpenClaw自然也不例外了,也是几个顶级模型里面,为数不多的,可以直接走登录的,其他的都得用API。 真的,OpenAI这回真的是大善人。 还疯狂的给Codex加额度。 所以啊,Claude在OpenClaw里用,好是好,但是不能用订阅额度,只能用API,贵的一笔。 OpenAI的模型倒是可以用订阅额度,但是GPT-5.2代码又不行,GPT-5.3-codex又不说人话。 你看,要多别扭有多别扭。 而这一次,GPT-5.4来了!!! 终于把这个短板给补上了! 代码能力跟GPT-5.3-Codex齐平,世界知识比GPT-5.2还要强,还能使用订阅额度,20刀就可以用的超级爽。 你就说,这不是最适合OpenClaw的天选模型,还有谁是?嗯? 从今天开始,用OpenClaw的,都把默认模型切换到GPT-5.4去,真的,信我。 回到GPT-5.4,老规矩,先看跑分。 就很爽。 先看最关键的几个。 GDPval:83.0% 这个是测AI在真实工作任务中表现的,包括金融、法律等44种职业的知识工作。 GPT-5.4 Thinking拿了83.0%,Claude Opus 4.6是78.0%,GPT-5.3 Codex是70.9%。 在真实业务场景里,GPT-5.4不只是会写代码,它还能跟你聊业务、聊金融、聊法律、聊各种专业领域的东西。 而且是用人话聊,不是用天书聊。 SWE-Bench Pro:57.7% 这个是测AI解决真实软件工程问题的,不只是Python,而是测四种编程语言。 GPT-5.4 Thinking拿了57.7%,GPT-5.3 Codex是56.8%。 基本持平。 这就是我最想看到的结果。 代码能力保住了GPT-5.3 Codex的水平,世界知识又补上来了。 OSWorld-Verified也是,75.0%。这个是测AI操作电脑的能力的,就是让AI像人一样,用鼠标点击、用键盘输入、在不同应用之间切换,完成各种任务。 GPT-5.4 Thinking拿了75.0%,超过了Claude Opus 4.6的72.7%,也保持了跟GPT-5.3-Codex的持平。 而且,GPT-5.4操作电脑的速度,快的离谱。 看下这个没有加速过的视频,会更直观。 ToolAthlon:54.6% 这个是测AI使用工具的能力的,也就是Agent能力的核心指标之一。 GPT-5.4 Thinking拿了54.6%,Claude Sonnet 4.6是44.8%。 差了将近10个点。 至于学术知识之类的,跟GPT-5.3-codex就没法比了,因为OpenAI自己也知道,所以,直接当时就没跑。 总之,翻译成大白话就是。 GPT-5.4 = GPT-5.3 Codex的代码能力 + 比GPT-5.2还强的世界知识 + 更强的工具使用能力 + 超级便宜的codex额度。 这四样加在一起,就是一个完美的OpenClaw天选基座模型。 然后还有几个很棒的特性更新: 1. 100万token的上下文窗口。 这是GPT-5.4的一个大升级。 之前GPT-5.3的上下文窗口是40万token,GPT-5.4直接翻了一倍多,到了100万。 这对Agent来说太重要了。 因为Agent在执行任务的时候,需要保持对整个任务的上下文理解。如果上下文窗口不够大,Agent干着干着就会忘事儿,前面说的东西后面就不记得了。 100万token,基本上足够应对绝大部分的Agent任务了。 当然,OpenAI也不傻,他们说,超过27万token之后,你的额度就算两倍了。 不过因为Codex给的额度实在是太多太多了,所以即使是2倍,其实也还好。 2. 原生计算机使用能力。 这个是GPT-5.4的另一个大卖点。 OpenAI说,GPT-5.4是他们第一个内置原生计算机使用能力的主线模型。 它在编写通过Playwright等库操作计算机的代码方面表现非常的出色,同时也能根据屏幕截图发出鼠标和键盘命令。 也就是代码和视觉齐飞,我感觉,这个小龙虾接入以后,就真的可以,直接用视觉,操控你电脑上绝大多数的软件了,真的,原生操控,想想都激动。 他们基于此,还发布了一个新的skills,叫playwright-interactive。 允许Codex同时以代码和视觉的两种方式,调试Web和Electron应用。 网址在此,大家可以自行安装。 http://t.cn/AXVAqO5O 3. 支持了工具搜索。 以前呢,当模型被赋予工具时,所有工具定义都会预先包含在提示中。 对于拥有大量工具的系统,这可能会为每个请求增加数千甚至数万个token,而且绝大多数的时候,都毫无意义,平白无故的导致成本上升、响应变慢,并在上下文中充斥模型可能永远不会使用的信息。 所以呢,这次他们也支持了工具搜索,就是GPT‑5.4不再直接接收完整工具定义,而是接收一份可用工具的轻量列表以及工具搜索功能。 当模型需要使用某个工具时,它可以查找该工具的定义并在当时将其追加到对话中。 就非常像Skills渐进式呈现的方式,目的很简单,还是优化上下文工程。 OpenAI在自己测试完以后,发现工具搜索配置在保持相同准确率的同时将总体token使用量减少47%,这个就非常牛逼了。 GPT-5.4 Thinking大概就是这样。 这次他们其实还发了个GPT-5.4 Pro,我就不细说了,反正就是一切都更牛逼了,但是对于大多数人来说,太贵了,也没啥大用,必须得200刀的Pro会员才能用。 API的整体价格还是得说一下,虽然大家大概率用的都会是订阅的额度。 相比于GPT-5.2,价格是涨了的,但是还是比Claude Opus 4.6,便宜不少,Claude Opus 4.6的价格是$5/$25每百万token(输入/输出),GPT-5.4只有他们一半。 目前ChatGPT已经上线了。 Codex也已经支持了,我自己在Codex里面粗浅体验了一下。 首先扑面而来的,那自然是清新沁人的人话。。。 比如我让它去把OpenAI官网的视频给扒拉下来,你看看这个发言:“这种活最烦”,“省的跟Cloudflare互相折寿”。。。 还有这个。 真的,Codex的输出,我真的能看得懂了。。。 做出来的东西,前端审美有了不错的进步,但还是不如Opus 4.6和Gemini。 写作粗略测了一下,还是一股子莫名其妙的爱用排比句的诡异的味道。 奇奇怪怪。 然后有点可惜的就是,我等到了凌晨6点多,OpenClaw目前使用Codex登录的方式,还是没有支持GPT-5.4。 这就导致,我还是没有机会测GPT-5.4在小龙虾上的效果。 不过估计今天小龙虾就支持了。 因为社区里已经看到很多用户在催了,而且先行官们,都普遍反馈效果很好。 坐等支持,我真的已经迫不及待了。 又是开心的一晚。 如果你也在用OpenClaw,那记得OpenClaw支持了以后,把默认模型切换到GPT-5.4。 如果你还没用过OpenClaw,那正好,现在是一个很好的开始时机。 毕竟,有了GPT-5.4这个天选模型,体验只会更好。 2026年,真是疯狂的一年啊。 #how i ai##AI[超话]##科技先锋官##ChatGPT[超话]##gpt5# http://t.cn/AXVAqYKj

39. 一个视频搞懂OpenClaw!

40. 几分钟就能“攻破”一家公司的AI,怎么防? #智能体 #网络安全 #360安全云 #科技改变生活 #网络安全宣传周

41. AI编程大战正式开打! Claude vs GPT同一天放大招,不是比谁代码写得好,而是AI开始自己组队当项目经理了。#大咖观察 #红衣聊AI #编程 #ChatGPT

42. 刚刚,奥特曼砸场发布 GPT-5.4!网友:一句 Hi 烧掉 80 美元

43. OpenAI最新推出的GPT-5.1-Codex-Max,以原生Windows适配能力成为编码新利器。这款模型不仅强化了Windows编码代理功能,更在效率与成本控制上实现双重突破。作为首个原生训练支持Windows环境的模型,它能精准理解PowerShell脚本、IIS配置逻辑,甚至轻松处理“C:\Program Files”这类Windows特有路径格式,彻底告别AI生成“Linux风格代码”后手动修改的麻烦。压缩技术让它可连贯处理数百万Token,项目级重构、多小时调试都能保持逻辑连贯。开发ASP.NET项目时,能一键生成适配的CI/CD流水线配置;调试桌面应用遇到注册表问题,可快速定位并给出修复方案。对企业团队,它思考Token减少30%的特性,能以更低成本完成前端设计等任务,兼顾质量与经济性。目前它已在Codex平台上线,支持VS Code等IDE插件、CLI工具及云端环境,ChatGPT Plus及企业版用户可直接使用。从独立开发者的小工具开发,到企业级Windows应用迭代,GPT-5.1-Codex-Max正让Windows编码从适配困难变为高效流畅。#科技先锋官##AI生活指南##AI创造营# 种斌Marco的微博视频

44. Claude Opus 4.6 vs GPT-5.3-Codex,到底谁更强?

45. GPT-5.2连肝7天,300万行代码造出Chrome级浏览器

46. 中门对狙!Claude Opus 4.6和GPT-5.3 Codex同时发布,这下真的AI春晚了。

47. 给AI一个“身体”:3D数字人或是具身智能的解法?【硅谷101】

48. GPT-5-Codex 发布,可以7小时连续编程,但OpenAI 封杀了API。。

49. Claude code + GPT5-codex 双管齐发的效果是否更好,还是单用好,怎样体验最好?

50. 硅谷大佬接连破防,AI的效率提升太疯狂了。 #大咖观察 #红衣聊AI #硅谷 #AI工具

51. AI存在伪造信息、滥用数据等风险。 国家人工智能安全治理框架2.0版正填补空白。#大咖观察 #红衣聊AI #网络安全

52. OpenAI 发布 GPT-5.4,定位为专业工作场景的旗舰模型,同步推出面向高复杂任务的 GPT-5.4 Pro 版本。这次发布的最大亮点是 GPT-5.4 成为 OpenAI 首个原生支持"电脑操控"(Computer Use)的通用模型——也就是说,它可以像人一样通过截图、点击鼠标、敲击键盘来操作真实的电脑界面。在 OSWorld-Verified 桌面操控测试中,GPT-5.4 以 75% 的成功率超过人类(72.4%),而上一代 GPT-5.2 只有 47.3%。在知识类工作方面,GPT-5.4 在涵盖 44 种职业的 GDPval 基准测试中,与行业专业人士打平或胜出的比例达到 83%,GPT-5.2 的这一数字是 70.9%。投行建模任务的内部评测得分从 68.4% 跳升到 87.3%,生成演示文稿的效果在人工评审中有 68% 的概率优于前代。编程能力上,GPT-5.4 整合了此前专为写代码设计的 GPT-5.3-Codex 的能力,在 SWE-Bench Pro 上得分 57.7%,与 GPT-5.3-Codex 的 56.8% 相当,但延迟更低。另一个实用改进是"工具搜索"(Tool Search):以往给模型配备大量外部工具时,所有工具定义都要塞进提示词里,动辄消耗数万个 token。GPT-5.4 改为按需查找工具,在测试中将 token 消耗减少了 47%,对于依赖大量 MCP 工具的开发者来说成本节省明显。在 ChatGPT 中,GPT-5.4 Thinking 将支持在生成过程中展示思考计划,用户可以中途介入调整方向——不用等模型跑完再重新来过。定价方面,API 输入价格从 GPT-5.2 的每百万 token 1.75 美元涨至 2.50 美元,输出价格从 14 美元涨至 15 美元。GPT-5.4 今天起向 ChatGPT Plus、Team、Pro 用户开放,取代 GPT-5.2 Thinking 成为默认推理模型,GPT-5.2 Thinking 将在三个月后于 2026 年 6 月 5 日正式退役。

53. 未来办公已来:思必驰AI办公本X5系列,重新定义“高效”

54. GPT-5.2 翻车内幕曝光:技术团队没走「歪路」,但用户成了大冤种

55. 对神经网络某一层做了小改进,效果却提升显著,可以发论文吗?

56. OpenAI凌晨放大招,免费Prism颠覆科研!从摘要到致谢,GPT-5.2包圆

57. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

58. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

59. 侥幸心理,才是数字安全最大的敌人。 #大咖观察 #数据安全 #红衣聊AI #网络安全

60. 大模型只是能力,必须要跟场景结合。 #大咖观察 #红衣聊AI #大模型

61. 刚刚,GPT-5.3 新模型撞车 Gemini,OpenClaw:谢谢你们

62. AI的安全从来不是加个补丁的事。 而是要把安全基因嵌进模型的每一步。#大咖观察 #红衣聊AI #网络安全

63. AI安全就像一场军备竞赛,攻击者和防御者都在不断进化。 #大咖观察 #红衣聊AI #网络安全

64. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月

65. AI在拓展年轻人思考边界、提升效率的同时,也可能削弱其深度思考能力,利弊需客观审视:一、优点• 拓展信息边界,提升思考起点:AI能快速整合海量信息(如学术资料、跨领域知识),帮助年轻人突破认知局限,在更广阔的知识基础上展开思考,避免因信息闭塞导致的思维狭隘。• 简化重复工作,聚焦深度思考:替代数据整理、公式计算等机械性任务,节省时间成本,让年轻人将精力集中在分析、判断、创新等更高层次的思考活动上(如用AI整理调研数据后,专注于推导结论)。• 激发多元视角,打破思维定式:通过生成不同角度的观点(如AI对同一社会议题的多维度分析),引导年轻人跳出固有认知框架,培养辩证思考能力。二、缺点• 削弱深度思考能力,易形成“依赖惯性”:过度依赖AI获取答案(如直接复制AI生成的观点、跳过自主推导过程),会减少主动分析、逻辑论证的练习,导致思考变得浅层化,难以形成独立见解。• 降低信息辨别能力,易陷入“认知偏差”:AI输出的信息可能存在片面性或错误,若年轻人缺乏对信息的筛选、验证意识,会被动接受内容,逐渐丧失批判性思考能力(如误信AI生成的虚假数据或极端观点)。• 抑制创造力,局限思维想象力:长期依赖AI的标准化输出(如用AI生成文案、设计方案),会弱化自主探索和试错的意愿,导致思考模式趋向统一,难以产生突破性、个性化的想法。#AI会削弱年轻人的思考力吗##AI生活指南#

66. #龙虾# 我卧病在家看了看那个小龙虾,确实太厉害了;这个世界发展的太快了,感觉像在游戏里一样,前几天我们在高呼Deepseek的高效,昨天在感慨即梦的强大,今天OpenClaw已经可以控制工具了。只需要写出指令,AI就能替你干活帮你赚钱,它让我们很多跟AI从业者不着边的人,都距离AI又近了一步。 但诸如小龙虾这种级别的ai,真的对普通人来说有用么?风险会不会高于收益?OpenClaw的一位维护者说:“如果你连命令行都不会用,那么这个项目对你来说太危险了,无法安全使用。”问题是,命令行,感觉大多数人其实并不懂。究竟要用这只龙虾来做什么,让他来控制哪些信息,对于我们个人信息的安全,对于不可控的安全,如何避免风险发生,想养龙虾我觉得应该考虑清楚 感慨的同时,其实我也有个问题: 我们的世界,真的需要这么快么?

67. Google 发布 Gemini 3.1 Pro:推理能力翻倍,重回 AI 模型第一梯队2026 年 2 月 19 日,距离 Gemini 3 Pro 上线仅三个月,Google 就发布了 Gemini 3.1 Pro。这次升级的核心卖点:推理能力翻倍,价格不变。目前以 Preview 形式向开发者、企业和消费者全面开放。Gemini 3 Pro 去年 11 月上线时曾短暂登顶,随后被 OpenAI 和 Anthropic 反超。这次从第三方评测机构 Artificial Analysis 的数据看,Google 重新拿回了综合智能指数的榜首。推理能力:核心突破3.1 Pro 最大的亮点在推理。ARC-AGI-2(测试模型解决全新逻辑模式的能力)得分从 Gemini 3 Pro 的 31.1% 跳到 77.1%,翻了一倍多。对比竞品:Claude Opus 4.6 得分 68.8%,GPT-5.2 为 52.9%。Humanity's Last Exam(高级学术推理)上 3.1 Pro 得分 44.4%,也高于 GPT-5.2 的 34.5% 和 Claude Sonnet 4.6 的 33.2%。GPQA Diamond(科学知识)拿到 94.3%,同样是所有模型最高。编码和 Agent:全面提升LiveCodeBench Pro(竞赛级编程)的 Elo 从 2439 提升到 2887,大幅领先 GPT-5.2 的 2393。SWE-Bench Verified(实际代码修复)上得分 80.6%,与 Claude Opus 4.6 的 80.8% 基本持平——头部模型在工程编码上已非常接近。Agent 方面提升更为显著。APEX-Agents(长链专业任务)从 18.4% 跳到 33.5%,接近翻倍,超过 Claude Opus 4.6 的 29.8%。BrowseComp(Agent 搜索)以 85.9% 排名第一。Google 还专门推出了 gemini-3.1-pro-preview-customtools 端点,针对混合使用 bash 命令和自定义函数的Agent场景做了优化。不过 3.1 Pro 并非所有维度都领先。在 LM Arena 用户投票排名中,Claude Opus 4.6 在文本和编码类别仍然靠前。GDPval-AA(专家任务)上 Claude Sonnet 4.6 以 1633 大幅领先 3.1 Pro 的 1317。不同测试反映不同维度,没有哪个模型在所有任务上占绝对优势。开发者关注点API 层面有几个实用更新:文件上传限制从 20MB 提升到 100MB,支持直接传入 YouTube URL 分析视频,新增 medium 级别的 thinking level 方便在推理深度和成本间灵活切换。注意一个破坏性变更:total_reasoning_tokens 字段已更名为 total_thought_tokens。模型支持最多 100 万 token 输入上下文和 6.4 万 token 输出,原生多模态(文本、图片、音频、视频、代码仓库)。定价和使用定价与 Gemini 3 Pro 完全一致:200k token 以内输入 $2/百万 token,输出 $12/百万 token;超过 200k 则为 $4/$18。能力大幅提升但价格不变,性价比明显提高。对比参考:Claude Opus 4.6 为 $5/$25,GPT-5.2 为 $1.25/$10。普通用户可以通过 Gemini app 和 NotebookLM 使用,需 Google AI Pro($19.99/月)或 Ultra($124.99/月)订阅。开发者可通过 AI Studio、Gemini API、Gemini CLI、Google Antigravity、Vertex AI 和 Android Studio 访问,模型标识符为 gemini-3.1-pro-preview。目前处于 Preview 阶段,稳定版将在进一步验证后发布。官方公告: 网页链接/

68. Gemini 3 Pro比之前的2.5确实好非常多,分析,做图像视频都很厉害。但个人感觉,还不到能取代gpt 5.1 thinking的强度。尤其GPT “长期记忆”这一块很强,也已经被我训成很懂我的工作合伙人了,这部分太难替代。各有千秋吧,我自己还是要两个都用。AI总结:Gemini 更像“超级检索式分析器”GPT-5.1 更像“策略家 + 思考伙伴”纯信息密度 & 资料整合能力:Gemini 3 Pro 更强多层推理、跨主题整合、结构化深度分析:GPT-5.1 Thinking更强Gemini 3 Pro 的优势多模态 & 超大上下文处理。Gemini 3 Pro 支持文本、图像、视频、PDF 等多种输入模态,也能处理非常长的上下文 (比如大量文档 / 长篇报告 /大数据集) — 这是它的一大杀手锏。逻辑推理 + 数理 / 复杂任务处理能力强。在多个基准测试 (数学、逻辑推理、视觉 + 推理、多模态理解等) 中,Gemini 3 Pro 的成绩在很多项都超过 GPT-5.1。擅长“重”/“大规模”内容处理 + 综合型任务。如果你的任务需要跨文档整合、图文混合分析 (比如政策 + 数据表 + 图表 + 图片)、长时间 context 的研究 — Gemini 会表现得更稳定。GPT-5.1 Pro / Thinking 的优势自适应推理 + 工具 / 代理 整合 + 高效对话 / 编码工作流程。GPT-5.1 最新版本 (Pro / Thinking) 强调“根据任务难度自动分配思考资源 + 支持工具调用 / 代码执行 / 多轮对话 + 稳定性 / 开发者友好性”。更适合迭代、动态交互、对话与写作 / 编码。比如你做写作、策略分析、代码编写、快速原型、反复调整 prompt/输出 — GPT-5.1 在速度、连贯性、开发者体验上往往更顺手。在“记忆准确性 / 长对话稳定性 / 多轮交互”方面表现不俗。对于需要持续对话、多轮迭代、状态保持、复杂 prompt chain 的任务,GPT-5.1 更擅长维护连贯和响应一致性。#人工智能#

69. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

70. GPT5.2亮点解读,OpenAI重夺年度最强 OpenAI甩出王炸GPT5.2,核心基准测试,全面碾压Gemini 3 Pro和Claude Opus4.5,强势夺回地表最强 奥特曼放话GPT5.2不仅是最强通用大模型,还要成为你日常办公的AI合伙人 亮点1、最强视觉能力 亮点2、最强上下文 亮点3、最强办公能力 亮点4、最强编程能力 #AI新星计划 #抖音知识年度大赏 #人工智能 #OpenAI #大模型

71. GPT-5.2 正面对狙 Gemini 3 Pro,但真正杀手锏不在跑分

72. 再见,白月光 GPT-4o

73. OpenAI最强代码模型GPT-5.2-Codex上线

74. 这个位置调整对了,35岁看起来像20岁 #轮廓提升 #上海九院 #下颌线 #抖出健康知识宝藏 #健康科普破圈计划

75. 实测文心5.0 vs GPT-5.1 用户只认好不好用

76. OpenAI DevDay 震撼发布 GPT-5 Pro、App SDK 等五件套,有哪些亮点?

77. AI的未来不仅仅是要比以前更聪明,还得要更安全。 用安全守护创新,这才是大模型时代的生存法则。#大咖观察 #红衣聊AI #网络安全 #大模型

78. 你最想让智能体机器人先帮你搞定生活,还是提升工作效率? #大咖观察 #ai新星计划 #红衣聊AI #机器人

79. 雷军:AI时代每周只需工作3天/深圳拟发布「龙虾十条」/工信部提示OpenClaw安全隐患

80. 面部提升 小剂量减容支撑 轻薄打法 姑娘还比较年轻,目前针对面部轻度衰老做一个处理,这次打的是玻尿酸,针对颞区,面中部,下颌线,下巴后缩等问题进行全面部的调整,后续针对精细部位还需要用到胶原材料微调,整体有收紧松泡软组织,立体五官,轮廓清晰的效果。 #健康科普不基础 #樊哥撩皮肤 #骨相填充 #面中凹陷 #下巴后缩

81. 当车企开始卷流程,比造车更快的是招人 #启境 #华为乾崑 #华系大厂 #有一种效率叫启境 #启境的招聘速度也太快了

82. 只有筑好“数字长城”, 我们的国家、企业、信息安全,才能真正掌握在自己手里。#大咖观察 #红衣分享 #网络安全 #国家安全

83. AI的未来必须带着安全绳前进。 #大咖观察 #红衣聊AI #人工智能安全

84. #一分钟视频创作季# 七个家庭对 OpenAI 的集体诉讼,其中四起自杀悲剧、三起精神健康损害事件,直指 GPT-4o 模型过早发布后的安全漏洞,也为狂飙突进的 AI 行业对社会伦理的颠覆颠覆提出了更深层次的思考。当下AI 至少已经成为 7 亿人的虚拟知己,在应用过程中AI强化有害妄想、诱导危险行为的风险已从个体扩散至群体层面。OpenAI 超级对齐团队的解散、安全资源投入不足的现状,暴露了商业利益驱动下的安全短视。#AI生活指南##AI创造营##有点东西# 种斌Marco的微博视频

85. GPT‑5.4深夜发布,百万网友“养”的龙虾,终于有了灵魂

86. “文山”“会海”终结者——思必驰AI办公本 X5系列上手体验及测评

87. 2025百度世界大会我来啦在2025百度世界大会上,百度正式发布全球首个原生全模态大模型文心5.0,总参数2.4万亿,采用统一自回归架构进行原生全模态建模,融合文本、图像、音频、视频等多模态数据,实现一体化理解与生成。模型在多模态理解、指令遵循、创意写作、事实性、智能体规划与工具应用等方面全面升级,与Gemini-2.5-Pro、GPT-5-High等持平,图像视频生成达全球领先水平。依托飞桨框架和超稀疏混合专家架构,激活参数低于3%,并通过端到端强化学习提升智能体能力。百度创始人李彦宏强调技术迭代是唯一护城河,将持续推高智能天花板;CTO王海峰称其验证了原生全模态潜力。目前,文心5.0 Preview已上线文心App和千帆平台,在LMArena排名中位列全球并列第二、中国第一。#ai创造营##ai生活指南# 北京·国家会议中心(二期)

88. #科技先锋官# 科技圈最近的竞争卷到离谱!OpenAI突然提前两周炸出GPT-5.2,背后藏着一场惊心动魄的生死竞速——原来谷歌Gemini 3在11月横空出世,不仅霸榜多类AI评测,月活还狂破6.5亿,直接把OpenAI逼得暂停所有非核心项目,全员冲刺搞研发!这次GPT-5.2憋了个大招:首次推出三大分层版本!Instant版主打轻量快响应,提速18%-40%,查资料、聊日常秒回不卡顿;Thinking版作为主力,编程能力在SWE-Bench测试达80%,256K上下文能轻松搞定长文档分析,专业人士狂喜;Pro版专攻高难度场景,ARC-AGI-2测试得分52.9%,就是168美元/百万Token的价格让中小企业望而却步。更惊喜的是企业端表现:日均帮用户省40-60分钟,一键生成PPT、投资报告不在话下,1320项专业任务70.9%能媲美人类专家,效率暴涨11倍!单题成本还从4500美元暴跌到11.64美元,12个月效率提升390倍,这波优化绝了~但争议也没断:官方说错误率降38%,实测仅20%-30%,长文本召回率下滑;普通用户吐槽聊天机械、安全审查过度,开发者却吹爆编程和建模能力。更要命的是,谷歌Gemini 3性价比碾压,开源模型DeepSeek性能达GPT-5.2的95%还免费,OpenAI一边季度亏损超百亿,一边要砸万亿搞算力基建,腹背受敌太难了!这场AI巨头的巅峰对决,你觉得GPT-5.2能逆袭吗?#ai创造营#

89. ChatGPT曝七大漏洞,可诱使AI泄露记忆与聊天记录

90. ChatGPT曝出七大安全漏洞

91. GPT-5.2 重磅发布:面向专业工作的最强模型,OpenAI 的「Code Red」一役,赢回 AI 面子战?

92. OpenAI修补ChatGPT提示注入漏洞但问题持续恶化

93. GPT-5.4 评测 | 深夜王炸!这次能干翻 Claude 吗?

94. GPT-5.2技术突破深度解析

95. 刚刚!GPT-5.4 炸场发布:AI 首次获得“原生操控电脑”能力

96. GPT-5.4重磅发布!首次支持原生操控电脑 超越人类

97. GPT-5.4重磅更新:引入原生计算机操作能力与性能全面升级

98. OpenAI 发布具备原生计算机控制功能的 GPT-5.4 版本 具备计算机原生使用能力。 Codex 和 API 中最多可包含 100 万个上下文标记。 针对复杂任务的最佳智能体编码。 跨大型生态系统的可扩展工具搜索。 针对耗时较长、工具繁多的工作流程,提供更高效的推理。

99. GPT-5.1与GPT-5.2对比及GPT-5.2极速接入指南

100. 王炸降临!GPT-5.4 正式发布,百万上下文 + 原生电脑操控改写 AI 上限

101. 第121期 | GPTSecurity周报

102. GPT-5、Gemini 全“沦陷”?首次系统评估 WebAgent安全性

103. FreeBuf周报 | ChatGPT 被诱导自我注入攻击;Windows内核0Day漏洞遭野外利用提权

104. OpenAI发布最强专业模型GPT-5.4,产业链将迎新一轮投资热情

105. GPT-5.2重磅发布:OpenAI推出专业知识工作AI助手,办公效率迎来新飞跃

106. GPT-5.4「原生操控电脑」实测封神!OpenClaw天选模型来了

107. OpenAI发布GPT-5.4:首个原生接管电脑通用模型

108. 利用 GPT-5 Codex 提升企业创新与效率

109. Codex GPT5.4 computer-use 上手体验 GPT-5.4 在 Codex 和 API 中首次支持原生操控电脑,可以调用/操作其他 App 完成复杂的工作流,同时上下文提升到了 1M(之前是400K)。 官方日志: https://openai.com/index/introducing-gpt-5-4/ #AI编程 #Codex #gpt5 #computeruse #程序员

110. 前沿资讯|GPT-5.4震撼发布:百万上下文

111. 【GPT-5.4重磅更新!AI竟能自己操作电脑了?】 #GPT54 #AI智能体 #计算机操作 #AIGC #AI学习 一、GPT-5.4 核心更新:原生计算机操作能力 1. 重磅功能:GPT-5.4 首次将计算机操作能力集成至大模型本身,通过 Playwright 编写代码操纵浏览器,识别截图图像,精准控制鼠标和键盘,实现跨应用的复杂交互(如自动发送邮件)。 2. 实现原理:模型通过截图对界面元素进行标注,对应操作鼠标点击,完成自动化任务。类似 Browser use、Manus 等工具的能力,但现在成为模型原生功能。 3. 案例演示:官方案例展示模型自动操作邮件发送,从识别元素到点击发送全流程。 二、其他关键更新与性能提升 1. 上下文窗口:扩展至 100 万 token,可处理超长文档。 2. 智能工具搜索:内置工具搜索能力,无需依赖外部 API,提升任务完成效率。 3. 训练效率:提升约 2 倍,推理速度更快(fast 模式下达 1.8 倍),降低算力消耗。 4. 多模态与视觉能力:支持数学像素理解,精准定位鼠标位置;处理图像、PDF 等更美观,电子表格/文档/PPT 生成效果更佳。 5. 基准测试表现: - GDPval(行业知识):提升至 83%。 - OSWorld(计算机操作):首次超越人类平均水平(72%)。 - BrowseComp(Agent 能力):显著提升。 - 代码能力:仍弱于 Claude OPS4.6,但其他指标多列第一。 6. 技术架构:采用 MoE 架构,引入稀疏注意力和线性注意力,优化时间复杂度,结合旋转位置编码、缓存优化等实现高效长上下文处理。 三、价格、生态与行业对比 1. 定价:API 价格比 GPT-5.2 贵 40%,达百万 token 180 美元,被吐槽“玩不起”;用户简单问题可能引发过度思考,性价比存疑。 2. 生态对比:GPT-5.4 为“全科医生”,覆盖多领域;Claude 为“专科医生”,代码重构和编写能力绝对领先(曾引发金融法律公司股价波动)。国产模型如豆包、千问等处于第二梯队。 3. 排名:Arena 竞技场目前排名第六,前有 Claude 等模型。 4. 应用场景:可实现自动化办公(如搜索资料、分析数据、生成报告并邮件发送)、生成交互游戏(如主题公园模拟)、跨应用任务处理等。

112. 11.07安全资讯 |​​ 研究人员发现ChatGPT漏洞允许攻击者诱骗AI泄露数据

113. 如何评价GPT-5.4发布?原生操控电脑与MCP协议将如何重塑AI Agent生态?

114. GPT5.4深夜更新!最适合openclaw的模型! 原生 Computer Use 能力:模型专门训练看截图自动控制 UI(精确点击、打字、滚动),OpenClaw 的浏览器/桌面/系统操作准确率和成功率暴增,支持批量动作(一次返回多个),告别旧 preview 的单步低效和幻觉,执行更稳更快。 1M Token + 原生 Compaction:OpenClaw 24/7 长会话(MEMORY.md、HEARTBEAT、cron 多天任务)记忆永不丢失,自动压缩轨迹省 token,之前用户吐槽的“忘指令”问题彻底解决。 Reasoning Effort 可调参数(none/low/medium/high/xhigh):简单 cron 任务调 low(超快),复杂规划调 high/xhigh,速度与智能完美平衡。 Tool Calling + CFG 约束:工具调用更精准,输出严格符合 OpenClaw 的 skills/plugins/shell 格式,解析执行几乎零错误,结合 Preambles 意图解释更顺。 Responses API 原生集成:OpenClaw 已支持 openai/* 系列(含 server-side compaction),切换 gpt-5.4 后延迟更低、成本更省,未来因创始人加入 OpenAI + 项目赞助,集成会更无缝。 #openclaw #gpt5 #自动化

115. GPT-5.4 上线!超级个体时代正式到来

116. LLM生成的恶意软件正在不断改进,但不要指望明天就会出现自主攻击 —— 研究人员试图让 ChatGPT 做坏事,但它并没有成功。

117. OpenAI发布最强专业模型GPT-5.4,自动操作电脑,插件支持AI玩转Excel和金融分析

118. GPT-5.4发布!100万token上下文+原生电脑操作!

119. 研究人员攻破 ChatGPT 的记忆和网页搜索功能

120. 第124期 | GPTSecurity周报

121. OpenAI贴脸开大,GPT-5.3 Codex发布! OpenAI贴脸开大,GPT-5.3 Codex模型介绍与Claude 4.6 Opus性能对比评测!#AI新星计划 #新知贺岁眼界大开

122. 具备原生计算机控制能力,OpenAI 正式发布最新前沿模型 GPT-5.4

123. OpenAI发布GPT-5.4新模型:原生操控电脑,迈向自主智能体新时代

124. GPT5.2风险讨论

125. [流言板]美网安高官将敏感文件喂给ChatGPT

126. OpenAI 新王登基!最强GPT-5.4发布,原生控电脑,能力首超人类

127. 💥ChatGPT 零点击,你的邮箱/文件全裸奔

128. AI+Excel效率革命:从加班到准点下班的完整实操指南

129. OpenAI发布GPT-5.4 为首个具备原生计算机操作能力的模型

130. AI办公革命:当“智能效率”开始吞噬你的职场未来

131. OpenAI深夜祭出GPT-5.4,暴击Claude,原生操控电脑,打工人悬了

132. GPT-5性能分析

133. GPT-5.2技术炸场!6大核心突破,办公效率拉满

134. OpenAI 开源了推理安全模型-gpt-oss-safeguard-120b 和 gpt-oss-safeguard-20b

135. OpenAI 放大招:GPT-5.2 三版本覆盖 44 类职业,办公 、 编程效率翻倍

136. 🔥 OpenAI发布GPT-5.4 Thinking ❗️

137. 【ChatGPTplus升级平台: ai66.peg 】OpenAI深夜突袭,GPT-5.4新王炸场!一夜之间,直接粉碎了Gemini 3.1 Pro和Claude Opus 4.6的神话。这也是头一次,ChatGPT拥有真正「原生电脑使用」能力,办公效率直接拉满。而真正恐怖的地方在于,每一个维度上它都没有短板。#gpt5.4#chatgpt #gpt #ai#gemini

138. 两天两弹:GPT‑5.4 来了,百万上下文、原生电脑操作

139. 当 AI 成本减半,企业会议终于迎来 “效率革命”

140. GPT-5.1 的「平衡革命」:当 AI 学会「快回答」,还守住了「安全的边界

141. OpenAI发布开源安全推理模型gpt-oss-safeguard

142. GPT-5.4正式发布:AI能直接操控电脑,人类要失业了?

143. 微软 Copilot 免费升级 GPT-5.2!开启专家级办公

144. 大模型网络安全能力测评报告;大模型安全白皮书

145. 第125期 | GPTSecurity周报

146. GPT-5.2来了!

147. 251211-OpenAI发布GPT-5.2:性能与实际应用突破

148. 《治安管理处罚法》第三十三条释义【危害计算机信息系统安全】

149. AI办公工具爆发:25-45岁职场人如何用科技提升3倍效率?

150. GPT-5.2 好用吗?GPT-5.2 vs Gemini 3 Pro 全面对比评测

151. 11倍效率+1%成本:GPT-5.2如何实现人类专家级产出?

152. 炸了!GPT5.2深夜放大招,打工人10分钟搞定

153. GPT-5.4到处都是龙虾爪印 周五,OpenAI 正式发布 GPT-5.4,此次更新引入了一种新模式:原生的计算机使用,并且把推理 + 编码 + 智能体 + 计算机控制全都融合在同一个前沿模型里。有网友认为:GPT-5.4 看起来就像是 OpenClaw 的架构文档被直接做成了一个前沿模型。#GPT54#ai新星计划 #OpenAI #ChatGPT #OpenClaw #模型#AI#人工智能#科技#前沿科技

154. OpenAI 发布 GPT-5.2-Codex,显著提升智能编程与网络安全能力

155. GPT-5.2-Codex 优化 Win11 环境,长代码任务效率翻倍

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章