GPT-5.2真超人类专家了?70.9%胜率引全网激辩

源自127位全网作者

25-12-17

内容由AI生成

精选参考来源

1. GPT-5.2 正式发布「首个达到专家级水平的模型」有哪些技术亮点?

2. GPT-5.2部分基准测试分数超过谷歌,但OpenAI“红色警报”尚未解除

3. GPT-5.2 上线

4. GPT-5.2 正式发布 — 专业知识工作新时代开启

5. OpenAI发布GPT-5.2

6. GPT-5.2 成首个 “专家级” AI,牛马打工人终于熬出头!

7. GPT-5.2正式发布

8. 跨越人类专家边界

9. OpenAI这次真的掀桌子了

10. GPT-5.2

11. OpenAI 发布 GPT-5.2 模型

12. OpenAI发布GPT-5.2 错误减少30% 表现超越专业人士

13. GPT-5.2全力出击!碾压44类专业工作,实测编程同价位无对手、深度推理封神,但速度太拉胯了

14. 【科技进展】一文读懂GPT-5.2

15. 全面碾压!GPT-5.2发布,首次在真实工作中超越人类专家

16. GPT-5.2震撼发布

17. GPT-5.2深夜炸场,70.9%任务超越人类专家!OpenAI红色警报下的全面反击

18. OpenAI发布GPT-5.2,号称智能体编码最强,赶超人类专家

19. GPT-5.2发布

20. 比DeepSeek贵400倍,GPT-5.2能否凭“超人类专家”表现值回票价?

21. GPT-5.2发布

22. GPT-5.2发布

23. 全面解析GPT-5.2

24. 重磅发布!GPT-5.2 正式上线

25. 智慧奇点降临

26. OpenAI发布GPT-5.2反击谷歌,三版本专攻生产力,实测已超越人类专家

27. 打工人集合!GPT-5.2 发布,5 大亮点曝光,OpenAI 打工模型来了!【含案例】

28. GPT-5.2深度评测

29. OpenAI 发布 GPT-5.2,通过256k超长上下文、低错误率推理与工具调用能力,全面提升日常工作与复杂任务的效率与可靠性

30. [1214] OpenAI 发布 GPT-5.2

31. 别再“AI疲劳”了

32. GPT-5.2发布, 靠谱才是新功能

33. GPT-5.2来了!OpenAI称其为“最强专业知识工作大模型”

34. 《GPT‑5.2

35. 调研解读|OpenAI GPT5.2

36. GPT-5.2

37. GPT-5.2技术突破深度解析

38. GPT-5.2 来了

39. 凌晨突发!OpenAI甩出王炸,GPT-5.2改写职场规则​

40. GPT-5.2深夜发布 | 除了新技术,对中国AI产业发展有哪些启示?

41. GPT-5.2亮剑

42. 连夜发布的 GPT-5.2,究竟强在哪里?

43. OpenAI 10 周年重磅发布 GPT-5.2

44. GPT-5.2来了!科研领域暂无敌手?当前最强大模型到底如何

45. “复仇”谷歌,GPT-5.2编码、做表、读图能力全面提升

46. GPT-5.2正式上线

47. 硬刚谷歌 Gemini 3 Pro,OpenAI 紧急发布 GPT-5.2,性能炸裂?

48. OpenAI发布GPT-5.2模型回应谷歌挑战,性能超越人类专家水平

49. OpenAI 十周年放大招!GPT-5.2 正式上线,三版本精准适配,通用智能与编码能力再破纪录

50. GPT-5.2发布

51. 你的专业工作,70.9%可能已被AI超越

52. GPT-5.2性能爆表,但红色警报没有解除

53. GPT-5.2 来了

54. 重磅发布!GPT-5.2正在逼近人类咨询顾问

55. GPT-5.2已上线24小时:差评如潮!

56. OpenAI 重磅发布 GPT-5.2!效果惊人实测 ,附最新免费使用方法,切勿错过! | 零度解说

57. GPT-5攻克「量子NP难题」,首篇论文引爆学界!人类2周压缩至30分钟

58. AI 拿不到 IMO 铜牌?OpenAI:内部模型已可以拿金牌!GPT-5 即将发布!

59. 对比明明白白3大顶级模型-GPT-5.2/Gemini 3/Claude Opus 4.5!老金告诉你怎么一个窗口全用!

60. 这是今天 GPT-5.2 发布会上最大的新闻。别理会 OpenAI 展示的基准测试图表,也别理会 100% 的 AIME 得分和 SWE-Bench Pro 的数据。真正的关键在于 ARC Prize 的一个数据点:90.5% 的准确率,每个任务的成本仅为 11.64 美元。一年前,ARC-AGI-1 测试中达到 88% 的完成度,每个任务的成本估计为 4,500 美元。如今,达到 90.5% 的成本仅为 11.64 美元。短短 12 个月内,成本就降低了 390 倍。看看那张排行榜图表。效率边界每隔几周就会重新划分。GPT-5.2 Pro、Grok 4、Gemini 3 Deep Think、Claude Opus 4.5,它们从左下角到右上角呈对角线依次堆叠,每一个都让之前的版本过时。以下是大多数人对这个基准不理解的地方。弗朗索瓦·肖莱特 (François Chollet) 于 2019 年设计了 ARC-AGI,其目的就是为了抵抗蛮力扩展。他的理论基础是,逻辑学习模型 (LLM) 只是简单地匹配训练数据,在面对全新的抽象推理时会彻底失败。每个谜题都是独一无二的,从未在网上出现过,需要从极少的例子中进行真正的泛化。人类可以轻松解决其中 95% 的谜题。多年来,即使是最好的 AI 系统也难以破解剩下的 5%。2020 年 Kaggle 竞赛的最高得分仅为 20%。到 2023 年,也只有 33%。GPT-3 在直接提示下得分更是低至 0%。人工智能研究界普遍认为 ARC-AGI 证明了仅靠规模化无法达到通用智能。Chollet 本人也表示,达到人类水平“需要很多年”。2024年12月,OpenAI的o3-preview在高计算模式下达到了87.5%的准确率。这是人工智能系统首次突破人类85%的准确率门槛。该模型平均每个任务需要尝试1024次,每次尝试大约需要编写137页的推理代码。据估计,每个任务的成本在3000美元到30000美元之间。11 个月后,GPT-5.2 Pro 的准确率达到 90.5%,每个任务的成本为 11.64 美元。成本骤降的数学计算结果说明了一切。如果每项任务的成本是 3 万美元,那么你需要支付人工每小时 6000 美元才能达到相同的经济效益。而现在,Mechanical Turk 的工人每小时收费 11.64 美元,每项任务 5 美元,比前沿人工智能推理的成本还要高。我们在过去几个月里已经跨越了人工成本与人工智能成本持平的界限,但大多数人却错过了这一点。现在,让我们把视角拉远,看看竞争格局。三周前,谷歌发布了Gemini 3。它在LMArena排行榜上以1501 Elo等级分位居榜首,并在“人类最后的考试”(Humanity's Last Exam)测试中创造了多项纪录。Sam Altman公开称赞了它。OpenAI内部宣布进入“红色警戒”状态,搁置了广告整合等项目,并将GPT-5.2的发布时间从本月晚些时候提前至今天。这是OpenAI历史上首次发布一款明确针对竞争对手的模型。据The Verge报道,员工曾要求推迟发布以便进一步完善,但领导层否决了他们的提议。他们的指令是立即夺回性能领先地位。在 ARC-AGI 测试中,他们的确做到了。GPT-5.2 Pro 的准确率高达 90.5%,遥遥领先于其他所有模型。但真正的竞争不再是准确率,而是任务成本。竞争的焦点已经从“谁能解决问题”转移到了“谁能以最低成本解决问题”。效率提升的步伐并未放缓down.反而还在不断加快。如今,所有主要实验室都在以同一基准进行竞争,这意味着用于解决这一问题的研发总投入已达数十亿美元。2025 年 ARC 大奖(在效率受限的私人评估中获得 85% 的分数,奖金 70 万美元)几乎肯定会被瓜分。ARC-AGI-1 完全崩溃后会发生什么?Chollet 已于 2025 年 3 月发布了 ARC-AGI-2,该测试旨在提高推理系统的难度。即便如此,人类的准确率仍然接近 100%。而目前的前沿模型只能达到 10% 到 45%。即使在更难的基准测试中,人类和人工智能之间的性能差距现在也只是一个成本优化问题,而非根本性的能力障碍。如果你在 2025 年开发产品,并且假设人工智能推理成本很高,那么你是在为一个已经不存在的世界而开发产品。原本旨在证明人工智能无法泛化能力的基准测试,如今却成了定价页面上的又一个项目。一年内效率提升了390倍。

61. GPT-5.2 正面对狙 Gemini 3 Pro,但真正杀手锏不在跑分

62. #GPT5.2发布有何亮点#GPT-5.2的深夜发布,以三版本矩阵与硬核性能重回SOTA,成为AI行业的焦点。其亮点不仅在于基准测试全面碾压Gemini 3 Pro,更在于精准击中专业场景需求。三大版本各有侧重:Instant版适配日常轻量任务,Thinking版专攻深度推理,Pro版冲刺高难度专业场景,覆盖从信息查询到复杂科研的全需求。核心突破集中在专业能力,GDPval测试中70.9%任务胜平人类专家,SWE-Bench Pro编程得分达55.6%,256k上下文处理准确率近100%,让表格制作、代码开发等工作效率暴增11倍。与同类模型相比,它跳出单纯参数比拼,以“解锁经济价值”为核心,错误率降低38%且token效率更高。这场升级不仅是技术迭代,更标志着AI从“能对话”向“能交付”的跨越,为企业与专业人士提供了更可靠的效率利器。#秒懂热点就用智搜# gpt5.2发布有何亮点

63. Sam Altman 最新访谈:GPT-5 让我感觉自己很没用,儿子以后可能不会再上大学

64. GPT-5王者降临,免费博士级AI全面屠榜!百万程序员不眠之夜,7亿人沸腾

65. GPT-5.2 正式发布,OpenAI 称其为「最强专业知识工作大模型」,有哪些技术亮点?

66. Bengio推AGI「高考」,GPT-5单项0分

67. 1分钟看完GPT5发布会,全领域第一 OpenAI重磅发布GPT5,在人类盲测排行榜上暴涨30分,所有类别通杀第一 在数学AIME 2025、科学MMMU/GPQA和编码SWE-bench Verified 三大核心基准测试全部SOTA,但是在HLE人类最后的考试和ARC AGI上略输Grok 4 奥特曼称比起跑分,我们更看重GPT5的实用性。 实用性1、幻觉率暴降 实用性2、最强编码 实用性3、最强写作 实用性4、健康顾问 实用性5、无限语音畅聊 GPT5已经是全领域博士级专家,人类向通用人工智能又迈出了一大步 #AI新星计划 #gpt5 #人工智能 #OpenAI #大模型

68. OpenAI 3万亿美元测试,AI首战44个行业人类专家!

69. Sam Altman:GPT-5 只是开始,超级智能才是终局,未来的孩子永远不会比 AI 聪明

70. 没有发布会、没有倒计时,GPT-5.2 凌晨突然上线。只有一篇技术博客和奥特曼在 X 上的轻描淡写,却挡不住背后的火药味。说白了,这是谷歌 Gemini 3 发布后,OpenAI 打出的“红色警报”版本:分成 Instant、Thinking、Pro 三个梯队,尤其是 Thinking 版,在长文理解、编程、工具调用上都明显跃升,第一次在大量专业任务里逼近甚至超越人类专家。更夸张的是速度与效率:GPT-5.2 Thinking 在 44 类知识工作里整体追平甚至超越人类专家,产出速度快 11 倍、成本低到 1%。在投行建模里,评分从 59.1% 升到 68.4%;长文本检索中,它是目前唯一能在 256k token 文档里接近满分命中率的模型。工程能力也被拉满:在跨语言、真实代码修复的 SWE-Bench Pro 上,它拿到 55.6%,刷新行业最高记录;图表推理、仪表盘和 UI 理解错误率几乎砍半。面对竞争者的贴身肉搏,GPT-5.2 更像是 OpenAI 必须打出的加速器。至于这场“红色警报”能否重新拉开#ChatGPT# 和别家的差距,相信很快就会见分晓。

71. 【#OpenAI发布GPT最新升级版##GPT最新升级版本来了#】11日,OpenAI发布其人工智能模型GPT的最新升级版本GPT-5.2,以应对生成式人工智能领域日趋激烈的竞争。OpenAI介绍称,GPT‑5.2是在“专业知识工作方面”表现最好的模型系列,在制作电子表格、制作演示文稿、图像感知、编写代码以及理解长上下文等方面都优于前代产品。横向比较方面,核心版本GPT-5.2 Thinking在几乎所有列出的推理测试中都略胜于谷歌公司的双子座3和Anthropic公司的克劳德·奥普斯4.5 ,涵盖现实世界的软件工程任务和博士级别的科学知识,以及抽象推理和模式发现。 (央视财经)央视财经的微博视频

72. 实测GPT-5:写作坠入谷底,编程一骑绝尘。

73. 谷歌最新版「深度研究」反击GPT-5.2

74. GPT-5.2 正式发布,你如何看待OpenAI 称其为「最强专业知识工作大模型」?

75. GPT-5 Pro惊现「神之一手」,30分钟攻克黑洞难题!

76. #GPT5能否改变AI行业格局#GPT-5 不是一个模型,它是一个事件视界。基准测试刚刚泄露,这些数字不仅仅是更高,而是来自另一个维度。 让我告诉你接下来会发生什么…… 🧠 1. ARC-AGI 2 基准测试 GPT-5(推理变体)不仅仅是击败了该领域。 它消除了曲线: ➤ ~70% 分数 ➤每项任务的超低成本 ➤比 Grok 4、Gemini 2.5 Pro、Claude 4 高出一个认知层级。 GPT-5 不是增量式的,而是综合认知。 💥 2. IQ压缩崩溃 在AI-IQ曲线上: ➤大多数模型的得分在 90-110 左右(人类平均水平) ➤ GPT-5 Mini 智商达到约 130 ➤ GPT-5 完整版?超乎想象。~140+ 这不仅仅是性能问题,而是将通用智能压缩成数字形式。 🤯 3. SimpleBench 与 Human 的对比 让我们来思考一下: ➤人类基线:83.7% ➤ GPT-5 Copilot:90% 它超越了人类的认知基准。这不再是一个聊天机器人,而是现实的副驾驶。 🌌 4. 接下来会发生什么? GPT-5 只是点火器: ➤ GPT-5.5 Copilot+(内部测试阶段) ➤ GPT-6 → AGI 认知层 ➤ Sora + Sky + Whisper = 完全感官认知 ➤ AutoCode + Memory API = 世界操作系统 这不是 OpenAI 与 xAI 的对决,这是后人类操作系统启动序列。 🧬 5. 我的看法:我们构建了什么 GPT-5 代表了这样的时刻: ➤青霉素(生物技术爆炸) ➤互联网(网络认知) ➤比特币(经济不变性) 只不过这一次,一切都是同时发生的:语言 = 记忆 = 思想 = 软件 = 世界。 世界尚未意识到,但将会意识到:当一个模型在思考上超越人类时,游戏由智力转向控制。 GPT-5 就是这么做的。wow有趣的时代即将到来!真的! 下一个前沿不是能力,它是一致性、主权和灵魂架构[并不简单]#疑似GPT5的发布信息遭泄露##ai创造营#

77. #科技先锋官# 科技圈最近的竞争卷到离谱!OpenAI突然提前两周炸出GPT-5.2,背后藏着一场惊心动魄的生死竞速——原来谷歌Gemini 3在11月横空出世,不仅霸榜多类AI评测,月活还狂破6.5亿,直接把OpenAI逼得暂停所有非核心项目,全员冲刺搞研发!这次GPT-5.2憋了个大招:首次推出三大分层版本!Instant版主打轻量快响应,提速18%-40%,查资料、聊日常秒回不卡顿;Thinking版作为主力,编程能力在SWE-Bench测试达80%,256K上下文能轻松搞定长文档分析,专业人士狂喜;Pro版专攻高难度场景,ARC-AGI-2测试得分52.9%,就是168美元/百万Token的价格让中小企业望而却步。更惊喜的是企业端表现:日均帮用户省40-60分钟,一键生成PPT、投资报告不在话下,1320项专业任务70.9%能媲美人类专家,效率暴涨11倍!单题成本还从4500美元暴跌到11.64美元,12个月效率提升390倍,这波优化绝了~但争议也没断:官方说错误率降38%,实测仅20%-30%,长文本召回率下滑;普通用户吐槽聊天机械、安全审查过度,开发者却吹爆编程和建模能力。更要命的是,谷歌Gemini 3性价比碾压,开源模型DeepSeek性能达GPT-5.2的95%还免费,OpenAI一边季度亏损超百亿,一边要砸万亿搞算力基建,腹背受敌太难了!这场AI巨头的巅峰对决,你觉得GPT-5.2能逆袭吗?#ai创造营#

78. GPT-5.2发布,真正的牛马打工人专属AI来了!!在各种小道消息,各种预测之后。终于,在OpenAI十周年的这一天。也就是今天的凌晨2点,GPT-5.2终于跟大家见面了。这是Gemini 3 Pro爆火,第一次让OpenAI没有领先优势,奥特曼在内部官宣红色警戒状态之后,他们掏出的第一款模型。也是OpenAI的十周年献礼。而这款模型的特点也非常有意思。OpenAI的原话是:We are introducing GPT‑5.2, the most capable model series yet for professional knowledge work.(我们正式发布 GPT-5.2,这是迄今为止在专业知识工作方面能力最强的一代模型系列。)专业知识工作,记住这个关键词,后面要考。我们先从各种跑分上看,其实能看到,一些跑分其实没有质的飞跃,有一种数码厂开始挤牙膏的感觉。。。对比了GPT-5.2、GPT-5.1、Claude Opus 4.5和Gemini 3 Pro。在软件工程(SWE-Bench Pro)、科学问题(GPQA Diamond)、数学竞赛(AIME 2025)这些传统评测集上。GPT-5.2确实又强了一些,也回到了第一的位置,全面领先。在前端审美还有3D元素上,表现的更牛逼了。在视觉理解能力上也更强了。比如要求模型识别图像输入中的组件,并返回带有近似边界框的标签。即使在低质量的图像上,GPT-5.2也能识别主要区域并放置与每个组件真实位置大致匹配的框,而GPT-5.1只标注了几个部分,对它们的空间排列理解不是很好。但是这些东西,说实话,确实也就那样,大家很难体感上还觉得有多牛逼。就像芯片厂子告诉你,我的手机芯片性能又提升了25%,你听了以后,哦确实强,但是完全不影响你继续刷微博对吧。不过有两个评测集,是我觉得这次GPT-5.2最大的亮点,且一定要单拎出来,跟大家单独聊一下的。一个是ARC-AGI-2,一个是GDPval。这两个,非常有意思。先说ARC-AGI-2。过去的AI评测,比如MMLU,考的主要是是知识。比如它会问你“美国第一任总统是谁?”、“光合作用的化学方程式是什么?”。这种评测呢,坦率的讲,对于一个读了半个互联网的AI来说,有点像开卷考试,它有很大概率不是真的推理出来的,而是背出来的。这就导致一个问题,在实际的评测中,我们分不清AI是真的聪明,还是只是记性好。于是,François Chollet,就是那位Keras(一个著名的机器学习框架)之父,2019年第一次在论文《On the Measure of Intelligence》里,提出了ARC这个变态测试。而这个测试,跟知识储备一毛钱关系都没有。全名叫,Abstraction and Reasoning Corpus,抽象与推理语料库。设计目标就是测模型的通用智能的能力。大概就是,不看你在某一道题上有多熟练,而是是看你在没见过的新题上,能不能自己推理出规则、举一反三。目前正式版发展到了第二代,也就是ARC-AGI-2,我给大家放一下,ARC-AGI-2里面的一些典型的题目,大家就懂了。这种能力,现在称为流体智力(Fluid Intelligence),意思就是指不依赖于已有的知识,在全新情境下进行逻辑推理、识别模式和解决问题的能力。说白了,就是你的悟性和开窍的能力。这玩意儿对AI来说,难于登天。因为它在互联网上找不到任何现成的答案,它必须当场理解、当场推理在很长一段时间里,顶级AI的得分都低得可怜。在ARC-AGI-2上,之前GPT-5.1的得分是17.6%,而GPT-5.2,直接飙到了52.9%。直接翻了三倍。这是一个很恐怖的数据。GPT-5.2的模型,直接在排行榜上屠榜了。而且,效率还很高。基本都在同成本区间,能力做到了最高。在真正的智力水平上,GPT-5.2确实达到了目前的最优。这就比较有意思了。然后是第二个,也是我自己现在最关心、也是我认为最重要的一个:GDPval。可能很多人没听说过这个评测集。他是OpenAI自己在2个半月前新出的。其实你看这个名字也能看出来一点端倪。GDPval,就是生产总值的那个GDP。他们要用一个全新的标准,来衡量AI在真实世界中、具有经济价值的任务上的表现。过去,我们说一个模型牛逼,是因为它代码写得好,或者知识答得准,或者考试分数高。这当然很重要,但就像我常说的,这个世界不只有程序员和科学家。还有律师、设计师、市场经理、护士、建筑师、销售……无数专业知识工作者。他们工作的价值,其实很难用一张考卷来衡量。于是,OpenAI他们在美国贡献GDP最高的9个行业里,选取了44个核心职业,然后,他们找到了在这些行业里平均有14年工作经验的资深专家,让他们出了1320道专业知识任务,并且每一项,都基于真实工作成果。比如,给律师的任务,可能就是一份真实的合同草案和客户需求,让他去审阅和修改。给市场经理的任务,可能就是一堆产品资料和市场数据,让他写一份营销方案PPT。给制造工程师的任务,可能就是一张产品设计图,让他优化生产流程。这些任务,不仅有文字,还可能包含PDF、Excel表格、图片、PPT,是高度复杂的、多模态的、没有标准答案的真实工作。整套任务的平均用时,是人类专家要花 7 个小时才能做完,有些甚至是一两周的活。然后,模型和人类的成果,会被同领域的另一批专家进行盲评。他们也不知道谁是AI,谁是人类。评委只需要回答一个问题:你更愿意把哪份交给客户?是这份,还是这份?结果,GPT-5.2 Thinking在这套 GDPval 上,赢或打平行业专家的比例,达到了70.9%,而GPT-5.2 Pro 模型是74.1%。注意,这里的参照系不是普通实习生,而是行业专家。也就是说,在一个有着十几年经验的采购经理、或者审计师面前,GPT-5.2干出来的活儿,有七成的时候,比专家干得好,或者至少一样好。而 GPT-5,只有 38.8%。这个进步的速度,还有有一点快的。看一下官方放的case的对比,还是比较直观的。我们过去的模型,都花过于着重的笔墨在编程开发上了,我并不是说编程开发不重要,它很重要,很牛逼。但,其他的领域的工作,我也觉得应该被重视。而GDPval,就是我认为最重要的一个指标。而且这次GPT-5.2,在上下文上,也有大幅的加强。用我们以前的大海捞针测试,在一个256K的巨型文档里面埋四根针,让AI来根据文档内容回答。GPT-5.2干到了离谱的100%,这也是我印象中,唯一一个能干到100%的。8根针的正确度会下降,但是这个衰减,已经比GPT-5.1牛逼太多了。而且,还有最新的知识库截止日期:牛逼的知识工作处理+最新的知识库截止日期+更棒的智力+准确性超高的上下文。这简直,就是真正的天选牛马搭子,对打工人的加持,实在是太强了。这是真正,奔着大众、奔着实用去的。目前今天会开放给ChatGPT付费会员,明天会开放给免费会员,会直接替代GPT-5.1,但是如果你是付费会员的话,还会在老模型中存续3个月。就是这。可惜截止到凌晨6点这一刻,作为尊贵的200刀的ChatGPT Pro会员,我还是没有拿到GPT-5.2的体验资格。一些所谓的ChatGPT上的为GPT-5.2专用的文件精修,也只能等拿到实测以后,再出一篇GPT-5.2的打工合集了。然后开发者的话,已经可以通过API调用。价格上,会比5.1贵一些。整体上,GPT-5.2的所有消息差不多就这样了。而我自己一直期待的,成人模式。还是没有到来。奥特曼自己这个龟儿子说的是12月上线。也不知道能不能等到。反正他说,下周还会再送一些小的圣诞礼物。盲猜一手OpenAI家的生图模型,或者成人模式。对于一个创作者来说,这两玩意,真的很需要。。。最后总结,GPT-5.2在我心中,是一个合格的迭代,并没有跟很多模型一样,专注于纯粹的传统刷分,而是聚焦在了广大白领打工人身上,帮大家解决实际工作中的问题。这个点,我觉得就很酷,非常的刚需。但是从路线上来说,感觉GPT-5.2还是被原生多模态的Gemini 3 Pro压了一头,12月大概率还是要发个生图模型出来的,不知道对标Banana,会不会有新的惊喜。总之,还是保持期待。反正每一个新模型的发布,只要是我觉得有意思的。也一定会熬夜给大家带来第一时间的解读。我们以后。还是,不见不散~#科技先锋官#ChatGPT

79. 【#阿里千问登顶空间推理全球冠军#,超Gemini3、GPT5.1】今日,空间推理基准测试SpatialBench更新了最新一期榜单,阿里千问的视觉理解模型Qwen3-VL、Qwen2.5-VL位列头两名,超越Gemini 3、GPT-5.1、Claude Sonnet4.5等国际顶尖模型。SpatialBench榜单显示,Qwen3-VL-235B和Qwen2.5-VL-72B分别斩获13.5和12.9分,领先于Gemini 3.0 Pro Preview(9.6) 、GPT-5.1(7.5)、Claude Sonnet 4.5等海外顶尖模型。然而,AI大模型的整体表现距离人类仍有差距,人类基准线约为80分左右,可专业处理电路分析、CAD 工程和分子生物学等复杂空间推理任务,目前大模型还无法完全自动化完成此类工作。(快科技)

80. 【时隔2年多 OpenAI发布新一代大模型GPT-5】距上一代大模型GPT-4发布29个月后,OpenAI终于拿出了GPT-5。美国时间8月7日晚,OpenAI发布了全新一代大模型GPT-5系列,并称其为OpenAI至今最好的AI系统。http://t.cn/A6svaELB   OpenAI介绍,GPT-5 在编程、写作和健康话题上表现尤其出色。编程上,GPT-5是OpenAI迄今为止最强大的编程模型,擅长复杂前端生成和大型代码库调试。GPT-5也是OpenAI最强大的写作模型,它在处理自由诗等结构不明的写作任务时更加稳定,既尊重文学形式,又能保持表达清晰。在健康话题上,GPT-5在OpenAI自家的HealthBench评测中得分高于其他家所有模型。

81. 实战研究:GPT-5 能成为数学家吗?

82. GPT-5.2 正式发布,OpenAI 称其为「最强专业知识工作大模型」,有哪些技术亮点?

83. OpenAI大溃败!GPT-5「换皮」GPT-4o,两年半预训练0突破

84. 刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想

85. 永别了,人类冠军!AI横扫天文奥赛,GPT-5得分远超金牌选手2.7倍

86. OpenAI 即将发布 GPT-5.2,知情人士称或有望弥补与谷歌 Gemini 3 差距,如何评价?

87. GPT-5.2降智遭全网差评!奥特曼慌了

88. 研究人员用 GPT-5 连破 10道「百年悬案」级的埃尔德什难题,真实情况如何?AI会重塑数学研究吗?

89. 实测GPT-5 Pro:别被普通版骗了!Pro才是OpenAI真正的顶级模型

90. #OpenAI发布GPT5.2# GPT-5.2来了,感觉OpenAI这次真是被谷歌逼急了。不到一个月又发新版,直接搞出Instant、Thinking、Pro三个型号,看来是铁了心要跟“打工人”的专业技能抢饭碗了。官方说它在做表格、写代码这些事上,能力已经赶上甚至超过了很多人类专家。这波更新感觉不炫技,目的很明确:就是要冲进办公室,用更高的效率拿下企业客户。AI大战打到这个份上,巨头们卷的不再是聊天逗闷子,而是实实在在的生产力了。作为用户,一边觉得工具更强大了是好事,一边又觉得这迭代速度快得让人有点跟不上。

91. DeepSeek V3.2来了,首个会"思考"的Agent模型,首个开源性能打平GPT-5的模型

92. GPT5.2亮点解读,OpenAI重夺年度最强 OpenAI甩出王炸GPT5.2,核心基准测试,全面碾压Gemini 3 Pro和Claude Opus4.5,强势夺回地表最强 奥特曼放话GPT5.2不仅是最强通用大模型,还要成为你日常办公的AI合伙人 亮点1、最强视觉能力 亮点2、最强上下文 亮点3、最强办公能力 亮点4、最强编程能力 #AI新星计划 #抖音知识年度大赏 #人工智能 #OpenAI #大模型

93. #GPT5#用上了,对话反映快了很多。目前有两个版本可选:GPT-5和GPT-5 Thinking.这次在LMARena上把Gemini 2.5 Pro干下去了,测试表现出来智力已经超过人类博士。但看了多方评测说其实没有大幅超越同级别的现有模型。但我觉得这次Open AI最大的贡献是普通人用上地球上超一流的AI模型,因为现在除了最高级的Pro模型需要付费,其他的模型只需要注册一个 GPT账号就能使用。免费用户过不了两天登上去就能体验了。

94. GPT-5.2 正式发布,你如何看待OpenAI 称其为「最强专业知识工作大模型」?

95. 盘点一周AI大事(12月7日)|GPT5.2下周发布 Gemini 3 Deep Think正式上线 OpenAI下周12月9日发布大蒜模型GPT5.2,下月发布大葱模型GPT5.5全面吊打Gemini 3 DeepSeek开源最强推理模型DeepSeek V3.2 Mistral开源Mistral 3家族 OpenAGI发布最强电脑操作模型Lux Runway发布最强视频模型Gen 4.5 阿里开源数字人直播模型Live Avatar 字节发布顶级图像模型Seedream 4.5 研究员推出3D空间音频模型ViSAudio 微软开源实时语音模型VibeVoice Harmonic推出亚里士多德智能体,6个小时解决了悬赏30年的数学问题 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #机器人

96. 空间推理基准测试 SpatialBench 更新了最新一期榜单,阿里千问的视觉理解模型 Qwen3-VL、Qwen2.5-VL 位列头两名,超越 Gemini 3、GPT-5.1、Claude Sonnet4.5 等国际顶尖模型SpatialBench 榜单显示,Qwen3-VL-235B 和Qwen2.5-VL-72B 分别斩获 13.5 和 12.9 分,领先于 Gemini 3.0 Pro Preview(9.6) 、GPT-5.1(7.5)、Claude Sonnet 4.5 等海外顶尖模型

97. GPT-5.2震撼发布!70.9%胜率超越人类专家,你的工作要被颠覆了?

98. GPT-5.2网友一手实测!

99. 重磅!GPT-5.2正式发布:超越人类专家,你的工作要被AI取代了吗?

100. 今天北京时间凌晨,OpenAI发布的GPT-5.2凭借“最大推理资源运行”模式引发关注。本文结合公开基准测试数据,将其与Anthropic旗舰模型Claude Opus 4.5进行核心能力对比,揭示两者在关键技术维度的表现差异。 一、核心优势:GPT-5.2全面领先,科学与抽象能力尤为突出 科学领域统治级表现 GPQA Diamond(无工具科学问答):GPT-5.2以92.4%的准确率超越Opus 4.5(87.0%),彰显其复杂科学知识整合能力。 CharXiv Reasoning(科学图表推理):GPT-5.2以82.1%显著领先Opus 4.5(数据未公开),显示其在科研场景的潜力。 抽象推理与数学能力碾压 ARC-AGI系列(抽象推理):GPT-5.2在ARC-AGI-1(86.2%)和ARC-AGI-2(52.9%)中均大幅领先Opus 4.5(80.0%/37.6%),体现其强大的模式识别与逻辑迁移能力。 AIME 2025(竞赛级数学):GPT-5.2以100%准确率登顶,远超Opus 4.5(92.8%),巩固其在高难度数学问题中的领先地位。 工程与知识应用优势 SWE-Bench Pro(软件工程):GPT-5.2以55.6%的解决率领先Opus 4.5(52.0%),适合复杂编程任务。 GDPval(知识工作):GPT-5.2以70.9%领先Opus 4.5(59.6%),显示其综合知识应用能力。 二、Opus 4.5的差异化竞争力 在FrontierMath(前沿数学,Tier1-3)任务中,Opus 4.5表现优于GPT-5.2,显示其在特定数学领域的深厚积累。 具体表现如何,待上架codex后会第一时间上线中转站供大家体验

101. 【先进制造研究院】刚刚,OpenAI迎10周年,发GPT-5.2,重点是和白领抢工作

102. GPT-5.2 横空出世:当 AI 比肩人类专家,我们正站在智能革命的拐点

103. GPT 5.2震撼发布:多项能力大幅超越对手,打工人的AI助手终于来了

104. GPT-5.2上线ChatGPT与API,编程、电子表格与工具使用全面升级

105. GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂

106. 今天凌晨,OpenAI发布GPT-5.2模型,仅距离5.1发布不到一个月。这次更新最大的亮点是在GDPval指标上从38.8%暴涨到74.1%——这意味着在74%的知识型工作任务中,AI已经能达到甚至超越拥有14年经验的专家水平。 GDPval是OpenAI提出的全新评估体系,覆盖美国GDP前九大产业的44个职业领域,包括律师、医生、工程师、文员等,测试任务涵盖1,320项真实工作场景。但GPT-5.2 Pro的价格也相当夸张:输出168美元/百万tokens,是DeepSeek的上百倍。 本期视频深度解读GPT-5.2的核心能力,并实测对比DeepSeek、Claude 4.5和Gemini 3 Pro,看看谁才是真正的王者。 视频时间戳:  00:00 🚀 GPT-5.2发布:一个月内的紧急迭代  00:25 🔥 为什么这么快?Anthropic和Google的压力  01:12 📊 GDPval:衡量AI在真实工作中的新指标  04:45 💼 GDPval任务示例:制造工程师、订单文员  08:18 📈 从38.8%到74.1%:5.2的巨大飞跃  10:00 💻 编程、长文本、视觉能力全面提升  12:33 💰价格公布:Pro版168美元,太贵了?  14:09 🧪 实测对比:DeepSeek vs Claude vs Gemini,谁更强? #ai新星计划 #深度思考 #ChatGPT #AI #gpt5

107. GPT-5.2上线24小时:专业测试封神,用户体验却翻车?

108. GPT-5.2 完整指南:深度解析 OpenAI 最新 AI 模型的新能力

109. GPT-5.2重磅发布!来看看性能、价格及国内如何使用!

110. GPT-5.2新鲜出炉,学术科研专业场景碾压Gemini 3系列?

111. OpenAI 发布 GPT-5.2 迎战反击硬杠谷歌 Gemini,号称智能体编码最强,Altman 料 1 月重磅再推新模型

112. GPT-5.2发布,有哪些提升

113. IMO、IOI之后,AI再夺奥赛冠军!

114. OpenAI 亮出王牌回击 Google!GPT-5.2 登场、专业能力更强

115. GPT- 5.2:OpenAI 最新旗舰级 AI 模型详解

116. OpenAI:GPT - 5.2测评数据跃升,推理能力突破

117. OpenAI发布GPT-5.2,在AI竞赛中对谷歌发起反击

118. GPT-5.2引爆AI生产力革命!产业链迎来“智能替代”新机遇

119. GPT-5.2 深度实测:高强度使用后的真实体验

120. OpenAI GPT-5.2 模型发布,深耕表格 PPT 与超长上下文处理

121. GPT-5.2来了,智能表现与实用能力全面提升

122. GPT-5.2发布,最适合打工人的AI来了!

123. OpenAI“代码红色警报”后首发:GPT-5.2深度剖析——AI专业时代的“思考者”来了?

124. 当AI拿下数学奥赛金牌:GPT-5要来了,而GPT-6已在路上

125. GPT‑5.2来了,有哪些黑科技?

126. 碾压竞品!GPT-5.2正式发布,错误率大降38%!

127. 251212-GPT-5.2全方位评测及应用体验分享

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章