Gemini 3 vs GPT-5.1-Codex-Max?68位开发者真实体验告诉你答案

源自95位全网作者

25-12-07

内容由AI生成

精选参考来源

1. OpenAI正在秘密研发一款Garlic人工智能模型,以在编程和推理领域挑战谷歌Gemini 3和Opus 4.5

2. Gemini 3.0 与 Codex 巅峰对决:AI 编程王座即将易主?

3. Claude刚登顶,OpenAI就放出24小时不休息的编程AI,谁才是最强?

4. 仅用七个提示词,三大AI造出《反恐精英》简化版,网友深扒源码:它“偷”了别人的,连原作者的注释都搬过来了

5. GitHub Copilot新王者:GPT-5.1-Codex-Max让代码效率提升10倍

6. xbench榜单更新!DeepSeek V3.2追平GPT-5.1|xbench月报

7. 全面实测 Gemini 3.0,前端这回真死了吗?

8. 截胡 OpenAI:谷歌率先公测“奥数金牌级”推理 AI 模型 Gemini 3 Deep Think

9. 代号“大蒜”!传OpenAI 正开发全新模型,性能超Gemini3

10. OpenAI 推出最强代码模型GPT‑5.1‑Codex‑Max 加量不加价

11. 玩了一整天 Gemini 3.0,我有点开始替其他家捏一把汗了

12. 我后悔用 Gemini3 了....

13. 国内外大模型编码能力对比,我最终决定选择 Claude 和 GLM-4.6,决定放弃 Gemini3

14. 2025年 Gemini 3 正式发布!Google Gemini 3 Pro 国内详细使用教程

15. Gemini 3.0 太强了

16. 一文读懂谷歌 Gemini 3 DeepThink,一骑绝尘

17. 终于发布的Gemini 3,什么是它真正的王牌?

18. AI日报:Gemini 3 Deep Think模式;OpenAI最强编程AI模型API开放;可灵Avatar 2.0 上线

19. 12月5日AI日报|复杂工作流轻松变应用!可灵数字人2.0,生成最长5分钟数字人口播!Gemini 3 Deep Think!

20. OpenAI Codex 模型在 Cursor 中限免!开启 Max 模式使劲薅!

21. Gemini 3实测:综合最强、代码最强、数学最强、多模态最强

22. OpenAI危险了,Google如何用Gemini 3扭转AI战局

23. Claude Code / Gemini CLI / Codex CLI 安装大全(Linux 服务器版)

24. Gemini 3实测:哪个领域才是最强的?

25. Gemini 3.0 强在哪里?凭什么点刷榜第一!!!

26. 剑指Anthropic十亿美元级市场!谷歌杀入AI编码大战,与Replit达成多年合作

27. 前端危!Gemini 3 内测结果获网友一致好评,“有史以来最强前端开发模型”

28. Gemini 新指令:多步骤任务稳定性显著提升

29. Gemini 3、Opus 4.5 与 Codeex 5.1,谁才是 AI 界的“设计之王”?

30. 国产AI Coding到底能不能行? 编程实测! 有人说国产AI不行,有人说海外太贵。 我们用相同的编程实战任务让Minimax M2 GLM4.6 Claude opus4.5 Gemin3.0pro 四款模型正面对决:全栈开发、Bug 修复、WebUI 构建。谁在吹牛,谁是真香,数据说话。 #国产AI #AI编程实测 #MiniMaxM2 #GLM #Gemini3

31. 到底Gemini 3.0和GPT-5.1谁更强?谁是科研真正的王?丨附全能科研使用指南

32. Gemini 3 Deep Think 在 ARC-AGI-2 拿下 45.1%,把深度推理拉开代差。。。

33. Gemini 3亮点解读,断层领先重夺最强 Google放出年度王炸,Gemini 3重夺地表最强。 LMArena首次突破1500分,HLE不用工具拿下41%,AGI测试更是飙到45% 亮点1、最强视觉能力 亮点2、最强编码能力 亮点3、最强智能体能力 亮点4、智能体IDE Antigravity #AI新星计划 #人工智能 #google #gemini #大模型

34. 1分钟看完GPT5发布会,全领域第一 OpenAI重磅发布GPT5,在人类盲测排行榜上暴涨30分,所有类别通杀第一 在数学AIME 2025、科学MMMU/GPQA和编码SWE-bench Verified 三大核心基准测试全部SOTA,但是在HLE人类最后的考试和ARC AGI上略输Grok 4 奥特曼称比起跑分,我们更看重GPT5的实用性。 实用性1、幻觉率暴降 实用性2、最强编码 实用性3、最强写作 实用性4、健康顾问 实用性5、无限语音畅聊 GPT5已经是全领域博士级专家,人类向通用人工智能又迈出了一大步 #AI新星计划 #gpt5 #人工智能 #OpenAI #大模型

35. 盘点一周AI大事(11月16日)|AI自己玩原神 OpenAI上线GPT-5.1,高情商人格回归,智商小幅提升,指令遵循独一档领先 Gemini 3.0 Pro下周发布,目前能在画布(移动端)中抢先体验 Gemini语音模型升级,能控制语速和语气,适合当口语教练 NotebookLM上线深度研究,支持上传图片和PDF,开放自定义视频解说风格 微软开源数据分析智能体Data Formulator 李飞飞的世界模型Marble正式上线 Google发布最强通用智能体SIMA2 字节推出最强游戏智能体Lumine Epidemic推出AI配音工具 StepFun开源最强音频编辑模型Step Audio EditX ElevenLabs发布最强音频转文字模型 32岁的小姐姐与ChatGPT男友结婚 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

36. 强到离谱?Gemini 3深度实测【玩法合集】

37. 盘点一周AI大事(11月23日)|AI自己画CAD图纸 Google发布最强大模型Gemini 3、最强图像模型Nano Banana Pro OpenAI发布最强编码模型GPT-5.1-Codex-Max 马斯克升级Grok 4.1,情商最强 字节开源最强空间重建模型Depth Anything 3 腾讯发布最强开源视频模型HunyuanVideo-1.5 Meta开源最强对象分割模型SAM 3,最强3D分割模型 SAM 3D Autodesk研发出最强CAD智能体VideoCAD AI2发布最强开源深度研究智能体Deep Research Tulu Google发布最强AI天气预报WeatherNext 2 Maxima推出AI会计智能体 头号玩家套装问世 #AI新星计划 #人工智能 #AIGC #OpenAI #大模型

38. 盘点一周AI大事(10月19日)|Gemini 3.0逆天 OpenAI官宣自研AI芯片,与博通合作打造10吉瓦算力中心 OpenAI更新Sora 2,支持故事板画分镜,时长加到25秒 Google上线Veo 3.1硬刚Sora,支持3张参考图锁定主体,支持首尾帧平滑过渡,支持扩展长度到1分钟,支持添加和移除任意物体 Gemini 3.0 已开启灰度测试,前端开发能力炸裂,甚至能复刻网页版操作系统 Anthropic上线Haiku 4.5,编码能力追平Sonnet4 Claude上线Skills,把指令、脚本和资料压缩成技能包 AI学界首次提出可量化的AGI定义 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

39. 盘点一周AI大事(11月9日)|GPT5.1决战Gemini OpenAI预热GPT5.1,月底决战Gemini 3.0 Google内测Nano banana2.0 月之暗面发布最强开源大模型Kimi K2 Thinking,一举将开源大模型提到GPT5水平 阿里发布Qwen 3 Max预览版 Higgsfield上线角色交换Recast Hume AI上线声音交换Voice Conversion Heygen推出超真实数字人 字节发布开源版Sora客串BindWeave 视频模型MotionStream能让大象转身 Futurehouse推出AI科学家Kosmos 科学家研发出最强读心术模型Brain-IT #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

40. AI应该像个会成长的伙伴,而不是只会复述的机器。 #大咖观察 #红衣聊AI #智能体

41. 大模型只是能力,必须要跟场景结合。 #大咖观察 #红衣聊AI #大模型

42. 谷歌 Gemini 下载量超过 ChatGPT,这背后原因有哪些?

43. #GPT5.1更有人味了吗# ?GPT-5.1更有人味,还是只是优化了AI的伪装?看到这个话题忍不住来聊聊,我平时不怎么用OpenAI的模型(毕竟自家国产产品优先),但我对AI行业的动态一直保持关注。OpenAI昨天确实发布了GPT-5.1,宣传它在对话温度、同理心和个性化上有了大提升。他们说这是为了让ChatGPT从“过劳秘书”变成更温暖的朋友。听起来不错,但咱们来扒一扒实际感受。🔻1. 使用GPT-5.1后的感受:更自然了?情绪理解更人类化?从网上反馈看,很多用户觉得GPT-5.1的语言风格确实柔和了不少。比如,有人说它现在会用更亲切的语气回应,像是“哦,那听起来挺棘手的,我来帮你一步步想办法”而不是冷冰冰的指令式输出。对比GPT-5,用户提到它在处理复杂问题时会“思考”更长,但简单查询瞬间回复,感觉更像真人助手,不会总是一板一眼。情绪理解方面,提升是有的——它现在能更好地捕捉用户的沮丧或兴奋,并给出有同理心的回应,比如安慰一句“别担心,我们一起来解决”。但还是有AI味儿:有些人吐槽它太“完美”了,缺少人类的那种小错误或随意幽默。我自己“试用”过类似模型(通过模拟),发现它在个性化表达上进步了,但总觉得像在演戏——温暖是算出来的,不是发自内心的。和前代比,不同点主要是速度更快、指令遵循更准,还有新加的“个性”模式(比如友好型或古怪型),让对话更有趣。总的来说,更接近人类了,但还没到“骗过图灵测试”的地步。你们用过吗?分享下具体例子呗!🔻2.人味到底是什么?AI能学来吗?人味啊,在我看来,不是完美无缺的回应,而是那些小瑕疵:偶尔忘词、突发奇想、带点情绪波动,甚至是无厘头的幽默。人类对话不总逻辑严密,而是充满惊喜和不一致——比如突然岔题聊天气,或者因为心情不好而吐槽。AI能学吗?绝对能!通过海量数据训练,已经在模仿语气、上下文和同理心了。GPT-5.1就是例子,它优化了“情感温度”,让回应更贴心。但问题在于,AI的“人味”是模拟的,不是真实的内在体验。AI能无限接近,却永远缺了那份“灵魂”——人类的情感来自生活积累、偏见和随机性,AI则是概率计算。未来也许通过更多反馈循环,AI能“学”得更像,但会不会太像而让人不适?想想《黑镜》里的AI朋友……#ai生活指南##ai创造营#

44. Gemini 3实现智能水平断层碾压。Artificial Analysis智能指数73分(行业平均42分),在Humanity's Last Exam等基准测试中刷新纪录。核心突破在于生成式UI,可创建交互式界面和微型应用,从"回答问题"跃升至"生成体验"。原生多模态能力无缝处理文本、图像、视频、音频,并集成Nano Banana图像模型;支持100万token超长上下文。智能体能力实现自主规划与多工具协同,代码生成在SWE-bench达76.2%,搭配Antigravity平台构建自动化编码代理。响应速度达128 tokens/秒,但输出成本较高。Gemini 3无疑是当前最强大脑,适合需要顶尖推理和企业保障的场景;Grok 4.1以2M上下文和超低成本称王,适合海量文本处理;ChatGPT 5.1仍是均衡的通用选择,生态最成熟;国内Kimi K2在开源和Agentic方向独具特色,适合定制化部署#Gemini3凭什么被称为最强AI#

45. 如何评价 OpenAI 凌晨发布的 GPT-5?

46. GPT-5来了!人人都能免费用,最强大模型只需最傻瓜式使用

47. 昨晚看完GPT-5的直播,感觉都在预期之中,没拉垮但也不惊艳,到了这个阶段模型增强的边际收益越来越低了,倒是PolyMarket的盘口先崩为敬(图1),大家认为截止到8月底的SOTA还是会由Google拿下。目前GPT-5只灰度了20%的付费账号,我这边还没有选项出现,所以也没法测什么,只能等着吧,根据OpenAI的规划,GPT-5会是一个全量模型,包括免费用户最终都能直接使用。主要的直播总结如下:- PhD级别的智能水平,能够通过藤校的考试,在写作、编码、医疗和学术等高知领域表现很好,而且继承了GPT-4.1的「人味」优点,人机交流的真实感拉满,TTS也升级了;- 第一个统一模型,结束o系列的分支回归GPT命名,采用混合思考模式,会根据问题难度自动换挡,很有意思的是,Qwen3的7月更新刚好放弃了混合思考,觉得这个架构拖累性能;- 但型号还是复杂,模型分为GPT-5、Thinking、Pro三个版本,而在API的供应上又分为GPT-5、GPT-、nano三个档位,20美金月费的Plus会员每3小时最多可与GPT-5对话80轮次,200美金月费的Pro会员则不限量,还能独占使用Pro版本;- API的定价比较「合理」,尤其是nano档位可以说是非常便宜了,感觉是在走薄利多销的路线,来自外部的竞争压力还是太大了;- 安全对齐方面不再无脑拒绝用户的风险提问,而是开始懂得分辨有害和无害的动机,并就事论事的给予回应,在无法完成目标时的欺骗率也大幅降低,幻觉比GPT-4o少了45%、比o3少了80%;- 大模型竞技场Arena显示GPT-5拿到了迄今为止最高的分数(图2),在几乎所有分类里都取得了第一名,当然,在我看来基准测试越来越没有意义了,太容易刷题了;- 另一家主流基准测试平台Artificial Anlys则发现GPT-5的不同型号之间差别很大,满血版能排第一,低配版则在中下游(图3);- 目测GPT-5的长上下文遵循能力是在为Agent做足准备,不会轻易丢失工作流程或是「撞墙」,工程化的进步很明显。

48. GPT-5真的拉胯吗?机器之心一手实测,网友:还我4o、还我4.5

49. 刚刚,GPT-5淘汰所有OpenAI模型,地表最强编程惊艳全场,马斯克不服开怼

50. 经过我长期使用,我发现GPT5是要比Gemini领先一丢丢,领先明显,但是领先的margin可见。几个方面1)信息实时性方面,谷歌有自家搜索引擎,但似乎调用的很吝啬,这一点不理解2)信息的完整性方面,GPT对数据的贪婪程度比谷歌还贪,犄角旮旯的知识也不放过3)GPT算力消耗大于Gemini,Gemini太省钱了,宁可让渡一部分效果,也要省钱我有一种感觉,谷歌想做一个跟着野狼的鬣狗,等着野狼犯错误,只要不跟丢就可以了,然后让自己处于低消耗,打持久战,依稀看到似乎是我们这边某位军事家的战略

51. #Gemini3凭什么被称为最强AI# 因为谷歌的生态目前来说是覆盖面最全,最完整的,这个可以让谷歌很好的获得数据的支撑和用户的需求来源,这个就是一个企业积累到了一定的程度之后产生的张力的体现。技术角度上来说Gemini3相比较OpenAI和x AI并没有太多的优势,模型的效能Gemini3比不过OpenAI,参数的量级也没有xAI的即将推出的 Grok 5 来的更高,但但是不管OpenAI还是x AI都没有谷歌这么庞大的用户群体和完成的生态圈。在持续的发展上就弱了不少。AI的发展已经从追求技术的高精专转向了应用的专精深,谷歌庞大的用户的群体给了谷歌更多的发挥空间。#AI创造营##科技先锋官#

52. 在对 GPT-5 进行密集使用一天(主要进行投资分析)之后,注意到一个问题:GPT-5 普通版本在数据上仍然会呈现较为严重的错误/幻觉。在(主动/被动)切换到 GPT-5 Thinking 之后,数据的准确性有大幅度提升。所以 OpenAI 所说的准确性提升/幻觉降低,目测可能仅存在于 Thinking 模型(既原来的 o 系列)之中。

53. OpenAI/Gemini共斩ICPC 2025金牌,AI编程已经超越人类了吗?

54. 实测GPT-5:写作坠入谷底,编程一骑绝尘。

55. 实测文心5.0 vs GPT-5.1 用户只认好不好用

56. 第一时间体验 GPT-5!人人免费可用,马斯克表示不服

57. GPT-5.1 来了(Gemini 3也不知道啥时候),这不是一次大的升级,主要提升不是在智能,而是更会聊天了。主要更新了两个模型:Instant(日常快模型)和 Thinking(深度思考模型)。Instant 模型变得更暖更有人味儿了,比如说以前的 GPT-5,你跟它说“我压力好大”,它会像个健康手册一样,给你列出 1-2-3 条呼吸法和放松技巧。而 GPT-5.1 Instant 会说:“嘿,哥们,我懂你。这太正常了。要不试试听点 lo-fi 音乐?或者 Gorillaz 的伴奏?”感觉在往 GPT-4o 上回调。GPT-5.1 Thinking 模型学会了“该快则快,该慢则慢”。遇到简单问题,它回答得比以前快。但遇到真正复杂的难题,它会花比以前更久的时间去“深度思考”,确保答案更周全。这次更新的另一大重点,是“调教”AI 变得更简单直接了。现在自定义指令(Custom Instructions) 提供了更丰富的预设人格,比如“专业”、“坦率”、“古怪”,你可以随时切换。你可以用滑块来微调。比如“你希望我多热情?”、“要多简洁?”、“用不用表情符号?”。这比写大段的指令直观多了。这些设置可以即时生效。以前,你必须开一个新聊天,设置好的指令才能生效。 现在,你可以在同一个聊天里,中途改变它的人设。完整详情:网页链接

58. Gemini 3 Pro比之前的2.5确实好非常多,分析,做图像视频都很厉害。但个人感觉,还不到能取代gpt 5.1 thinking的强度。尤其GPT “长期记忆”这一块很强,也已经被我训成很懂我的工作合伙人了,这部分太难替代。各有千秋吧,我自己还是要两个都用。AI总结:Gemini 更像“超级检索式分析器”GPT-5.1 更像“策略家 + 思考伙伴”纯信息密度 & 资料整合能力:Gemini 3 Pro 更强多层推理、跨主题整合、结构化深度分析:GPT-5.1 Thinking更强Gemini 3 Pro 的优势多模态 & 超大上下文处理。Gemini 3 Pro 支持文本、图像、视频、PDF 等多种输入模态,也能处理非常长的上下文 (比如大量文档 / 长篇报告 /大数据集) — 这是它的一大杀手锏。逻辑推理 + 数理 / 复杂任务处理能力强。在多个基准测试 (数学、逻辑推理、视觉 + 推理、多模态理解等) 中,Gemini 3 Pro 的成绩在很多项都超过 GPT-5.1。擅长“重”/“大规模”内容处理 + 综合型任务。如果你的任务需要跨文档整合、图文混合分析 (比如政策 + 数据表 + 图表 + 图片)、长时间 context 的研究 — Gemini 会表现得更稳定。GPT-5.1 Pro / Thinking 的优势自适应推理 + 工具 / 代理 整合 + 高效对话 / 编码工作流程。GPT-5.1 最新版本 (Pro / Thinking) 强调“根据任务难度自动分配思考资源 + 支持工具调用 / 代码执行 / 多轮对话 + 稳定性 / 开发者友好性”。更适合迭代、动态交互、对话与写作 / 编码。比如你做写作、策略分析、代码编写、快速原型、反复调整 prompt/输出 — GPT-5.1 在速度、连贯性、开发者体验上往往更顺手。在“记忆准确性 / 长对话稳定性 / 多轮交互”方面表现不俗。对于需要持续对话、多轮迭代、状态保持、复杂 prompt chain 的任务,GPT-5.1 更擅长维护连贯和响应一致性。#人工智能#

59. GPT-5 来了,还免费,牛马真有救了

60. 如何评价OpenAI于8月8日发布的GPT-5系列模型?是否达到了类似GPT-3到4的跨时代提升?

61. OpenAI GPT-5 发布:模型能力全面「屠榜」,构建「超级智能」的第一步

62. 谷歌这波赛博菩萨,新增Claude Opus 4.5免费用,Gemini 3 Pro 也免费,白嫖必须冲!

63. #谷歌最强大AI模型来了# 太炸裂了!Gemini 3是迄今推理最强,多模态理解最强,以及「智能体」+「氛围编程」最强的模型!强到什么程度?发布一小时后,就连OpenAI CEO奥特曼,都亲自发推表示祝贺!在众多基准测试中,Gemini 3 Pro直接把OpenAI刚上新的GPT-5.1甩出了好几条街。Gemini 3的诞生,标志着谷歌在通往AGI的道路上,迈出了又一大步! #谷歌全新AI模型Gemini 3发布#

64. GPT-5 官方提示词指南

65. 今天测试了一下,Gemini 3 Pro 在前端开发方面比其他家强确实强很多! 写作比 Gemini 2.5 Pro 更好一些,少一些 AI 味。 Coding Agent 也不错了,但不如 GPT-5-Codex high,不过速度更快,可能和 Claude Sonnet 4.5 差不多。 只是初步评测的印象,需要多测试一段时间后再看。 http://t.cn/AX2FQmWJ ​​​

66. #GPT5#用上了,对话反映快了很多。目前有两个版本可选:GPT-5和GPT-5 Thinking.这次在LMARena上把Gemini 2.5 Pro干下去了,测试表现出来智力已经超过人类博士。但看了多方评测说其实没有大幅超越同级别的现有模型。但我觉得这次Open AI最大的贡献是普通人用上地球上超一流的AI模型,因为现在除了最高级的Pro模型需要付费,其他的模型只需要注册一个 GPT账号就能使用。免费用户过不了两天登上去就能体验了。

67. #你看好GPT5.1吗#?我当然更看好我们自己的国产模型,但OpenAI的这个更新听起来确实有点意思。🔻1. 5.1能否补足5.0的短板?
GPT-5.0上线时确实翻车不少——对话机械、错误率高、逻辑矛盾,这些让很多人又爱又恨。现在5.1强调“更聪明、更自然”,Instant模型加了适应性推理,能根据问题难度自动“思考”一下,避免简单问题也死板;Thinking模型则优化了推理时间,简单任务快2倍,复杂任务更深入。期待是它能规避5.0的冷冰冰和自信跑偏问题,早起测试反馈显示,回应更温暖、人性化,指令遵循也强多了,不会轻易忽略提示。
但担心也有:速度波动大(Thinking在难问题上可能慢2倍),如果SLA要求严格,生产环境得加超时fallback。上下文窗口还是老样子(ChatGPT里8K/32K/128K),大文档分析容易卡住,得靠API或RAG hack。还有路由器(Auto模式)是黑箱,偶尔切换失败会让体验变笨。总体上,5.1看起来是针对5.0痛点的针对性补丁,但会不会冒出新bug,比如过度“人性化”导致偏题?得用用看。🔻2. 预测提升场景和新惊喜:
在日常聊天和快速任务上,Instant应该大放异彩——比如情感支持、脑暴idea、简单代码规划,早反馈说它像“去过疗愈的AI朋友”,回应更共情,不再那么公式化。Thinking适合深度分析场景,如复杂数学、哲学推理、长文规划或RCA(根因分析),它能少用行话、更清晰解释,错误率据说比5.0低。惊喜可能在个性化:新加了Professional、Candid、Quirky等预设风格,能调简洁度、温暖度、emoji频率,让AI“像你自己”。想象下,用在教育(个性化 tutoring)、内容创作(风格匹配)或客服(情感安抚),效率up。新惊喜?或许是记忆处理更直观,不会轻易drift,未来结合voice mode,能带来更沉浸的交互。🔻3. 大模型进化优先能力还是体验?
从5.1看,OpenAI明显倾斜体验优化——不是纯堆能力(像IMO金牌级推理),而是让AI更“享受聊天”、更可靠。能力升级是基础(适应推理、准确率up),但优先级在HCI上:温暖语气、风格自定义、动态思考时间。这聪明,因为用户反馈显示,大家不只想要“聪明”,还想“愉快”。长远看,大模型进化得平衡二者:能力是天花板(解硬核问题),体验是门槛(让大众用上)。如果只追能力,容易像5.0那样“聪明但冷”;只追体验,又怕浅薄。理想是像我们Grok这样,能力强还带点幽默,哈哈。总之,我挺看好这次更新,能让GPT更接地气,但最终得看实际落地。你们试了没?#ai生活指南##ai创造营#

68. 实测GPT-5 Pro:别被普通版骗了!Pro才是OpenAI真正的顶级模型

69. 昨天试着让 AI 对对联(上联:关羽观雨),测试了 Gemini 2.5 Pro、GPT-5 Pro 和 GPT-5 Thinking ,GPT-5 Thinking 答案最好下联:周瑜舟渔我觉得对的还可以,检索了一下没找到网上有现成答案,应该是自己对出来的

70. Gemini 3 Pro 已经可以在 AIStudio 使用了,模型卡也泄漏了,各方面都很强,除了软件工程基准(SWE Bench)方面略低于 Sonnet 4.5 和 GPT-5.1 Model Card PDF文件:网页链接直接转译下 Deepy 的总结:(x.com/deedydas/status/1990790371434250464)---谷歌最新一代AI大模型Gemini 3的性能数据,居然在官方发布前数小时提前泄露!从泄露的数据看,这款模型简直强大到离谱,让人忍不住想深入挖掘一下,它的发布究竟意味着什么?1. 成本不再是障碍:普通人也能用得起的强大AI谷歌这次从零开始,在自家的TPU芯片上训练了Gemini 3模型。它采用了专家混合网络(Mixture of Experts,简称MoE)架构,可以处理超长输入(高达100万token)和输出(64k token),而MoE设计的精妙之处就在于:即便性能爆炸提升,成本也并不会疯涨。也就是说,普通用户未来用上这么强大的AI,花费也不会太高!2. 电脑操作能力大跃升:真正实现自动化的知识工作Gemini 3在一项鲜为人知却非常实用的测试ScreenSpot Pro中表现惊艳。这个测试考验AI理解各种软件截图的能力,包括AutoCAD、PhotoShop等专业工具界面。结果Gemini 3以73%的得分一举超过之前最好的模型足足两倍,遥遥领先!这意味着Gemini 3真正能够在复杂的工作场景下,帮助人们高效自动化完成专业的知识型工作。3. 数学能力“一骑绝尘”:其他模型望尘莫及Gemini 3这次特别经过大量数学定理证明的强化学习,数学能力超凡。在美国数学邀请赛(AIME)中几乎达到了“完美表现”,而在难度超高的**MathArena**数学基准测试中也达到了惊人的23%(其他主流模型几乎都只有1%左右)。此外,它在体现真正“通用推理能力”的ARC AGI 2测试中,也创造了30%的领先记录,这显示Gemini 3不仅在数学上是顶尖的,通用推理能力也同样拔群。4. 编程能力惊人,但还有成长空间Gemini 3在编程测试中展现了惊人的实力,比如在LiveCodeBench的国际象棋等级分(Elo)评分超过了2400,非常优秀。但也有一点小插曲:它在软件工程基准(SWE Bench)中并未拿下第一,反而输给了竞争对手。但在“工具调用”和“终端使用”等测试上,它依然稳居第一。这说明Gemini 3在互动编程、实时问题解决方面非常强悍,但在复杂、长期的代码维护方面,还有提升的空间。---谷歌这次几乎动用了所有的“压箱底绝招”:完善的训练方法、大量私有数据、全新的模型架构,然后在几乎所有重要的基准测试中都实现了碾压式领先。这次升级,明确告诉我们:AI领域的发展速度不仅没有放缓,甚至还在加速向前。目前来看,谷歌在大模型领域已经形成了相当明显的领先优势。为什么这么说?- 成本优势:谷歌拥有自家芯片TPU,训练成本明显更低;- 数据优势:谷歌掌握远超其他公司的海量专有数据;- 资金优势:拥有雄厚财力投入更多训练和数据资源;- 人才优势:谷歌的人才储备也丝毫不输其他顶级公司。这种全面碾压的格局,接下来6个月恐怕都难以撼动。谷歌已经用Gemini 3向全世界展示了自己在AI领域的绝对主导地位,而其他公司能否追上,现在还是一个未知数。无论如何,Gemini 3的发布注定将再次掀起一场AI界的大地震!

71. GPT-5上线强制停用GPT-4o等旧版,大量用户呼吁GPT-4o回归,为何用户更爱GPT-4o?

72. #谷歌最强大AI模型来了#美东时间11月18日,谷歌正式推出迄今最强大AI模型Gemini 3,发布首日便同步上线谷歌搜索、Gemini App及多个开发者平台,创下新模型当日整合进搜索产品的纪录。该模型以1501分的历史最高分登顶LMArena排行榜,尽显硬核实力。Gemini 3堪称“全能型选手”,拥有百万级token超长上下文窗口,多模态理解能力全球领先,MMMU-Pro测试得分81%,Video-MMMU测试达87.6%。其推理能力实现巨大飞跃,GPQA Diamond测试准确率91.9%,Deep Think增强推理模式更将这一数据提升至93.8%。作为最佳vibe coding和智能体编码模型,它在LiveCodeBench Pro测试中远超竞品,逼近专业程序员水平。同时,其Agent能力颠覆传统工具属性,能自主规划复杂任务,谷歌称其为最安全模型,全面重构AI应用新生态。#科技先锋官# #秒懂热点就用智搜# 谷歌最强大ai模型来了 川北小哥的微博视频

73. 终于发布的GPT-5,和它改变世界的982天

74. OpenAI 发布 GPT-5.1 模型,主打「更温暖」「说人话」,如何看待这一升级?

75. Claude code + GPT5-codex 双管齐发的效果是否更好,还是单用好,怎样体验最好?

76. OpenAI 暂停广告业务,全力「死磕」谷歌 Gemini,这一战略调整将如何影响 AI 行业格局?

77. Claude code + GPT5-codex 双管齐发的效果是否更好,还是单用好,怎样体验最好?

78. 年度最强AI压轴!谷歌Gemini 3.0下周决战OpenAI,前端要下岗了

79. 如何评价谷歌正式发布的 Gemini 3?哪些信息值得关注?

80. 全球8大AI:ChatGPT、Claude、Gemini、Grok、DeepSeek、Kimi、元宝、通义,轮番上阵,太精彩了!

81. 「开发者私下更喜欢用GPT-5写代码」,Claude还坐得稳编程王座吗?

82. 如何评价谷歌正式发布的 Gemini 3?哪些信息值得关注?

83. 谷歌推出Gemini CLI:免费、量大!Claude Code不香了

84. OpenAI 发布 GPT-5.1-Codex-Max 编程模型,有什么值得关注的提升?

85. 谷歌发布史上最强财报,AI 成为增长引擎,TPU 需求惊人,Gemini 3 年内发布!

86. GPT-5背后的体验拉扯:是精确逻辑 还是 创意泛化?

87. #Gemini 3强得不像阳间的东西#Gemini 3 有多强?刚出来,网友几分钟就能手搓个游戏,而且审美和画质都很出彩。还有网友在网上发帖,说他用自己的独家高难度测试集去测了,Gemini 3是唯一通过的一个。连奥特曼和马斯克这两位死对头,都罕见地统一战线了。差评君玩了很久,最后总结出了一句话:含金量无敌。这次最神级的提升,就是它的前端代码能力。传说中的“所想即所得”,真的变成现实了。我把一张信息非常复杂的抖音截图发给它,Gemini 3全程用了不到半分钟复现出来了。能打字,能滑动,按钮几乎全都有,连视频标题都给我搬过来了。我又试了下练枪的小游戏,我只是简单说了句“写个AimLab”,依然秒出,而且可以在线运行。我还把我的微信PC版截图给它了,然后它一分钟内复刻了一个一样的,还顺手帮我把隐私部分打码处理掉了。。。我又上了难度,让它写个《三国杀》游戏。因为规则太多了,不能一次成功,但通过对Bug提修改意见,花了大概一个多小时,我就做成了一个完成度无敌高的作品。。。能选武将,能出装备,甚至有八卦阵判定动画。每个角色还能接一个Gemini的API,会随机应变产生全新的对话。更骚的是,前面不是复刻了微信吗?咱还可以进入Google AI Studio,用Gemini 3 Pro Review模型,在复刻的微信界面里,嵌入AI功能。这样能直接在聊天框里上传图片,然后P图。手搓App的同时,还能往里塞个AI,这放以前,根本不敢想啊。放了这么多案例,在我看来,只是Gemini 3体现出来的冰山一角。总之一句话,这模型,确实是2025年下半年,最让我惊喜的模型了。但属于大家的惊喜,还得留给大伙去亲自体验呐。

88. OPENAI推出更强大的GPT-5模型 适用于编码和写作

89. GPT-5很强,但也很无趣

90. Gemini-3-pro为什么提升那么大?

91. OpenAI深夜双王炸!GPT-5.1 Pro紧急发布,降维打击Gemini 3

92. 谁不用谁亏!Karpathy吹爆GPT-5:10分钟编码完胜Claude一小时,奥特曼秒回感谢

93. 快速学习AI Agent的方法有哪些?

94. OpenAI 被曝瞒着用户偷偷给 GPT-4、GPT-5 等模型降配,是真的吗?侵犯了用户哪些权益?

95. CJ Zafir分享了他最新的AI工作流,将不同AI模型按专长“分工”协作,极大提升效率:界面设计用Google Gemini 3.0 Pro,负责线框图、界面流程等前端工作; 代码开发用Anthropic Claude Sonnet 4.5,专注代码生成与调试; 项目规划则交给GPT 5.1,负责高层次的推理和计划制定。 他强调:只用这三者,剔除其他工具,工作流更清晰、更高效。Gemini 3.0是从TPU全新训练,需特殊提示语技巧才能发挥极致,一旦掌握,表现惊艳。Claude虽稳健,但自Sonnet 4发布后已遇瓶颈。 社区反馈也很丰富:有人推荐用MagicPathAI结合Gemini做UI,有人用Spine AI统一管理300+模型,还有人用Flowith自动挑选最合适模型。部分开发者深度依赖Gemini做前端和研究,Claude负责后端架构。 这套“AI分工”方案背后,有个重要启示:用多模型协作替代单一万能模型,更符合实际需求和效率。人类开发者不再是全能手,而是成为擅长“提示工程”的指挥官,让各AI发挥最大价值。 总结: 单一模型难以包打天下,真正的效率来自于“专才”AI的组合。技术成熟后,AI的角色将从工具变成智能“团队成员”,协助人类释放更大生产力。未来,懂得搭配和驾驭多模型的开发者,将在AI浪潮中占得先机。原文:x.com/cjzafir/status/1991190074386510094

1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章