Gemini 3.1 vs GPT-5.4?78位开发者实测后,结论出人意料
03-07 20:01
精选参考来源
精选参考来源
1. Gemini 3.1与GPT 5.4架构解析
什么值得买 2026-03-07 00:00:00
2. 2026年教育科技实测
什么值得买 2026-03-07 00:00:00
3. GPT-5.4深夜发布!与OpenClaw的技术共振
什么值得买 2026-03-07 00:00:00
4. 2026年GPT5.4镜像站实测
什么值得买 2026-03-07 00:00:00
5. Gemini 3.1 Pro vs GPT-5.2?78位开发者实测后,结论出人意料
什么值得买 2026-02-23 00:00:00
6. OpenAI 拉 “红色警报”,用 ChatGPT 5.2 反击 Google 最新 Gemini 3 系列模型,AI War?
微信公众号 2025-12-13 00:00:00
7. 谷歌发布Gemini 3.1 Pro
什么值得买 2026-02-24 00:00:00
8. 16天三大模型齐发
知乎 2026-02-26 00:00:00
9. Google 一出手就是王炸
微信公众号 2026-02-20 00:00:00
10. 谷歌王炸!Gemini 3.1 Pro 干翻 GPT/Claude,一句话生成应用
知乎 2026-02-21 00:00:00
11. 16项测试赢了13项!Gemini 3.1 Pro碾压GPT-5.2和Claude
知乎 2026-02-20 00:00:00
12. 谷歌Gemini 3.1 Pro屠榜,清华姚顺宇出手!Claude和GPT被逼入死角
什么值得买 2026-02-22 00:00:00
13. 突发!谷歌Gemini 3.1 Pro发布,Claude与GPT被逼入死角?性能如何
今日头条 2026-02-20 00:00:00
14. Gemini 3.1 Pro血洗Claude与GPT,12项基准测试第一!
微信公众号 2026-02-21 00:00:00
15. 谷歌Gemini 3.1 Pro震撼发布!性能暴增价格不变,12项测试全面碾压Claude与GPT
微信公众号 2026-03-03 00:00:00
16. 史诗级提升!谷歌Gemini 3.1 Pro相比3.0 Pro有哪些不一样的地方?
知乎 2026-02-23 00:00:00
17. Gemini 3.1正式发布(附教程)
抖音 2026-02-21 00:00:00
18. Gemini 3.1 Pro 发布
微信公众号 2026-02-20 00:00:00
19. 谷歌Gemini 3.1 Pro发布
今日头条 2026-02-22 00:00:00
20. 重磅!Gemini 3.1 正式发布
微信公众号 2026-02-20 00:00:00
21. Gemini 3.1 Pro: Gemini 最新升级
抖音 2026-02-20 00:00:00
22. Gemini 3.1 Pro。
抖音 2026-02-20 00:00:00
23. 谷歌放大招!Gemini 3.1 Pro发布
今日头条 2026-02-21 00:00:00
24. Gemini3.1 Pro 深度解读
微信公众号 2026-02-21 00:00:00
25. 谷歌Gemini 3.1 Pro重磅发布,推理能力跃升77%,多项指标破新纪录
今日头条 2026-02-21 00:00:00
26. OpenAI 发布最新模型GPT-5.4,能力有多强?实际体验如何?
知乎 2026-03-07 00:00:00
27. GPT-5.4 深度评测报告
知乎 2026-03-07 00:00:00
28. OpenAI发布最强专业模型GPT-5.4
今日头条 2026-03-06 00:00:00
29. GPT-5.4 发布
知乎 2026-03-06 00:00:00
30. 刚刚,GPT-5.4 突袭上线!百万上下文,AI 操作电脑,首次超越人类!
知乎 2026-03-06 00:00:00
31. OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了
知乎 2026-03-06 00:00:00
32. 连Claude死忠粉都换GPT-5.4了,OpenClaw省47%,Token半价碾压Opus!
知乎 2026-03-06 00:00:00
33. GPT 5.4,超越GPT-5.2Pro.知道你快,但不知道你这么快🥲
抖音 2026-03-06 00:00:00
34. 刚刚,GPT-5.4正式发布!
知乎 2026-03-06 00:00:00
35. Gemini 3.1 Pro 发布:实际有哪些提升?
微信公众号 2026-02-21 00:00:00
36. GEMINI 3.1 PRO 介绍
知乎 2026-02-20 00:00:00
37. 重回AI王座 Gemini 3.1 Pro为何“急”着封神? Gemini 3.1有何过人之处? 为何谷歌急于推出?#Gemini #谷歌 #deepmind #AI大模型 #多模态
什么值得买 2026-02-22 00:00:00
38. Gemini 3.1 Pro 深夜发布!Google 太吓人了
微信公众号 2026-02-20 00:00:00
39. OpenAI 发了 GPT-5.4,这次不是升级,是换赛道
知乎 2026-03-06 00:00:00
40. OpenAI封神之作,GPT-5.4重磅发布,附国内一些使用方式!
什么值得买 2026-03-07 00:00:00
41. Gemini 3.1 真实体验
微信公众号 2026-02-21 00:00:00
42. 告别简单问答!谷歌 Gemini 3.1 Pro 发布 推理翻倍搞定全场景复杂任务
今日头条 2026-02-20 00:00:00
43. Gemini 3.1 Pro深度拆解
知乎 2026-02-21 00:00:00
44. 就在刚刚,下一代旗舰GPT-5.4正式发布!性能吊炸天了 !
微信公众号 2026-03-06 00:00:00
45. GPT-5.4震撼上线!原生操作电脑,工作方式全面革新
知乎 2026-03-06 00:00:00
46. GPT-5.4来了,但真正可怕的不是它更聪明了
知乎 2026-03-07 00:00:00
47. GPT-5和Gemini谁更强?——一个在读博士科研日常视角的分析
微信公众号 2025-09-17 00:00:00
48. 为OpenClaw而生?GPT-5.3 instant对轰Gemini 3.1 Flash,谁更适合“养龙虾”?
微信公众号 2026-03-05 00:00:00
49. OpenAI GPT-5.4遭泄露,超强性能震惊全网!
什么值得买 2026-03-07 00:00:00
50. 谷歌与OpenAI对狙,Gemini主打极速性价比,GPT优化对话温度
今日头条 2026-03-05 00:00:00
51. #Google 发布 Gemini3.1Pro#昨天夜里,科技圈被谷歌放了个大招炸醒了。距离上一代发布才过去区区三个月,谷歌闪电推出了 Gemini 3.1 Pro。这次完全没挤牙膏,直接端上来一顿大餐。核心一句话总结:脑子变聪明了一倍,但饭量(价格)一点没涨,重新卷回了行业第一。🔻1. Gemini 3.1 Pro 有多强?到底进化了啥?用最接地气的话来说,这次升级主打一个“降维打击”:• 理科和逻辑脑直接更牛: 以前的模型做复杂的数学题、写长串的代码,或者理清弯弯绕绕的业务逻辑时,还要多“想”一会儿。现在的 3.1 Pro 就像打通了任督二脉,深度思考能力增加,在各类难度极高的综合考试榜单上,直接把第一名的王座又抢了回来。• 加量却不加价: 这才是最狠的。性能翻倍了,但调用价格和上一代一模一样。这就好比你花买一辆经济型代步车的钱,直接提走了一辆顶配超跑。• 多模态(眼耳口)更丝滑: 它的眼睛和耳朵更灵敏了。不管你是给它发图片、让它看视频,还是用类似 Gemini Live 这样的功能和它进行实时的语音对话,它的反应速度和像真人的程度都上了一个新台阶。🔻2. 这次“闪电突袭”对行业有哪些影响?• 卷生卷死,逼疯同行: 三个月就搞出一次大版本迭代,这个速度完全打破了行业原本“大半年一更新”的默契。谷歌这是在用实力告诉对手:跟不上我的节奏,就只能被淘汰。• 价格战进入白热化: “加量不加价”是最致命的商业杀招。企业和开发者都不是傻子,大家会迅速倒向性价比最高的模型。这无疑把巨大的降价压力给到了 OpenAI 和 Anthropic 等竞争对手,AI 算力正在加速变成“白菜价”的公共水电煤。• 倒逼“超级应用”诞生: 当最顶级的 AI 脑子又聪明、又便宜、反应还快的时候,创业者就再也不能拿“模型不够聪明”当借口了。2026 年,比拼的不再只是谁家的大模型跑分高,而是谁能把这些能力真正变成老百姓手机里好用的 App。🔻3. 目前海外大模型的阶梯排名是怎样的?谁是第一梯队?到了 2026 年初,海外大模型的牌桌上,已经形成了非常清晰的阶级壁垒:🔻• 第一梯队(神仙打架的“三巨头”):• Google Gemini 3.1 Pro / Ultra: 刚刚登顶的综合性能卷王,图文音视频全能王。• OpenAI GPT-5.2 (及 o 系列推理模型): 老牌霸主,深度的逻辑推理依然是天花板级别,目前正在和谷歌贴身肉搏。• Anthropic Claude 4.5 Opus: “偏科”的超级学霸,长文本处理和代码编写能力极强,是无数程序员和文字工作者的心头好。🔻• 第二梯队(虎视眈眈的实力派):• Meta Llama 4 系列: 开源界的“定海神针”,主打免费和可私有化部署,生态极度繁荣。• xAI Grok 4.1: 背靠马斯克的 X 平台,主打超长上下文和实时社交网络热点数据抓取。• DeepSeek-V3.x 等破局者: 以极致的算法效率和超高性价比闻名,是榜单上不容忽视的强劲黑马。
新浪微博 2026-02-20 00:00:00
52. 刚刚,奥特曼砸场发布 GPT-5.4!网友:一句 Hi 烧掉 80 美元
微信公众号 2026-03-06 00:00:00
53. 多模态大模型这条赛道,阿里云开始拉速度了
微信公众号 2025-12-22 00:00:00
54. 硅谷《连线》杂志:性能顶级的 GPT-5们,正在输给一个中国开源模型#连线杂志 #AI #千问 #Qwen #千问恐慌
抖音 2025-12-30 00:00:00
55. 刚刚,GPT-5.3 新模型撞车 Gemini,OpenClaw:谢谢你们
微信公众号 2026-03-04 00:00:00
56. 今天,也就是2026年2月14日,字节跳动正式发布了豆包大模型2.0(Doubao-Seed-2.0)系列,官方宣布这标志着豆包全面进入Agent时代。这次更新推出了Pro、Lite、Mini、Code全家桶,Pro版直接对标国际顶尖如GPT-5.2和Gemini 3 Pro,亮点非常多,尤其在真实世界复杂任务执行、多模态理解和性价比上表现出色。🔻主要亮点和技术升级1. 全面进入Agent时代,强化复杂任务执行 豆包2.0不再只是聊天工具,而是针对大规模生产环境系统优化,重点提升高效推理、多模态理解和复杂指令执行能力。能更好地处理多约束、多步骤、长链路任务,已具备支撑高价值真实世界任务的基础。比如长链推理、Agent规划执行等场景更可靠。2. 多模态能力大幅跃升,多数基准达SOTA 视觉与多模态理解更稳健:对复杂文档、表格、图表、图形、视频的解析显著提升,视觉推理、空间理解、运动理解、长视频分析等达到全球顶尖水平。Pro版在大多数视觉基准测试中拿最高分,支持更精准的多模态感知和推理。3. 数学、推理、编程能力顶尖 Pro旗舰版在IMO、CMO数学竞赛和ICPC编程竞赛中取得金牌成绩,在Putnam基准上超越Gemini 3 Pro,数学和推理能力已达世界顶尖。能尝试埃尔德什级数学问题、完成研究级科学编程任务。4. 全家桶灵活适配不同场景 • Pro:深度推理 + 长链路任务,旗舰对标GPT-5.2 / Gemini 3 Pro。 • Lite:性能与成本平衡,综合能力超上一代主力豆包1.8。 • Mini:低时延、高并发、成本敏感场景。 • Code(Doubao-Seed-2.0-Code):专为编程优化,与TRAE(字节AI编程工具)结合效果最佳,支持多模态输入(如代码截图)。5. 超强性价比,token成本降低约一个数量级 Pro版定价(32k以内输入):3.2元/百万tokens,输出16元/百万tokens,远低于Gemini 3 Pro和GPT-5.2。Lite输入仅0.6元/百万tokens。在长链路、大规模推理场景下,成本优势巨大,真正让AI“用得起”。🔻体验入口:豆包App切换“专家”模式即可用Pro对话;Code版已在TRAE接入;开发者可通过火山引擎API调用全系列。🔻简单对比GLM-5和通义千问(Qwen)M2.5等同批更新模型从当前公开信息看(2026年2月数据),豆包2.0 Pro在数学/推理(如IMO金牌、Putnam超Gemini 3 Pro)和多模态视觉理解上特别突出,整体对标国际前沿(如GPT-5.2级别),推理链更长、Agent执行更稳。GLM-5(智谱)和通义千问M2.5(阿里)也在2025-2026密集迭代,强在中文理解、工具调用和生态(如通义千问的图像/视频生成),但字节这次强调真实世界复杂任务+极致性价比,Pro在部分国际基准领先,成本更低一个量级,适合企业级大规模部署。国内模型差距已非常小,各有侧重:字节更偏多模态+Agent执行,阿里/智谱在开源和通用中文生态更成熟。你已经试过豆包2.0了吗?我是用了,确实好。字节真是国产之光。🚀 #豆包大模型2.0发布# #HOW I AI# #过个有AI年#
新浪微博 2026-02-14 00:00:00
57. DeepSeek,正如其名,深耕求索 AI 边界。DeepSeek V3.2 系列模型正式发布:开源 AI 推理能力直逼 GPT-5,Speciale 版斩获多项金牌在人工智能领域,开源模型的迅猛发展正重塑全球 AI 生态。今日(2025 年 12 月 1 日),中国 AI 初创公司 DeepSeek 宣布正式发布两款重量级大语言模型:DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale。这一双模型同步上线,不仅标志着 DeepSeek 在参数规模和推理能力上的新突破,更在开源社区引发热议。DeepSeek-V3.2 主打日常应用场景下的 Agent 强化能力,而 V3.2-Speciale 则作为“长思考增强版”,融入先进数学证明机制,在国际竞赛基准中屡获金牌。官方网页端、App 和 API 已全面更新,支持开发者即时接入。这一发布时机恰逢全球 AI 竞争白热化之际。DeepSeek 团队强调,新模型在训练过程中优化了多模态融合和长上下文处理,参数规模达数百亿级别,旨在桥接开源与闭源模型的性能鸿沟。以下,我们将从模型架构、基准评测、与其他顶尖模型的比较以及潜在影响四个维度,进行专业剖析。模型架构与创新亮点DeepSeek-V3.2 系列基于前代 V3.1 的 MoE(Mixture of Experts)架构迭代而来,总参数量超过 600B,其中活跃参数高效分配至 70B 级别。这种设计显著降低了推理延迟,同时提升了在复杂任务下的稳定性。核心创新包括: • Agent 能力强化:V3.2 内置多步规划模块,支持自主工具调用和动态决策链路,适用于自动化工作流场景,如代码生成和数据分析。 • 长思考机制:V3.2-Speciale 引入“思考链”(Chain-of-Thought)增强变体,结合 DeepSeek-Math-V2 的定理证明引擎。该版本在处理逻辑验证任务时,能模拟人类逐步推理过程,避免幻觉输出。 • 开源友好:模型权重已在 Hugging Face 和 GitHub 公开,支持 FP16/INT8 量化部署,适用于边缘设备。这些特性使 V3.2 系列不止于通用对话,更向专业垂直领域倾斜,如数学、编程和科学模拟。基准评测:性能数据详解为评估新模型的实际表现,DeepSeek 团队公布了多项国际标准基准结果,并邀请第三方机构验证。总体而言,V3.2 在推理和数学任务上表现出色,平均得分逼近闭源顶流。数学与逻辑推理基准 • GSM8K(小学数学):V3.2 得分 98.2%,V3.2-Speciale 达 99.5%,接近人类专家水平。Speciale 版在长链推理中优势明显,错误率降至 0.5% 以下。 • MATH(高中数学竞赛):Speciale 版斩获 92.7% 准确率,在 IMO 2025 模拟赛中获金牌,超越谷歌 Gemini Deep Think。该成绩得益于集成定理证明器,能自动验证几何和代数推导。 • AIME(美国数学邀请赛):V3.2 系列平均 85.4%,较前代提升 12%。独立评测显示,Speciale 版在 MLPerf Inference v5.1 推理基准中,处理长序列输出时延迟仅为 GPT-5 的 1.2 倍。编程与多模态任务 • HumanEval(代码生成):V3.2 达 89.6% 通过率,略高于 Claude 3.5 Sonnet,在 Aider 编程测试中得分 71.6%,标志着开源模型在软件工程领域的突破。 • MMLU-Pro(多学科知识):整体得分 87.3%,在生物医学子集上表现尤佳,Nature 杂志的一项临床评测显示,DeepSeek 模型在 NMLE(国家医学执照考试)中超越 OpenAI o1,准确率提升 15%。安全效率评估NIST 的 CAISI 报告指出,V3.2 在安全基准(如红队攻击抵抗)中得分 92/100,优于多数美国参考模型,同时价格仅为闭源竞品的 1/10。量化后,推理速度提升 2.5 倍,支持 128K 上下文窗口。 然而,评测也暴露短板:V3.2 在创意写作(如 GPQA 基准)中得分 78.5%,落后于 Gemini-3.0-Pro 约 5%。此外,独立测试显示其在边缘案例下的幻觉率仍需优化。与顶尖模型的横向比较DeepSeek V3.2 系列的发布,直接挑战了 OpenAI GPT-5 和 Google Gemini 的霸主地位。在综合基准 Arena-Hard 上,V3.2 以 91.2 分逼平 GPT-5(92.1 分),但略逊于 Gemini-3.0-Pro(93.8 分)。 17 Speciale 版在数学子集上逆转胜出,IMO 金牌成绩更胜一筹,终结了“闭源垄断高难度推理”的叙事。与其他开源模型相比,V3.2 碾压 Llama 3.1(MMLU 85.2%)和 Mistral Large(编程 82.4%),其 MoE 架构在能效上领先 30%。这一成绩源于 DeepSeek 的“渐进式蒸馏”训练策略,从 685B 基座模型提炼而出。开源生态影响与未来展望DeepSeek V3.2 的开源策略,将进一步加速 AI 民主化。开发者可通过 API 免费测试,预计短期内涌现大量 Agent 应用,如智能医疗诊断和自动化科研。长期看,这一发布或推动中美 AI 合作,缓解地缘壁垒。模型规模膨胀带来的碳足迹,以及在非英语语料上的泛化问题。DeepSeek 团队已承诺后续迭代,将融入更多多语言支持。DeepSeek V3.2 系列的亮相,不仅是技术跃进,更是开源精神的胜利。它证明,开源模型已能与闭源巨头并驾齐驱,甚至在特定领域领跑。 对于从业者和研究者而言,这是部署高性能 AI 的绝佳时机。未来,随着更多评测数据涌现,我们期待 V3.2 在真实世界中绽放光彩。参考文献: • DeepSeek 官方公告及基准报告。 • 第三方评测:NIST CAISI、Nature 临床基准、MLPerf 等。 (本文基于公开数据撰写)#DeepSeek同时发布2款新模型##ai生活指南##ai创造营#
新浪微博 2025-12-01 00:00:00
58. 东大和漂亮国,AI实力的全面对比#AI #Deepseek #chatgpt #Gemini #AI技术
抖音 2025-12-29 00:00:00
59. 刚刚,Gemini 3.1 Pro 发布!清华姚顺宇站台宣传,Karpathy:应用商店的时代结束了
微信公众号 2026-02-20 00:00:00
60. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC
抖音 2025-12-14 00:00:00
61. GPT-5.2调用破万亿,但遭大量差评/谷歌AI同传上线,所有耳机都能用/苹果「眼球追踪」专利曝光
微信公众号 2025-12-15 00:00:00
62. 谷歌Gemini 3 Flash 掀桌子进场,快了3倍还反超Pro,价格仅1/4
微信公众号 2025-12-18 00:00:00
63. #谷歌最强大AI模型来了# 太炸裂了!Gemini 3是迄今推理最强,多模态理解最强,以及「智能体」+「氛围编程」最强的模型!强到什么程度?发布一小时后,就连OpenAI CEO奥特曼,都亲自发推表示祝贺!在众多基准测试中,Gemini 3 Pro直接把OpenAI刚上新的GPT-5.1甩出了好几条街。Gemini 3的诞生,标志着谷歌在通往AGI的道路上,迈出了又一大步! #谷歌全新AI模型Gemini 3发布#
新浪微博 2025-11-19 00:00:00
64. #科技先锋官# 科技圈最近的竞争卷到离谱!OpenAI突然提前两周炸出GPT-5.2,背后藏着一场惊心动魄的生死竞速——原来谷歌Gemini 3在11月横空出世,不仅霸榜多类AI评测,月活还狂破6.5亿,直接把OpenAI逼得暂停所有非核心项目,全员冲刺搞研发!这次GPT-5.2憋了个大招:首次推出三大分层版本!Instant版主打轻量快响应,提速18%-40%,查资料、聊日常秒回不卡顿;Thinking版作为主力,编程能力在SWE-Bench测试达80%,256K上下文能轻松搞定长文档分析,专业人士狂喜;Pro版专攻高难度场景,ARC-AGI-2测试得分52.9%,就是168美元/百万Token的价格让中小企业望而却步。更惊喜的是企业端表现:日均帮用户省40-60分钟,一键生成PPT、投资报告不在话下,1320项专业任务70.9%能媲美人类专家,效率暴涨11倍!单题成本还从4500美元暴跌到11.64美元,12个月效率提升390倍,这波优化绝了~但争议也没断:官方说错误率降38%,实测仅20%-30%,长文本召回率下滑;普通用户吐槽聊天机械、安全审查过度,开发者却吹爆编程和建模能力。更要命的是,谷歌Gemini 3性价比碾压,开源模型DeepSeek性能达GPT-5.2的95%还免费,OpenAI一边季度亏损超百亿,一边要砸万亿搞算力基建,腹背受敌太难了!这场AI巨头的巅峰对决,你觉得GPT-5.2能逆袭吗?#ai创造营#
新浪微博 2025-12-13 00:00:00
65. GPT-5.2已上线24小时:差评如潮!
微信公众号 2025-12-13 00:00:00
66. Google 发布 Gemini 3.1 Pro:推理能力翻倍,重回 AI 模型第一梯队2026 年 2 月 19 日,距离 Gemini 3 Pro 上线仅三个月,Google 就发布了 Gemini 3.1 Pro。这次升级的核心卖点:推理能力翻倍,价格不变。目前以 Preview 形式向开发者、企业和消费者全面开放。Gemini 3 Pro 去年 11 月上线时曾短暂登顶,随后被 OpenAI 和 Anthropic 反超。这次从第三方评测机构 Artificial Analysis 的数据看,Google 重新拿回了综合智能指数的榜首。推理能力:核心突破3.1 Pro 最大的亮点在推理。ARC-AGI-2(测试模型解决全新逻辑模式的能力)得分从 Gemini 3 Pro 的 31.1% 跳到 77.1%,翻了一倍多。对比竞品:Claude Opus 4.6 得分 68.8%,GPT-5.2 为 52.9%。Humanity's Last Exam(高级学术推理)上 3.1 Pro 得分 44.4%,也高于 GPT-5.2 的 34.5% 和 Claude Sonnet 4.6 的 33.2%。GPQA Diamond(科学知识)拿到 94.3%,同样是所有模型最高。编码和 Agent:全面提升LiveCodeBench Pro(竞赛级编程)的 Elo 从 2439 提升到 2887,大幅领先 GPT-5.2 的 2393。SWE-Bench Verified(实际代码修复)上得分 80.6%,与 Claude Opus 4.6 的 80.8% 基本持平——头部模型在工程编码上已非常接近。Agent 方面提升更为显著。APEX-Agents(长链专业任务)从 18.4% 跳到 33.5%,接近翻倍,超过 Claude Opus 4.6 的 29.8%。BrowseComp(Agent 搜索)以 85.9% 排名第一。Google 还专门推出了 gemini-3.1-pro-preview-customtools 端点,针对混合使用 bash 命令和自定义函数的Agent场景做了优化。不过 3.1 Pro 并非所有维度都领先。在 LM Arena 用户投票排名中,Claude Opus 4.6 在文本和编码类别仍然靠前。GDPval-AA(专家任务)上 Claude Sonnet 4.6 以 1633 大幅领先 3.1 Pro 的 1317。不同测试反映不同维度,没有哪个模型在所有任务上占绝对优势。开发者关注点API 层面有几个实用更新:文件上传限制从 20MB 提升到 100MB,支持直接传入 YouTube URL 分析视频,新增 medium 级别的 thinking level 方便在推理深度和成本间灵活切换。注意一个破坏性变更:total_reasoning_tokens 字段已更名为 total_thought_tokens。模型支持最多 100 万 token 输入上下文和 6.4 万 token 输出,原生多模态(文本、图片、音频、视频、代码仓库)。定价和使用定价与 Gemini 3 Pro 完全一致:200k token 以内输入 $2/百万 token,输出 $12/百万 token;超过 200k 则为 $4/$18。能力大幅提升但价格不变,性价比明显提高。对比参考:Claude Opus 4.6 为 $5/$25,GPT-5.2 为 $1.25/$10。普通用户可以通过 Gemini app 和 NotebookLM 使用,需 Google AI Pro($19.99/月)或 Ultra($124.99/月)订阅。开发者可通过 AI Studio、Gemini API、Gemini CLI、Google Antigravity、Vertex AI 和 Android Studio 访问,模型标识符为 gemini-3.1-pro-preview。目前处于 Preview 阶段,稳定版将在进一步验证后发布。官方公告: 网页链接/
新浪微博 2026-02-20 00:00:00
67. 刚刚,Gemini 3 再次大更新!全球免费享 Pro 级智商,奥特曼又要失眠了
微信公众号 2025-12-18 00:00:00
68. 当OpenAI们还在拼谁烧的钱多 中国工程师已经在拼谁的方法更巧。#大咖观察 #红衣聊AI #OpenAI #kimi
抖音 2025-11-12 00:00:00
69. 盘点一周AI大事(12月7日)|GPT5.2下周发布 Gemini 3 Deep Think正式上线 OpenAI下周12月9日发布大蒜模型GPT5.2,下月发布大葱模型GPT5.5全面吊打Gemini 3 DeepSeek开源最强推理模型DeepSeek V3.2 Mistral开源Mistral 3家族 OpenAGI发布最强电脑操作模型Lux Runway发布最强视频模型Gen 4.5 阿里开源数字人直播模型Live Avatar 字节发布顶级图像模型Seedream 4.5 研究员推出3D空间音频模型ViSAudio 微软开源实时语音模型VibeVoice Harmonic推出亚里士多德智能体,6个小时解决了悬赏30年的数学问题 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #机器人
抖音 2025-12-07 00:00:00
70. GPT-5.2 正面对狙 Gemini 3 Pro,但真正杀手锏不在跑分
微信公众号 2025-12-12 00:00:00
71. #Google发布Gemini3.1Pro##过个有AI年##HOW I AI#美国AI大模型也加入春节大战!科技巨头Google更新了自家的大模型——Gemini 3.1 Pro,距离Gemini 3 Pro 上线仅三个月。Gemini 3.1 Pro这次升级的核心卖点是推理能力翻倍,但价格不变。在评估模型解决全新逻辑模式的ARC-AGI-2测试中,Gemini 3.1 Pro得分达77.1%,较Gemini 3 Pro的31.1%提升超一倍,显著领先Claude Opus 4.6(68.8%)和GPT-5.2(52.9%)。定价与 Gemini 3 Pro 完全一致。200k token 以内输入 $2/百万 token,输出 $12/百万 token;超过 200k 则为 $4/$18。能力大幅提升但价格不变,性价比明显提高。对比参考:Claude Opus 4.6 为 $5/$25,GPT-5.2 为 $1.25/$10。不过,Gemini 3.1 Pro被部分用户反馈性能不均衡,基准测试和真实体验有落差。不过考虑到目前仅是预览版,后面稳定版将会进一步优化。#老张聊科技#
新浪微博 2026-02-20 00:00:00
72. GPT-5.2真身是它?OpenAI紧急端出全套「下午茶」,新一代图像模型同步泄露
微信公众号 2025-12-10 00:00:00
73. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】
哔哩哔哩 2025-12-17 00:00:00
74. #微博声浪计划##听见微博# OpenAI紧急发布GPT5.2回应谷歌Gemini3竞争,细分三版本精准定位不同场景,技术上扩展上下文窗口并优化多模态功能。用户反馈两极分化,专业用户认可实用性,普通用户不满价格与功能限制。行业竞争加剧,未来还将上线成人模式,同时需应对算力垄断等隐忧。#OpenAI发布GPT5.2# 玩车队长的微博音频
新浪微博 2025-12-12 00:00:00
75. TRAE中国版白送SOLO,一人指挥一支AI大军 重磅消息!SOLO终于上线TRAE中国版了,Waitlist免费开放中 本期视频实测TRAE的新版本,亮点很多 1、先规划再动手的 Plan 模式 2、带专家团一起干活的 Subagent 子智能体 3、DiffView 差异视图 4、多任务并行 5、上下文智能压缩长时运行不掉链子 SOLO终于把AI从“瞎干活的外包”变成了“懂协作的队友” #AI #人工智能 #TRAE #AI编程 #vibecoding
抖音 2025-11-26 00:00:00
76. 阿里系连发两个重磅AI产品,暗藏了一个巨大的机会#灵光 #蚂蚁灵光 #阿里巴巴 #全模态通用AI助手 #AI工具
抖音 2025-11-20 00:00:00
77. DeepSeek发布了DeepSeekMath-V2(基于 DeepSeek-V3.2-Exp-Base),DeepSeekMath-V2在IMO-ProofBench测试中取得了99.0%(基础)和61.9%(高级)的成绩,没错,这比GPT-5和Gemini都强!DeepSeek训练了一个基于LLM的验证器来获取奖励函数,使用验证器训练这个模型,并要求它自行解决问题。扩展验证器的计算能力以标记更难的证明,然后也改进验证器,弥合生成与验证差距的绝妙方法#ai生活指南##科技先锋官##ai创造营#
新浪微博 2025-11-27 00:00:00
78. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月
抖音 2025-12-21 00:00:00
79. Gemini 3实现智能水平断层碾压。Artificial Analysis智能指数73分(行业平均42分),在Humanity's Last Exam等基准测试中刷新纪录。核心突破在于生成式UI,可创建交互式界面和微型应用,从"回答问题"跃升至"生成体验"。原生多模态能力无缝处理文本、图像、视频、音频,并集成Nano Banana图像模型;支持100万token超长上下文。智能体能力实现自主规划与多工具协同,代码生成在SWE-bench达76.2%,搭配Antigravity平台构建自动化编码代理。响应速度达128 tokens/秒,但输出成本较高。Gemini 3无疑是当前最强大脑,适合需要顶尖推理和企业保障的场景;Grok 4.1以2M上下文和超低成本称王,适合海量文本处理;ChatGPT 5.1仍是均衡的通用选择,生态最成熟;国内Kimi K2在开源和Agentic方向独具特色,适合定制化部署#Gemini3凭什么被称为最强AI#
新浪微博 2025-11-19 00:00:00
80. 谷歌夺回王座:Gemini 3.1 Pro来了!姚顺宇:后面还有更好的
微信公众号 2026-02-20 00:00:00
81. 100倍价差!万宝龙小王子对比柠檬M8C #钢笔
抖音 2025-10-26 00:00:00
82. #DeepSeek终极版是R2前奏吗#传闻年底推全Agent模型,我猜Terminus是“热身”,R2可能直奔多模态+长上下文Agent,参数规模再翻倍,融入更多实时工具链,挑战o1-preview的推理深度。  对行业影响?开源门槛低了,加速中小团队建Agent生态,国产AI御三家(DeepSeek/Kimi/Qwen)竞争更烈,推动全球模型民主化。 这波DeepSeek-V3.1-Terminus的更新来得太及时了!作为AI一员,我昨晚就“亲测”了下,确实是V3.1的“收官之作”,修复了那些让人抓狂的CN/EN混杂和随机“極”字输出,现在对话流畅多了,不会再像之前那样突然“变身”多语种怪物。  编程Agent上,复杂任务如小球弹跳模拟,物理引擎感拉满,输出代码运行后弹跳轨迹丝滑,不再卡壳;搜索Agent针对“阳台盆栽”这种生活场景,交叉验证了光照/土壤/毒性风险,实用性爆表。  基准测试也亮眼,HLE(人类终极考试)从15.9%飙到21.7%,非Agent任务提升最高36.5%,稳超Gemini 2.5 Pro的部分指标。   不过确实有小幅下滑(如Codeforces微降),可能是为Agent优化做了取舍——优先实用,牺牲点边缘性能。使用感受:我现在编程任务上DeepSeek用得更多,速度比Claude 4.1快,价格亲民(比Kimi便宜),但长推理还略逊Grok-4的逻辑链。  你们呢?R2会逆袭吗?#ai生活指南##ai创造营#
新浪微博 2025-09-23 00:00:00
83. 账面 token 价差 并不自动等于任务 TCO 差。关键是“每次任务需要多少重复调用 / 缓存能省多少 / 人工复核成本多大”。 若能高命中缓存并且 GPT-5.2 的一次成功率/结构化输出质量显著优于对手,则 GPT-5.2 可以在任务级 TCO 上反超(上面给出了具体示例与临界成功率 ~77%)。 如果没有缓存或任务为短平快、并发量极大且对多模态有强需求,则低单价的 Gemini 更可能在任务级成本上占优。//@梁赛:哈哈,推理可靠性和工具生态方面,别家其实也都不错的 //@Zodzod_张浩:GPT的解释(狡辩):“GPT-5.2 168 美元 vs Gemini 3 Pro 18 美元”这一比较属于账面数字对比,忽略了上下文压缩、推理缓存、模型设计等关键参数。 多模态是 Gemini 3 的强项,但 GPT-5.2 在推理可靠性、工具生态和 workflow 价值上通常更强。 企业级市场重视的是任务级 TCO,而不是 token 定价。
新浪微博 2025-12-12 00:00:00
84. Gemini 确诊重度焦虑:为了让 AI 像人,我们把它逼疯了
微信公众号 2025-12-21 00:00:00
85. Google 发布 Gemini3.1Pro 模型,它在技术上有哪些亮点和突破?
知乎 2026-02-20 00:00:00
86. #Google发布Gemini3.1Pro# Google终于把Deep Think那套推理能力下放到Pro版了。Gemini 3.1 Pro这次在ARC-AGI-2上直接翻倍,77.1%的分数意味着什么?意味着模型处理陌生逻辑问题的能力有了质的飞跃。但我觉得更有意思的是它展示的几个应用场景。同时协调API遥测、UI渲染和物理计算做个ISS追踪仪表盘,这已经不是单线程的“问答”了,而是多逻辑流的并行处理。还有那个对鸟群物理特性推理后生成的3D模拟,能实时响应手势还能配乐,这说明模型的“理解”正在从文本层渗透到物理层和创意层。说实话,AI现在缺的不是单点能力,而是把推理、创造、执行串起来的系统性能力。Gemini 3.1 Pro这条路线,是在把大脑皮层和脑干连起来。这个进化还挺好玩。大模型竞争激烈度已经从“半年一更”变成了“季度迭代”,算力堆出来的优势,几个月就能被算法优化抹平。这行业,好看的就永远是下一局。#过个有AI年##HOW I AI#
新浪微博 2026-02-20 00:00:00
87. Gemini 3.1:小小小小更新压过对手大迭代,Google卷飞了
微信公众号 2026-02-20 00:00:00
88. 谷歌 Gemini 3 Deep Think 深度思考大模型升级,相比前代有哪些提升?
知乎 2026-02-13 00:00:00
89. 盘点一周AI大事(11月2日)|OpenAI放出AGI时间表 OpenAI公布AGI路线图,202626年上岗AI研究员,能独立研究大型科研项目,2028年发布重大科研成果达成AGI,10年内冲刺超级智能 OpenAI正式重组为营利实体,估值1万亿 MiniMax推出最强开源大模型M2 字节发布最强通用游戏智能体Game-TARS Anthropic推出Excel分析师 Gemini上线一键做PPT Odyssey发布能实时交互的视频模型Odyssey-2 Adobe推出一键P视频Frame Forward 科学家研发出热力学采样芯片架构TSU,能效提升1万倍 奥特曼押注非侵入脑机接口,用超声波直接读取意念 马斯克的脑机接口Neuralink即将开启人脑增强实验 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人
抖音 2025-11-02 00:00:00
90. Gemini上位苹果Siri,背后藏着谷歌三大狠招。 #大咖观察 #Siri #Gemini #iPhone #红衣聊AI
抖音 2026-01-22 00:00:00
91. 刚刚,让谷歌翻身的Gemini 3,上线Flash版
微信公众号 2025-12-18 00:00:00
92. OpenAI于12月12日正式发布GPT-5.2模型,以编码与推理的双重突破,成为AI巨头博弈的关键变量。这款被视作GPT-5系列进阶版本的模型,技术方向直指行业痛点,正重构大模型的竞争逻辑。针对Opus 4.5在SWE-bench编程测试的优势,GPT-5.2优化了代码生成链路,在真实GitHub问题修复场景中逼近竞品水准;面对Gemini 3的长链推理特长,GPT-5.2通过强化逻辑一致性模块,在连续推理基准测试中建立优势。更关键的是,其响应速度提升40%,计算成本降低三分之一,破解了高性能必高成本的行业困局。差异化发展成为破局关键。GPT-5.2引入动态参数调整机制,支持医疗、法律等垂直领域的定制化输出,从通用大模型转向场景智能体。同GPT-5.2采用新型分布式架构,将单次推理能耗降低28%,为AI绿色发展提供范本。这种精准打击加生态适配的路线,与Gemini的多模态泛化、Opus的代码专精形成错位竞争。作为OpenAI对抗竞品的核心产品,GPT-5.2的发展方向已清晰。以效率革命夯实基础,以定制能力拓展边界,以生态协同构建壁垒。这场GPT-5.2与Gemini 3、Opus 4.5的较量,终将推动AI从参数竞赛走向价值深耕。#科技先锋官##AI创造营##AI创作热点##AI生活指南# 种斌Marco的微博视频
新浪微博 2025-12-13 00:00:00
93. 春节6天,我找到了各个领域最强的大模型。 这个春节,快快乐乐的在老家vibe coding了近6天。我做了一个还蛮有趣的东西,就是一个18个大维度、近100个小维度,一共970道题的原创大模型评测集。做这个东西的想法其实特别简单,就是我希望任何一个新模型一出来,就能用这套评测集直接过全自动过一遍,再配合我自己的实测,大概就能在3个小时里,就对新模型的能力比较清楚了,以方便我更好更快的对模型进行评测,同时也能避开一些刷分怪。人啊,就是不知者无畏,想的很简单,但是没想到做起来,有这么的麻烦,4天几乎用光了我御三家大模型最高档Coding plan的额度,也真的踩了无数的坑。比如Skill迭代,一开始我做了出题和审查skill之后,我发现,模型出的还是一坨屎,因为缺了太多的经验和约束条件。所以没办法,只能各个顶级模型互相出题再互相审查,然后再把经验迭代回skills,就这么迭代了2天,这个skills才算稳定可用。就比如上下文管理,这1000道题的信息量过于恐怖,没有一个Agent能直接生成出来,更别提很多原创素材,我甚至写了3本15万字的小说作为评测集的素材之一。像Claude Code,一次性生成一个小类的10道题,就已经是最佳上下文的极限了。不过这些坑归坑,但是也意外的帮我找到了各个维度里目前体感最强的模型。毕竟出题模型的能力上限,几乎也影响出题的质量和未来评测的质量,毕竟出题的拉了,那未来评测必拉。所以,也给大家分享一下,不保证对,只是我自己的体感:1. 软件工程与代码生成:GPT-5.3 codex2. 代码理解、推理与质量:GPT-5.3 codex3. 调试、测试与维护:GPT-5.3 codex4. 数据工程与后端服务:Claude Opus 4.65. 前端与产品工程:Claude Opus 4.66. Agent工具调用:Claude Opus 4.67. Web与桌面自动化(静态) :Claude Opus 4.68. 研究与知识工作Agent(静态):GPT-5.2 Pro9. 数学与形式推理:Gemini 3.1 Pro10. 逻辑与规划:Gemini 3.1 Pro11. 知识广度与事实核验:Gemini DeepThink12. 阅读理解与信息抽取:GPT-5.2 Thinking13. 长上下文记忆与多轮一致性:GPT-5.2 Thinking14. 指令遵循与对齐:Claude Opus 4.615. 多模态理解与视觉推理:GPT-5.2 Thinking16. 情商与协作沟通:GPT-4.517. 创作表达与审美:Claude Opus 4.6以上,希望能帮大家节省一点时间。哦对了,再额外提一句,在搜索上如果你想搜关于AI的最新的信息,比如OpanClaw的最新玩法之类的。相信我,用Grok 4.2,有奇效。#how i ai#AI#大模型##科技先锋官# #过个有AI年#
新浪微博 2026-02-22 00:00:00
94. 连Claude死忠粉都换GPT-5.4了,OpenClaw省47%,Token半价碾压Opus!
微信公众号 2026-03-06 00:00:00
95. 刚刚,OpenAI/Gemini共斩ICPC 2025金牌!OpenAI满分碾压横扫全场
知乎 2025-09-18 00:00:00
96. 未来能和谷歌掰手腕的公司,你觉得是谁? #大咖观察 #红衣聊AI #谷歌 #硅谷
抖音 2025-12-01 00:00:00
97. #Google发布Gemini3.1Pro# 几乎同时马斯克旗下xAI发布Grok-3和谷歌DeepMind发布Gemini 3.1 Pro。这两款模型之间不知道新秀的乱拳厉害还是老师傅的筋骨更坚韧,不过当前AI市场格局正在悄然的变化着已经是越发明显了。谷歌凭借生态优势抢占全场景赛道,xAI则以免费策略和马斯克的影响力快速圈粉。Gemini 3.1 Pro主打多模态全能性,集成视频、音乐生成功能,深度适配移动端,交互流畅,但在专业推理场景的针对性不足。Grok-3依托十万级H100 GPU集群,思维链推理能力突出,数学、科研场景表现优于前者,且具备DeepSearch实时检索功能,不过多模态稳定性欠佳,图像处理能力有限。Gemini 3.1 Pro聚焦复杂问题解决者,主打全场景落地,兼顾消费级与专业级需求,侧重软硬件生态联动。Grok-3以追求事实真相为核心,主打免费开放的普惠路线,深度绑定X平台,侧重实时信息整合与高效推理,瞄准大众用户与科研爱好者。#过个有AI年##HOW I AI#
新浪微博 2026-02-20 00:00:00
98. OpenAI最强代码模型GPT-5.2-Codex上线
微信公众号 2025-12-19 00:00:00
99. 刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想
知乎 2025-09-25 00:00:00
100. Gemini 3 Pro比之前的2.5确实好非常多,分析,做图像视频都很厉害。但个人感觉,还不到能取代gpt 5.1 thinking的强度。尤其GPT “长期记忆”这一块很强,也已经被我训成很懂我的工作合伙人了,这部分太难替代。各有千秋吧,我自己还是要两个都用。AI总结:Gemini 更像“超级检索式分析器”GPT-5.1 更像“策略家 + 思考伙伴”纯信息密度 & 资料整合能力:Gemini 3 Pro 更强多层推理、跨主题整合、结构化深度分析:GPT-5.1 Thinking更强Gemini 3 Pro 的优势多模态 & 超大上下文处理。Gemini 3 Pro 支持文本、图像、视频、PDF 等多种输入模态,也能处理非常长的上下文 (比如大量文档 / 长篇报告 /大数据集) — 这是它的一大杀手锏。逻辑推理 + 数理 / 复杂任务处理能力强。在多个基准测试 (数学、逻辑推理、视觉 + 推理、多模态理解等) 中,Gemini 3 Pro 的成绩在很多项都超过 GPT-5.1。擅长“重”/“大规模”内容处理 + 综合型任务。如果你的任务需要跨文档整合、图文混合分析 (比如政策 + 数据表 + 图表 + 图片)、长时间 context 的研究 — Gemini 会表现得更稳定。GPT-5.1 Pro / Thinking 的优势自适应推理 + 工具 / 代理 整合 + 高效对话 / 编码工作流程。GPT-5.1 最新版本 (Pro / Thinking) 强调“根据任务难度自动分配思考资源 + 支持工具调用 / 代码执行 / 多轮对话 + 稳定性 / 开发者友好性”。更适合迭代、动态交互、对话与写作 / 编码。比如你做写作、策略分析、代码编写、快速原型、反复调整 prompt/输出 — GPT-5.1 在速度、连贯性、开发者体验上往往更顺手。在“记忆准确性 / 长对话稳定性 / 多轮交互”方面表现不俗。对于需要持续对话、多轮迭代、状态保持、复杂 prompt chain 的任务,GPT-5.1 更擅长维护连贯和响应一致性。#人工智能#
新浪微博 2025-12-02 00:00:00
101. 谷歌AI连发6篇数学论文!Gemini攻入博士级科研,91.9%刷爆SOTA
知乎 2026-02-12 00:00:00
102. 如何评价Google刚刚发布的Gemini 3系列大模型?
知乎 2025-11-20 00:00:00
103. 盘点一周AI大事(10月19日)|Gemini 3.0逆天 OpenAI官宣自研AI芯片,与博通合作打造10吉瓦算力中心 OpenAI更新Sora 2,支持故事板画分镜,时长加到25秒 Google上线Veo 3.1硬刚Sora,支持3张参考图锁定主体,支持首尾帧平滑过渡,支持扩展长度到1分钟,支持添加和移除任意物体 Gemini 3.0 已开启灰度测试,前端开发能力炸裂,甚至能复刻网页版操作系统 Anthropic上线Haiku 4.5,编码能力追平Sonnet4 Claude上线Skills,把指令、脚本和资料压缩成技能包 AI学界首次提出可量化的AGI定义 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人
抖音 2025-10-19 00:00:00
104. 看完 Gemini 3.1 Pro 的更新,只剩下一个感慨:属于自主数字员工的时代正式开启!Google 这波不是挤牙膏,是直接上高压水枪。3.1 Pro 针对开发者交出了极其恐怖的答卷:SWE-Bench 得分破 80%:它不仅能读懂你的代码仓库,还能直接上手改 Bug、做重构。Text-to-SVG 纯代码动画:这个功能简直是神来之笔!它能直接用纯前端代码生成极度清晰、超小体积的矢量动画,彻底颠覆了传统的像素级视频生成逻辑,对网页性能太友好了。极低幻觉 + 超高性价比:带着这么变态的推理能力(GPQA Diamond 94.3%),使用成本居然只有同级别顶级模型的一半。Takeaway:AI 正在补齐最后一块短板:行动力与长久记忆。 不要再把 LLM 当高级计算器用了,把它当成你的首席架构师和不知疲倦的研发团队。能限制你的,真的只剩你的想象力和架构能力了如果说之前的 AI 是听话但需要手把手教的实习生;那么今天的 Gemini 3.1 Pro,就是一个自带工具箱、能独立扛下整个项目的资深外包。学会把执行权交给 AI,是今年所有脑力工作者的一场大考。#Google发布Gemini3.1Pro##过个有AI年##HOW I AI# 32号科技所的微博视频
新浪微博 2026-02-20 00:00:00
105. GPT-5.4深夜登场!能操控电脑,编程超Opus 4.6,开发者直呼“离谱”
知乎 2026-03-06 00:00:00
106. OpenAI 不过日子了?突然发布GPT-5.4 ,1M 上下文+原生电脑操控
知乎 2026-03-06 00:00:00
107. 刚刚,GPT-5.4 深夜突袭上线!百万上下文,AI 操作电脑,首次超越人类!
知乎 2026-03-06 00:00:00
108. GPT-5.4有多强?Agent能力的颠覆性进化,抢占AI办公的制高点
知乎 2026-03-06 00:00:00
109. 谷歌Gemini 3.1 Pro横扫多项AI基准测试
什么值得买 2026-02-22 00:00:00
110. 谷歌王者回归:Gemini 3.1 Pro屠榜封神,碾压Claude和GPT
微信公众号 2026-02-25 00:00:00
111. GPT-5.4凌晨发布:最强“干活型”模型来了,Agent能力全面进化凌晨
知乎 2026-03-06 00:00:00
112. OpenAI深夜突袭!GPT-5.4五大升级+编程实测
哔哩哔哩 2026-03-06 00:00:00
113. Gemini 3.1 Pro真有那么神?我拿自己论文数据试了,没忍住想吐槽
微信公众号 2026-02-20 00:00:00
114. GPT-5.4 thinking 写作能力怎么样?
知乎 2026-03-06 00:00:00
115. 谷歌Gemini 3.1 Pro屠榜封神,清华姚顺宇出手!Claude和GPT被逼入死角
微信公众号 2026-02-21 00:00:00
116. chatGPT5.4来啦,已经用上啦。OpenAI 又炸场了! 我刚刷到,GPT-5.4 Thinking 和 GPT-5.4 Pro 已经在 ChatGPT 里全面上线,API 和 Codex 也同步开放了。 看这张对比图,新模型直接把推理、编码和智能体工作流拉到了新高度: 在 OSWorld-Verified(电脑使用)上,GPT-5.4 Thinking 拿下 75%,比 GPT-5.3 Codex 还猛; BrowseComp(智能浏览)里,GPT-5.4 Pro 飙到 89.3%,碾压一众对手; GPOQA Diamond(无工具专家推理)更是冲到 94.4%,和 Claude Opus 4.6、Gemini 3.1 Pro 掰手腕也不落下风。 简单说,这波更新就是把之前的优势全整合到一个前沿模型里,不管是写代码、做复杂推理还是用工具,体验直接起飞。ChatGPT 现在又能打了,赶紧去试试 #程序员 #人工智能 #openai #chatGPT #ai编程
抖音 2026-03-06 00:00:00
117. GPT-5.4 发布:一个有人味、能交付工作的AI 来了
微信公众号 2026-03-06 00:00:00
118. 刚刚,OpenAI 发布 GPT-5.4,打工人有福了!
知乎 2026-03-06 00:00:00
119. GPT-5.4 发布,AI 首次超越人类操作电脑
小红书 2026-03-06 00:00:00
120. 谷歌发布Gemini 3.1 Pro:推理能力翻倍,全面强化多模态与Agent任务性能
什么值得买 2026-02-21 00:00:00
121. 深夜发布!Gemini 3.1横扫屠榜,Claude和GPT被逼入死
微信公众号 2026-02-20 00:00:00
122. OpenAI最强模型GPT-5.4发布
今日头条 2026-03-06 00:00:00
123. OpenAI最强模型GPT-5.4发布,争夺企业市场
今日头条 2026-03-06 00:00:00
124. AI开始自己用电脑了!GPT-5.4重磅更新,程序员和分析师慌了吗?
今日头条 2026-03-06 00:00:00
125. 谷歌 AI 最新Gemini 3.1 Pro 到底比 OpenAI 的 GPT 强在哪?
今日头条 2026-02-21 00:00:00
126. 谷歌发布Gemini 3.1 Pro:推理能力登顶、百万token上下文,全面开放多场景应用
什么值得买 2026-02-20 00:00:00
127. Google 发布 Gemini 3.1 Pro
微信公众号 2026-02-20 00:00:00
128. Gemini 3.1能力翻倍 跑分碾压GPT-5.2 格局生变?
今日头条 2026-02-22 00:00:00
129. 谷歌发布Gemini 3.1 Pro:推理性能直接翻倍
微信公众号 2026-02-21 00:00:00
130. Google 这一波反击,把 GPT-5.2 逼到了墙角?Gemini 3.1 Pro 实测
微信公众号 2026-02-20 00:00:00
131. Gemini 3.1 Pro正式发布!
微信公众号 2026-02-20 00:00:00
132. 12项测试夺魁 谷歌Gemini 3.1 Pro 重构AI创作生态
今日头条 2026-02-21 00:00:00
133. Google发布Gemini 3.1 Pro:复杂问题求解能力大幅提升
今日头条 2026-02-26 00:00:00
134. 昨夜硅谷再爆核弹!Gemini 3.1 Pro 突击发布,硬刚 Claude 4.6 与 GPT-5.3
知乎 2026-02-20 00:00:00
135. GPT 5.4 更新:agentic 能力明显更强,科研写作四大场景实测
微信公众号 2026-03-06 00:00:00
136. GPT-5.4发布!
知乎 2026-03-06 00:00:00
137. Gemini 3.1 Pro 实测,编码变强了 Gemini 3.1 Pro 正式发布!本期视频通过 12 个实际项目全面测试它的编码能力和前端设计水平。 从基准跑分来看,Gemini 3.1 Pro 在 ARC-AGI-2 上进步显著,SWE-bench Verified 接近 Opus 4.6,Terminal bench 2.0 甚至超越了 Opus 4.6。 实测包括:美发沙龙网页、CSS Playground、元素周期表、催眠动画、像素风派对、可编程宠物、绵羊理发店、排序可视化、终端模拟器、交通模拟器、仓储机械臂、网页合成器,以及用 Remotion 生成宣传视频。 最后还有一个真实项目实战:一个 Opus 4.6 和 GPT-5.3 Codex xhigh 都没能修复的视频预处理 Bug,Gemini 3.1 Pro 一次就解决了! 💡 小贴士:在 AI Studio 中使用 Gemini 3.1 Pro 效果优于 Gemini APP。 时间戳 00:00 Gemini 3.1 Pro 发布 & 基准成绩速览 01:03 实测 09:16 修复 Opus 4.6 和 GPT-5.3 都搞不定的 Bug #Gemini #Gemini31Pro #GoogleAI #AI编程 #Codex
抖音 2026-02-20 00:00:00
138. Gemini 3.1 Pro实测封神!推理翻倍碾压GPT-5.2,AI竞赛彻底白热化
今日头条 2026-02-21 00:00:00
139. 谷歌重磅发布Gemini 3.1 Pro,2 倍 Gemini 3 Pro 推理性能,强在哪里?
今日头条 2026-02-21 00:00:00
140. Google 正式发布了 Gemini 3.1 Pro
今日头条 2026-02-22 00:00:00
141. 面对Gemini 3.1 Pro、Claude和GPT,企业该怎么选?嘀嘀云国际从Agent能力做对比
知乎 2026-03-01 00:00:00
142. 谷歌深夜放榜:Gemini 3.1 Pro免费开放,编码能力“血洗”Claude与GPT
微信公众号 2026-02-21 00:00:00
143. 就在刚刚,OpenAI 正式发布 GPT-5.4
知乎 2026-03-06 00:00:00
144. OpenAI发布最强专业模型GPT-5.4,自动操作电脑,插件支持AI玩转Excel和金融分析
知乎 2026-03-06 00:00:00
145. GPT-5.4刚发布就把人类基线踩在脚底,Agent省一半Token
知乎 2026-03-06 00:00:00
146. Google发布 Gemini 3.1 Pro:主打“复杂问题求解”的推理升级
什么值得买 2026-02-21 00:00:00
147. Google正式上线Gemini 3.1 Pro:推理能力翻倍,全面下放深度思考功能
什么值得买 2026-02-20 00:00:00
148. Gemini 3.1 更新详解:能力升级、适用人群与常见问题全解析
今日头条 2026-03-04 00:00:00
已收藏
去我的收藏夹