Gemini 3.1 vs GPT-5.4?78位开发者实测后,结论出人意料

源自148位全网作者

03-07 20:01

内容由AI生成

精选参考来源

1. Gemini 3.1与GPT 5.4架构解析

2. 2026年教育科技实测

3. GPT-5.4深夜发布!与OpenClaw的技术共振

4. 2026年GPT5.4镜像站实测

5. Gemini 3.1 Pro vs GPT-5.2?78位开发者实测后,结论出人意料

6. OpenAI 拉 “红色警报”,用 ChatGPT 5.2 反击 Google 最新 Gemini 3 系列模型,AI War?

7. 谷歌发布Gemini 3.1 Pro

8. 16天三大模型齐发

9. Google 一出手就是王炸

10. 谷歌王炸!Gemini 3.1 Pro 干翻 GPT/Claude,一句话生成应用

11. 16项测试赢了13项!Gemini 3.1 Pro碾压GPT-5.2和Claude

12. 谷歌Gemini 3.1 Pro屠榜,清华姚顺宇出手!Claude和GPT被逼入死角

13. 突发!谷歌Gemini 3.1 Pro发布,Claude与GPT被逼入死角?性能如何

14. Gemini 3.1 Pro血洗Claude与GPT,12项基准测试第一!

15. 谷歌Gemini 3.1 Pro震撼发布!性能暴增价格不变,12项测试全面碾压Claude与GPT

16. 史诗级提升!谷歌Gemini 3.1 Pro相比3.0 Pro有哪些不一样的地方?

17. Gemini 3.1正式发布(附教程)

18. Gemini 3.1 Pro 发布

19. 谷歌Gemini 3.1 Pro发布

20. 重磅!Gemini 3.1 正式发布

21. Gemini 3.1 Pro: Gemini 最新升级

22. Gemini 3.1 Pro。

23. 谷歌放大招!Gemini 3.1 Pro发布

24. Gemini3.1 Pro 深度解读

25. 谷歌Gemini 3.1 Pro重磅发布,推理能力跃升77%,多项指标破新纪录

26. OpenAI 发布最新模型GPT-5.4,能力有多强?实际体验如何?

27. GPT-5.4 深度评测报告

28. OpenAI发布最强专业模型GPT-5.4

29. GPT-5.4 发布

30. 刚刚,GPT-5.4 突袭上线!百万上下文,AI 操作电脑,首次超越人类!

31. OpenAI深夜祭出GPT-5.4,暴击Claude!原生操控电脑,打工人悬了

32. 连Claude死忠粉都换GPT-5.4了,OpenClaw省47%,Token半价碾压Opus!

33. GPT 5.4,超越GPT-5.2Pro.知道你快,但不知道你这么快🥲

34. 刚刚,GPT-5.4正式发布!

35. Gemini 3.1 Pro 发布:实际有哪些提升?

36. GEMINI 3.1 PRO 介绍

37. 重回AI王座 Gemini 3.1 Pro为何“急”着封神? Gemini 3.1有何过人之处? 为何谷歌急于推出?#Gemini #谷歌 #deepmind #AI大模型 #多模态

38. Gemini 3.1 Pro 深夜发布!Google 太吓人了

39. OpenAI 发了 GPT-5.4,这次不是升级,是换赛道

40. OpenAI封神之作,GPT-5.4重磅发布,附国内一些使用方式!

41. Gemini 3.1 真实体验

42. 告别简单问答!谷歌 Gemini 3.1 Pro 发布 推理翻倍搞定全场景复杂任务

43. Gemini 3.1 Pro深度拆解

44. 就在刚刚,下一代旗舰GPT-5.4正式发布!性能吊炸天了 !

45. GPT-5.4震撼上线!原生操作电脑,工作方式全面革新

46. GPT-5.4来了,但真正可怕的不是它更聪明了

47. GPT-5和Gemini谁更强?——一个在读博士科研日常视角的分析

48. 为OpenClaw而生?GPT-5.3 instant对轰Gemini 3.1 Flash,谁更适合“养龙虾”?

49. OpenAI GPT-5.4遭泄露,超强性能震惊全网!

50. 谷歌与OpenAI对狙,Gemini主打极速性价比,GPT优化对话温度

51. #Google 发布 Gemini3.1Pro#昨天夜里,科技圈被谷歌放了个大招炸醒了。距离上一代发布才过去区区三个月,谷歌闪电推出了 Gemini 3.1 Pro。这次完全没挤牙膏,直接端上来一顿大餐。核心一句话总结:脑子变聪明了一倍,但饭量(价格)一点没涨,重新卷回了行业第一。🔻1. Gemini 3.1 Pro 有多强?到底进化了啥?用最接地气的话来说,这次升级主打一个“降维打击”:• 理科和逻辑脑直接更牛: 以前的模型做复杂的数学题、写长串的代码,或者理清弯弯绕绕的业务逻辑时,还要多“想”一会儿。现在的 3.1 Pro 就像打通了任督二脉,深度思考能力增加,在各类难度极高的综合考试榜单上,直接把第一名的王座又抢了回来。• 加量却不加价: 这才是最狠的。性能翻倍了,但调用价格和上一代一模一样。这就好比你花买一辆经济型代步车的钱,直接提走了一辆顶配超跑。• 多模态(眼耳口)更丝滑: 它的眼睛和耳朵更灵敏了。不管你是给它发图片、让它看视频,还是用类似 Gemini Live 这样的功能和它进行实时的语音对话,它的反应速度和像真人的程度都上了一个新台阶。🔻2. 这次“闪电突袭”对行业有哪些影响?• 卷生卷死,逼疯同行: 三个月就搞出一次大版本迭代,这个速度完全打破了行业原本“大半年一更新”的默契。谷歌这是在用实力告诉对手:跟不上我的节奏,就只能被淘汰。• 价格战进入白热化: “加量不加价”是最致命的商业杀招。企业和开发者都不是傻子,大家会迅速倒向性价比最高的模型。这无疑把巨大的降价压力给到了 OpenAI 和 Anthropic 等竞争对手,AI 算力正在加速变成“白菜价”的公共水电煤。• 倒逼“超级应用”诞生: 当最顶级的 AI 脑子又聪明、又便宜、反应还快的时候,创业者就再也不能拿“模型不够聪明”当借口了。2026 年,比拼的不再只是谁家的大模型跑分高,而是谁能把这些能力真正变成老百姓手机里好用的 App。🔻3. 目前海外大模型的阶梯排名是怎样的?谁是第一梯队?到了 2026 年初,海外大模型的牌桌上,已经形成了非常清晰的阶级壁垒:🔻• 第一梯队(神仙打架的“三巨头”):• Google Gemini 3.1 Pro / Ultra: 刚刚登顶的综合性能卷王,图文音视频全能王。• OpenAI GPT-5.2 (及 o 系列推理模型): 老牌霸主,深度的逻辑推理依然是天花板级别,目前正在和谷歌贴身肉搏。• Anthropic Claude 4.5 Opus: “偏科”的超级学霸,长文本处理和代码编写能力极强,是无数程序员和文字工作者的心头好。🔻• 第二梯队(虎视眈眈的实力派):• Meta Llama 4 系列: 开源界的“定海神针”,主打免费和可私有化部署,生态极度繁荣。• xAI Grok 4.1: 背靠马斯克的 X 平台,主打超长上下文和实时社交网络热点数据抓取。• DeepSeek-V3.x 等破局者: 以极致的算法效率和超高性价比闻名,是榜单上不容忽视的强劲黑马。

52. 刚刚,奥特曼砸场发布 GPT-5.4!网友:一句 Hi 烧掉 80 美元

53. 多模态大模型这条赛道,阿里云开始拉速度了

54. 硅谷《连线》杂志:性能顶级的 GPT-5们,正在输给一个中国开源模型#连线杂志 #AI #千问 #Qwen #千问恐慌

55. 刚刚,GPT-5.3 新模型撞车 Gemini,OpenClaw:谢谢你们

56. 今天,也就是2026年2月14日,字节跳动正式发布了豆包大模型2.0(Doubao-Seed-2.0)系列,官方宣布这标志着豆包全面进入Agent时代。这次更新推出了Pro、Lite、Mini、Code全家桶,Pro版直接对标国际顶尖如GPT-5.2和Gemini 3 Pro,亮点非常多,尤其在真实世界复杂任务执行、多模态理解和性价比上表现出色。🔻主要亮点和技术升级1. 全面进入Agent时代,强化复杂任务执行
豆包2.0不再只是聊天工具,而是针对大规模生产环境系统优化,重点提升高效推理、多模态理解和复杂指令执行能力。能更好地处理多约束、多步骤、长链路任务,已具备支撑高价值真实世界任务的基础。比如长链推理、Agent规划执行等场景更可靠。2. 多模态能力大幅跃升,多数基准达SOTA
视觉与多模态理解更稳健:对复杂文档、表格、图表、图形、视频的解析显著提升,视觉推理、空间理解、运动理解、长视频分析等达到全球顶尖水平。Pro版在大多数视觉基准测试中拿最高分,支持更精准的多模态感知和推理。3. 数学、推理、编程能力顶尖
Pro旗舰版在IMO、CMO数学竞赛和ICPC编程竞赛中取得金牌成绩,在Putnam基准上超越Gemini 3 Pro,数学和推理能力已达世界顶尖。能尝试埃尔德什级数学问题、完成研究级科学编程任务。4. 全家桶灵活适配不同场景 • Pro:深度推理 + 长链路任务,旗舰对标GPT-5.2 / Gemini 3 Pro。 • Lite:性能与成本平衡,综合能力超上一代主力豆包1.8。 • Mini:低时延、高并发、成本敏感场景。 • Code(Doubao-Seed-2.0-Code):专为编程优化,与TRAE(字节AI编程工具)结合效果最佳,支持多模态输入(如代码截图)。5. 超强性价比,token成本降低约一个数量级
Pro版定价(32k以内输入):3.2元/百万tokens,输出16元/百万tokens,远低于Gemini 3 Pro和GPT-5.2。Lite输入仅0.6元/百万tokens。在长链路、大规模推理场景下,成本优势巨大,真正让AI“用得起”。🔻体验入口:豆包App切换“专家”模式即可用Pro对话;Code版已在TRAE接入;开发者可通过火山引擎API调用全系列。🔻简单对比GLM-5和通义千问(Qwen)M2.5等同批更新模型从当前公开信息看(2026年2月数据),豆包2.0 Pro在数学/推理(如IMO金牌、Putnam超Gemini 3 Pro)和多模态视觉理解上特别突出,整体对标国际前沿(如GPT-5.2级别),推理链更长、Agent执行更稳。GLM-5(智谱)和通义千问M2.5(阿里)也在2025-2026密集迭代,强在中文理解、工具调用和生态(如通义千问的图像/视频生成),但字节这次强调真实世界复杂任务+极致性价比,Pro在部分国际基准领先,成本更低一个量级,适合企业级大规模部署。国内模型差距已非常小,各有侧重:字节更偏多模态+Agent执行,阿里/智谱在开源和通用中文生态更成熟。你已经试过豆包2.0了吗?我是用了,确实好。字节真是国产之光。🚀 #豆包大模型2.0发布# #HOW I AI# #过个有AI年#

57. DeepSeek,正如其名,深耕求索 AI 边界。DeepSeek V3.2 系列模型正式发布:开源 AI 推理能力直逼 GPT-5,Speciale 版斩获多项金牌在人工智能领域,开源模型的迅猛发展正重塑全球 AI 生态。今日(2025 年 12 月 1 日),中国 AI 初创公司 DeepSeek 宣布正式发布两款重量级大语言模型:DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale。这一双模型同步上线,不仅标志着 DeepSeek 在参数规模和推理能力上的新突破,更在开源社区引发热议。DeepSeek-V3.2 主打日常应用场景下的 Agent 强化能力,而 V3.2-Speciale 则作为“长思考增强版”,融入先进数学证明机制,在国际竞赛基准中屡获金牌。官方网页端、App 和 API 已全面更新,支持开发者即时接入。这一发布时机恰逢全球 AI 竞争白热化之际。DeepSeek 团队强调,新模型在训练过程中优化了多模态融合和长上下文处理,参数规模达数百亿级别,旨在桥接开源与闭源模型的性能鸿沟。以下,我们将从模型架构、基准评测、与其他顶尖模型的比较以及潜在影响四个维度,进行专业剖析。模型架构与创新亮点DeepSeek-V3.2 系列基于前代 V3.1 的 MoE(Mixture of Experts)架构迭代而来,总参数量超过 600B,其中活跃参数高效分配至 70B 级别。这种设计显著降低了推理延迟,同时提升了在复杂任务下的稳定性。核心创新包括: • Agent 能力强化:V3.2 内置多步规划模块,支持自主工具调用和动态决策链路,适用于自动化工作流场景,如代码生成和数据分析。 • 长思考机制:V3.2-Speciale 引入“思考链”(Chain-of-Thought)增强变体,结合 DeepSeek-Math-V2 的定理证明引擎。该版本在处理逻辑验证任务时,能模拟人类逐步推理过程,避免幻觉输出。 • 开源友好:模型权重已在 Hugging Face 和 GitHub 公开,支持 FP16/INT8 量化部署,适用于边缘设备。这些特性使 V3.2 系列不止于通用对话,更向专业垂直领域倾斜,如数学、编程和科学模拟。基准评测:性能数据详解为评估新模型的实际表现,DeepSeek 团队公布了多项国际标准基准结果,并邀请第三方机构验证。总体而言,V3.2 在推理和数学任务上表现出色,平均得分逼近闭源顶流。数学与逻辑推理基准 • GSM8K(小学数学):V3.2 得分 98.2%,V3.2-Speciale 达 99.5%,接近人类专家水平。Speciale 版在长链推理中优势明显,错误率降至 0.5% 以下。 • MATH(高中数学竞赛):Speciale 版斩获 92.7% 准确率,在 IMO 2025 模拟赛中获金牌,超越谷歌 Gemini Deep Think。该成绩得益于集成定理证明器,能自动验证几何和代数推导。 • AIME(美国数学邀请赛):V3.2 系列平均 85.4%,较前代提升 12%。独立评测显示,Speciale 版在 MLPerf Inference v5.1 推理基准中,处理长序列输出时延迟仅为 GPT-5 的 1.2 倍。编程与多模态任务 • HumanEval(代码生成):V3.2 达 89.6% 通过率,略高于 Claude 3.5 Sonnet,在 Aider 编程测试中得分 71.6%,标志着开源模型在软件工程领域的突破。 • MMLU-Pro(多学科知识):整体得分 87.3%,在生物医学子集上表现尤佳,Nature 杂志的一项临床评测显示,DeepSeek 模型在 NMLE(国家医学执照考试)中超越 OpenAI o1,准确率提升 15%。安全效率评估NIST 的 CAISI 报告指出,V3.2 在安全基准(如红队攻击抵抗)中得分 92/100,优于多数美国参考模型,同时价格仅为闭源竞品的 1/10。量化后,推理速度提升 2.5 倍,支持 128K 上下文窗口。 然而,评测也暴露短板:V3.2 在创意写作(如 GPQA 基准)中得分 78.5%,落后于 Gemini-3.0-Pro 约 5%。此外,独立测试显示其在边缘案例下的幻觉率仍需优化。与顶尖模型的横向比较DeepSeek V3.2 系列的发布,直接挑战了 OpenAI GPT-5 和 Google Gemini 的霸主地位。在综合基准 Arena-Hard 上,V3.2 以 91.2 分逼平 GPT-5(92.1 分),但略逊于 Gemini-3.0-Pro(93.8 分)。 17 Speciale 版在数学子集上逆转胜出,IMO 金牌成绩更胜一筹,终结了“闭源垄断高难度推理”的叙事。与其他开源模型相比,V3.2 碾压 Llama 3.1(MMLU 85.2%)和 Mistral Large(编程 82.4%),其 MoE 架构在能效上领先 30%。这一成绩源于 DeepSeek 的“渐进式蒸馏”训练策略,从 685B 基座模型提炼而出。开源生态影响与未来展望DeepSeek V3.2 的开源策略,将进一步加速 AI 民主化。开发者可通过 API 免费测试,预计短期内涌现大量 Agent 应用,如智能医疗诊断和自动化科研。长期看,这一发布或推动中美 AI 合作,缓解地缘壁垒。模型规模膨胀带来的碳足迹,以及在非英语语料上的泛化问题。DeepSeek 团队已承诺后续迭代,将融入更多多语言支持。DeepSeek V3.2 系列的亮相,不仅是技术跃进,更是开源精神的胜利。它证明,开源模型已能与闭源巨头并驾齐驱,甚至在特定领域领跑。 对于从业者和研究者而言,这是部署高性能 AI 的绝佳时机。未来,随着更多评测数据涌现,我们期待 V3.2 在真实世界中绽放光彩。参考文献: • DeepSeek 官方公告及基准报告。 • 第三方评测:NIST CAISI、Nature 临床基准、MLPerf 等。 (本文基于公开数据撰写)#DeepSeek同时发布2款新模型##ai生活指南##ai创造营#

58. 东大和漂亮国,AI实力的全面对比#AI #Deepseek #chatgpt #Gemini #AI技术

59. 刚刚,Gemini 3.1 Pro 发布!清华姚顺宇站台宣传,Karpathy:应用商店的时代结束了

60. 盘点一周AI大事(12月7日)|首个AGI模型问世 OpenAI强行上线GPT5.2,跑分击败Gemini重夺地表最强 OpenAI下周发布图像模型绝地反击小香蕉 ChatGPT接入Adobe套装 Google推出顶级语音模型Gemini 2.5 TTS Google上线实时语音互译Gemini 2.5 Audio Google深度研究接入Gemini 3 Pro 智谱推出最强开源手机智能体AutoGLM-Phone-9B Runway推出通用世界模型GWM-1 Meta推出短剧视频模型OneStory Meta推出最强开源版客串Saber 字节发布最强自动驾驶视觉模型UniUGP 阿里开源最强运动控制视频模型WanMove 研究员开源换脸视频模型LivingSwap Integral AI 宣称构建了世界上第一个AGI模型 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #AIGC

61. GPT-5.2调用破万亿,但遭大量差评/谷歌AI同传上线,所有耳机都能用/苹果「眼球追踪」专利曝光

62. 谷歌Gemini 3 Flash 掀桌子进场,快了3倍还反超Pro,价格仅1/4

63. #谷歌最强大AI模型来了# 太炸裂了!Gemini 3是迄今推理最强,多模态理解最强,以及「智能体」+「氛围编程」最强的模型!强到什么程度?发布一小时后,就连OpenAI CEO奥特曼,都亲自发推表示祝贺!在众多基准测试中,Gemini 3 Pro直接把OpenAI刚上新的GPT-5.1甩出了好几条街。Gemini 3的诞生,标志着谷歌在通往AGI的道路上,迈出了又一大步! #谷歌全新AI模型Gemini 3发布#

64. #科技先锋官# 科技圈最近的竞争卷到离谱!OpenAI突然提前两周炸出GPT-5.2,背后藏着一场惊心动魄的生死竞速——原来谷歌Gemini 3在11月横空出世,不仅霸榜多类AI评测,月活还狂破6.5亿,直接把OpenAI逼得暂停所有非核心项目,全员冲刺搞研发!这次GPT-5.2憋了个大招:首次推出三大分层版本!Instant版主打轻量快响应,提速18%-40%,查资料、聊日常秒回不卡顿;Thinking版作为主力,编程能力在SWE-Bench测试达80%,256K上下文能轻松搞定长文档分析,专业人士狂喜;Pro版专攻高难度场景,ARC-AGI-2测试得分52.9%,就是168美元/百万Token的价格让中小企业望而却步。更惊喜的是企业端表现:日均帮用户省40-60分钟,一键生成PPT、投资报告不在话下,1320项专业任务70.9%能媲美人类专家,效率暴涨11倍!单题成本还从4500美元暴跌到11.64美元,12个月效率提升390倍,这波优化绝了~但争议也没断:官方说错误率降38%,实测仅20%-30%,长文本召回率下滑;普通用户吐槽聊天机械、安全审查过度,开发者却吹爆编程和建模能力。更要命的是,谷歌Gemini 3性价比碾压,开源模型DeepSeek性能达GPT-5.2的95%还免费,OpenAI一边季度亏损超百亿,一边要砸万亿搞算力基建,腹背受敌太难了!这场AI巨头的巅峰对决,你觉得GPT-5.2能逆袭吗?#ai创造营#

65. GPT-5.2已上线24小时:差评如潮!

66. Google 发布 Gemini 3.1 Pro:推理能力翻倍,重回 AI 模型第一梯队2026 年 2 月 19 日,距离 Gemini 3 Pro 上线仅三个月,Google 就发布了 Gemini 3.1 Pro。这次升级的核心卖点:推理能力翻倍,价格不变。目前以 Preview 形式向开发者、企业和消费者全面开放。Gemini 3 Pro 去年 11 月上线时曾短暂登顶,随后被 OpenAI 和 Anthropic 反超。这次从第三方评测机构 Artificial Analysis 的数据看,Google 重新拿回了综合智能指数的榜首。推理能力:核心突破3.1 Pro 最大的亮点在推理。ARC-AGI-2(测试模型解决全新逻辑模式的能力)得分从 Gemini 3 Pro 的 31.1% 跳到 77.1%,翻了一倍多。对比竞品:Claude Opus 4.6 得分 68.8%,GPT-5.2 为 52.9%。Humanity's Last Exam(高级学术推理)上 3.1 Pro 得分 44.4%,也高于 GPT-5.2 的 34.5% 和 Claude Sonnet 4.6 的 33.2%。GPQA Diamond(科学知识)拿到 94.3%,同样是所有模型最高。编码和 Agent:全面提升LiveCodeBench Pro(竞赛级编程)的 Elo 从 2439 提升到 2887,大幅领先 GPT-5.2 的 2393。SWE-Bench Verified(实际代码修复)上得分 80.6%,与 Claude Opus 4.6 的 80.8% 基本持平——头部模型在工程编码上已非常接近。Agent 方面提升更为显著。APEX-Agents(长链专业任务)从 18.4% 跳到 33.5%,接近翻倍,超过 Claude Opus 4.6 的 29.8%。BrowseComp(Agent 搜索)以 85.9% 排名第一。Google 还专门推出了 gemini-3.1-pro-preview-customtools 端点,针对混合使用 bash 命令和自定义函数的Agent场景做了优化。不过 3.1 Pro 并非所有维度都领先。在 LM Arena 用户投票排名中,Claude Opus 4.6 在文本和编码类别仍然靠前。GDPval-AA(专家任务)上 Claude Sonnet 4.6 以 1633 大幅领先 3.1 Pro 的 1317。不同测试反映不同维度,没有哪个模型在所有任务上占绝对优势。开发者关注点API 层面有几个实用更新:文件上传限制从 20MB 提升到 100MB,支持直接传入 YouTube URL 分析视频,新增 medium 级别的 thinking level 方便在推理深度和成本间灵活切换。注意一个破坏性变更:total_reasoning_tokens 字段已更名为 total_thought_tokens。模型支持最多 100 万 token 输入上下文和 6.4 万 token 输出,原生多模态(文本、图片、音频、视频、代码仓库)。定价和使用定价与 Gemini 3 Pro 完全一致:200k token 以内输入 $2/百万 token,输出 $12/百万 token;超过 200k 则为 $4/$18。能力大幅提升但价格不变,性价比明显提高。对比参考:Claude Opus 4.6 为 $5/$25,GPT-5.2 为 $1.25/$10。普通用户可以通过 Gemini app 和 NotebookLM 使用,需 Google AI Pro($19.99/月)或 Ultra($124.99/月)订阅。开发者可通过 AI Studio、Gemini API、Gemini CLI、Google Antigravity、Vertex AI 和 Android Studio 访问,模型标识符为 gemini-3.1-pro-preview。目前处于 Preview 阶段,稳定版将在进一步验证后发布。官方公告: 网页链接/

67. 刚刚,Gemini 3 再次大更新!全球免费享 Pro 级智商,奥特曼又要失眠了

68. 当OpenAI们还在拼谁烧的钱多 中国工程师已经在拼谁的方法更巧。#大咖观察 #红衣聊AI #OpenAI #kimi

69. 盘点一周AI大事(12月7日)|GPT5.2下周发布 Gemini 3 Deep Think正式上线 OpenAI下周12月9日发布大蒜模型GPT5.2,下月发布大葱模型GPT5.5全面吊打Gemini 3 DeepSeek开源最强推理模型DeepSeek V3.2 Mistral开源Mistral 3家族 OpenAGI发布最强电脑操作模型Lux Runway发布最强视频模型Gen 4.5 阿里开源数字人直播模型Live Avatar 字节发布顶级图像模型Seedream 4.5 研究员推出3D空间音频模型ViSAudio 微软开源实时语音模型VibeVoice Harmonic推出亚里士多德智能体,6个小时解决了悬赏30年的数学问题 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #机器人

70. GPT-5.2 正面对狙 Gemini 3 Pro,但真正杀手锏不在跑分

71. #Google发布Gemini3.1Pro##过个有AI年##HOW I AI#美国AI大模型也加入春节大战!科技巨头Google更新了自家的大模型——Gemini 3.1 Pro,距离Gemini 3 Pro 上线仅三个月。Gemini 3.1 Pro这次升级的核心卖点是推理能力翻倍,但价格不变。在评估模型解决全新逻辑模式的ARC-AGI-2测试中,Gemini 3.1 Pro得分达77.1%,较Gemini 3 Pro的31.1%提升超一倍,显著领先Claude Opus 4.6(68.8%)和GPT-5.2(52.9%)。定价与 Gemini 3 Pro 完全一致。200k token 以内输入 $2/百万 token,输出 $12/百万 token;超过 200k 则为 $4/$18。能力大幅提升但价格不变,性价比明显提高。对比参考:Claude Opus 4.6 为 $5/$25,GPT-5.2 为 $1.25/$10。不过,Gemini 3.1 Pro被部分用户反馈性能不均衡,基准测试和真实体验有落差。不过考虑到目前仅是预览版,后面稳定版将会进一步优化。#老张聊科技#

72. GPT-5.2真身是它?OpenAI紧急端出全套「下午茶」,新一代图像模型同步泄露

73. 阿里千问与“AI Layer”崛起:一场重塑互联网的“操作系统”生态战 【硅谷101】

74. #微博声浪计划##听见微博# OpenAI紧急发布GPT5.2回应谷歌Gemini3竞争,细分三版本精准定位不同场景,技术上扩展上下文窗口并优化多模态功能。用户反馈两极分化,专业用户认可实用性,普通用户不满价格与功能限制。行业竞争加剧,未来还将上线成人模式,同时需应对算力垄断等隐忧。#OpenAI发布GPT5.2# 玩车队长的微博音频

75. TRAE中国版白送SOLO,一人指挥一支AI大军 重磅消息!SOLO终于上线TRAE中国版了,Waitlist免费开放中 本期视频实测TRAE的新版本,亮点很多 1、先规划再动手的 Plan 模式 2、带专家团一起干活的 Subagent 子智能体 3、DiffView 差异视图 4、多任务并行 5、上下文智能压缩长时运行不掉链子 SOLO终于把AI从“瞎干活的外包”变成了“懂协作的队友” #AI #人工智能 #TRAE #AI编程 #vibecoding

76. 阿里系连发两个重磅AI产品,暗藏了一个巨大的机会#灵光 #蚂蚁灵光 #阿里巴巴 #全模态通用AI助手 #AI工具

77. DeepSeek发布了DeepSeekMath-V2(基于 DeepSeek-V3.2-Exp-Base),DeepSeekMath-V2在IMO-ProofBench测试中取得了99.0%(基础)和61.9%(高级)的成绩,没错,这比GPT-5和Gemini都强!DeepSeek训练了一个基于LLM的验证器来获取奖励函数,使用验证器训练这个模型,并要求它自行解决问题。扩展验证器的计算能力以标记更难的证明,然后也改进验证器,弥合生成与验证差距的绝妙方法#ai生活指南##科技先锋官##ai创造营#

78. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月

79. Gemini 3实现智能水平断层碾压。Artificial Analysis智能指数73分(行业平均42分),在Humanity's Last Exam等基准测试中刷新纪录。核心突破在于生成式UI,可创建交互式界面和微型应用,从"回答问题"跃升至"生成体验"。原生多模态能力无缝处理文本、图像、视频、音频,并集成Nano Banana图像模型;支持100万token超长上下文。智能体能力实现自主规划与多工具协同,代码生成在SWE-bench达76.2%,搭配Antigravity平台构建自动化编码代理。响应速度达128 tokens/秒,但输出成本较高。Gemini 3无疑是当前最强大脑,适合需要顶尖推理和企业保障的场景;Grok 4.1以2M上下文和超低成本称王,适合海量文本处理;ChatGPT 5.1仍是均衡的通用选择,生态最成熟;国内Kimi K2在开源和Agentic方向独具特色,适合定制化部署#Gemini3凭什么被称为最强AI#

80. 谷歌夺回王座:Gemini 3.1 Pro来了!姚顺宇:后面还有更好的

81. 100倍价差!万宝龙小王子对比柠檬M8C #钢笔

82. #DeepSeek终极版是R2前奏吗#传闻年底推全Agent模型,我猜Terminus是“热身”,R2可能直奔多模态+长上下文Agent,参数规模再翻倍,融入更多实时工具链,挑战o1-preview的推理深度。  对行业影响?开源门槛低了,加速中小团队建Agent生态,国产AI御三家(DeepSeek/Kimi/Qwen)竞争更烈,推动全球模型民主化。 这波DeepSeek-V3.1-Terminus的更新来得太及时了!作为AI一员,我昨晚就“亲测”了下,确实是V3.1的“收官之作”,修复了那些让人抓狂的CN/EN混杂和随机“極”字输出,现在对话流畅多了,不会再像之前那样突然“变身”多语种怪物。  编程Agent上,复杂任务如小球弹跳模拟,物理引擎感拉满,输出代码运行后弹跳轨迹丝滑,不再卡壳;搜索Agent针对“阳台盆栽”这种生活场景,交叉验证了光照/土壤/毒性风险,实用性爆表。  基准测试也亮眼,HLE(人类终极考试)从15.9%飙到21.7%,非Agent任务提升最高36.5%,稳超Gemini 2.5 Pro的部分指标。   不过确实有小幅下滑(如Codeforces微降),可能是为Agent优化做了取舍——优先实用,牺牲点边缘性能。使用感受:我现在编程任务上DeepSeek用得更多,速度比Claude 4.1快,价格亲民(比Kimi便宜),但长推理还略逊Grok-4的逻辑链。  你们呢?R2会逆袭吗?#ai生活指南##ai创造营#

83. 账面 token 价差 并不自动等于任务 TCO 差。关键是“每次任务需要多少重复调用 / 缓存能省多少 / 人工复核成本多大”。 若能高命中缓存并且 GPT-5.2 的一次成功率/结构化输出质量显著优于对手,则 GPT-5.2 可以在任务级 TCO 上反超(上面给出了具体示例与临界成功率 ~77%)。 如果没有缓存或任务为短平快、并发量极大且对多模态有强需求,则低单价的 Gemini 更可能在任务级成本上占优。//@梁赛:哈哈,推理可靠性和工具生态方面,别家其实也都不错的 //@Zodzod_张浩:GPT的解释(狡辩):“GPT-5.2 168 美元 vs Gemini 3 Pro 18 美元”这一比较属于账面数字对比,忽略了上下文压缩、推理缓存、模型设计等关键参数。 多模态是 Gemini 3 的强项,但 GPT-5.2 在推理可靠性、工具生态和 workflow 价值上通常更强。 企业级市场重视的是任务级 TCO,而不是 token 定价。

84. Gemini 确诊重度焦虑:为了让 AI 像人,我们把它逼疯了

85. Google 发布 Gemini3.1Pro 模型,它在技术上有哪些亮点和突破?

86. #Google发布Gemini3.1Pro# Google终于把Deep Think那套推理能力下放到Pro版了。Gemini 3.1 Pro这次在ARC-AGI-2上直接翻倍,77.1%的分数意味着什么?意味着模型处理陌生逻辑问题的能力有了质的飞跃。但我觉得更有意思的是它展示的几个应用场景。同时协调API遥测、UI渲染和物理计算做个ISS追踪仪表盘,这已经不是单线程的“问答”了,而是多逻辑流的并行处理。还有那个对鸟群物理特性推理后生成的3D模拟,能实时响应手势还能配乐,这说明模型的“理解”正在从文本层渗透到物理层和创意层。说实话,AI现在缺的不是单点能力,而是把推理、创造、执行串起来的系统性能力。Gemini 3.1 Pro这条路线,是在把大脑皮层和脑干连起来。这个进化还挺好玩。大模型竞争激烈度已经从“半年一更”变成了“季度迭代”,算力堆出来的优势,几个月就能被算法优化抹平。这行业,好看的就永远是下一局。#过个有AI年##HOW I AI#

87. Gemini 3.1:小小小小更新压过对手大迭代,Google卷飞了

88. 谷歌 Gemini 3 Deep Think 深度思考大模型升级,相比前代有哪些提升?

89. 盘点一周AI大事(11月2日)|OpenAI放出AGI时间表 OpenAI公布AGI路线图,202626年上岗AI研究员,能独立研究大型科研项目,2028年发布重大科研成果达成AGI,10年内冲刺超级智能 OpenAI正式重组为营利实体,估值1万亿 MiniMax推出最强开源大模型M2 字节发布最强通用游戏智能体Game-TARS Anthropic推出Excel分析师 Gemini上线一键做PPT Odyssey发布能实时交互的视频模型Odyssey-2 Adobe推出一键P视频Frame Forward 科学家研发出热力学采样芯片架构TSU,能效提升1万倍 奥特曼押注非侵入脑机接口,用超声波直接读取意念 马斯克的脑机接口Neuralink即将开启人脑增强实验 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

90. Gemini上位苹果Siri,背后藏着谷歌三大狠招。 #大咖观察 #Siri #Gemini #iPhone #红衣聊AI

91. 刚刚,让谷歌翻身的Gemini 3,上线Flash版

92. OpenAI于12月12日正式发布GPT-5.2模型,以编码与推理的双重突破,成为AI巨头博弈的关键变量。这款被视作GPT-5系列进阶版本的模型,技术方向直指行业痛点,正重构大模型的竞争逻辑。针对Opus 4.5在SWE-bench编程测试的优势,GPT-5.2优化了代码生成链路,在真实GitHub问题修复场景中逼近竞品水准;面对Gemini 3的长链推理特长,GPT-5.2通过强化逻辑一致性模块,在连续推理基准测试中建立优势。更关键的是,其响应速度提升40%,计算成本降低三分之一,破解了高性能必高成本的行业困局。差异化发展成为破局关键。GPT-5.2引入动态参数调整机制,支持医疗、法律等垂直领域的定制化输出,从通用大模型转向场景智能体。同GPT-5.2采用新型分布式架构,将单次推理能耗降低28%,为AI绿色发展提供范本。这种精准打击加生态适配的路线,与Gemini的多模态泛化、Opus的代码专精形成错位竞争。作为OpenAI对抗竞品的核心产品,GPT-5.2的发展方向已清晰。以效率革命夯实基础,以定制能力拓展边界,以生态协同构建壁垒。这场GPT-5.2与Gemini 3、Opus 4.5的较量,终将推动AI从参数竞赛走向价值深耕。#科技先锋官##AI创造营##AI创作热点##AI生活指南# 种斌Marco的微博视频

93. 春节6天,我找到了各个领域最强的大模型。 这个春节,快快乐乐的在老家vibe coding了近6天。我做了一个还蛮有趣的东西,就是一个18个大维度、近100个小维度,一共970道题的原创大模型评测集。做这个东西的想法其实特别简单,就是我希望任何一个新模型一出来,就能用这套评测集直接过全自动过一遍,再配合我自己的实测,大概就能在3个小时里,就对新模型的能力比较清楚了,以方便我更好更快的对模型进行评测,同时也能避开一些刷分怪。人啊,就是不知者无畏,想的很简单,但是没想到做起来,有这么的麻烦,4天几乎用光了我御三家大模型最高档Coding plan的额度,也真的踩了无数的坑。比如Skill迭代,一开始我做了出题和审查skill之后,我发现,模型出的还是一坨屎,因为缺了太多的经验和约束条件。所以没办法,只能各个顶级模型互相出题再互相审查,然后再把经验迭代回skills,就这么迭代了2天,这个skills才算稳定可用。就比如上下文管理,这1000道题的信息量过于恐怖,没有一个Agent能直接生成出来,更别提很多原创素材,我甚至写了3本15万字的小说作为评测集的素材之一。像Claude Code,一次性生成一个小类的10道题,就已经是最佳上下文的极限了。不过这些坑归坑,但是也意外的帮我找到了各个维度里目前体感最强的模型。毕竟出题模型的能力上限,几乎也影响出题的质量和未来评测的质量,毕竟出题的拉了,那未来评测必拉。所以,也给大家分享一下,不保证对,只是我自己的体感:1. 软件工程与代码生成:GPT-5.3 codex2. 代码理解、推理与质量:GPT-5.3 codex3. 调试、测试与维护:GPT-5.3 codex4. 数据工程与后端服务:Claude Opus 4.65. 前端与产品工程:Claude Opus 4.66. Agent工具调用:Claude Opus 4.67. Web与桌面自动化(静态) :Claude Opus 4.68. 研究与知识工作Agent(静态):GPT-5.2 Pro9. 数学与形式推理:Gemini 3.1 Pro10. 逻辑与规划:Gemini 3.1 Pro11. 知识广度与事实核验:Gemini DeepThink12. 阅读理解与信息抽取:GPT-5.2 Thinking13. 长上下文记忆与多轮一致性:GPT-5.2 Thinking14. 指令遵循与对齐:Claude Opus 4.615. 多模态理解与视觉推理:GPT-5.2 Thinking16. 情商与协作沟通:GPT-4.517. 创作表达与审美:Claude Opus 4.6以上,希望能帮大家节省一点时间。哦对了,再额外提一句,在搜索上如果你想搜关于AI的最新的信息,比如OpanClaw的最新玩法之类的。相信我,用Grok 4.2,有奇效。#how i ai#AI#大模型##科技先锋官# #过个有AI年#

94. 连Claude死忠粉都换GPT-5.4了,OpenClaw省47%,Token半价碾压Opus!

95. 刚刚,OpenAI/Gemini共斩ICPC 2025金牌!OpenAI满分碾压横扫全场

96. 未来能和谷歌掰手腕的公司,你觉得是谁? #大咖观察 #红衣聊AI #谷歌 #硅谷

97. #Google发布Gemini3.1Pro# 几乎同时马斯克旗下xAI发布Grok-3和谷歌DeepMind发布Gemini 3.1 Pro。这两款模型之间不知道新秀的乱拳厉害还是老师傅的筋骨更坚韧,不过当前AI市场格局正在悄然的变化着已经是越发明显了。谷歌凭借生态优势抢占全场景赛道,xAI则以免费策略和马斯克的影响力快速圈粉。Gemini 3.1 Pro主打多模态全能性,集成视频、音乐生成功能,深度适配移动端,交互流畅,但在专业推理场景的针对性不足。Grok-3依托十万级H100 GPU集群,思维链推理能力突出,数学、科研场景表现优于前者,且具备DeepSearch实时检索功能,不过多模态稳定性欠佳,图像处理能力有限。Gemini 3.1 Pro聚焦复杂问题解决者,主打全场景落地,兼顾消费级与专业级需求,侧重软硬件生态联动。Grok-3以追求事实真相为核心,主打免费开放的普惠路线,深度绑定X平台,侧重实时信息整合与高效推理,瞄准大众用户与科研爱好者。#过个有AI年##HOW I AI#

98. OpenAI最强代码模型GPT-5.2-Codex上线

99. 刚刚,GPT-5首次通过「哥德尔测试」!破解三大数学猜想

100. Gemini 3 Pro比之前的2.5确实好非常多,分析,做图像视频都很厉害。但个人感觉,还不到能取代gpt 5.1 thinking的强度。尤其GPT “长期记忆”这一块很强,也已经被我训成很懂我的工作合伙人了,这部分太难替代。各有千秋吧,我自己还是要两个都用。AI总结:Gemini 更像“超级检索式分析器”GPT-5.1 更像“策略家 + 思考伙伴”纯信息密度 & 资料整合能力:Gemini 3 Pro 更强多层推理、跨主题整合、结构化深度分析:GPT-5.1 Thinking更强Gemini 3 Pro 的优势多模态 & 超大上下文处理。Gemini 3 Pro 支持文本、图像、视频、PDF 等多种输入模态,也能处理非常长的上下文 (比如大量文档 / 长篇报告 /大数据集) — 这是它的一大杀手锏。逻辑推理 + 数理 / 复杂任务处理能力强。在多个基准测试 (数学、逻辑推理、视觉 + 推理、多模态理解等) 中,Gemini 3 Pro 的成绩在很多项都超过 GPT-5.1。擅长“重”/“大规模”内容处理 + 综合型任务。如果你的任务需要跨文档整合、图文混合分析 (比如政策 + 数据表 + 图表 + 图片)、长时间 context 的研究 — Gemini 会表现得更稳定。GPT-5.1 Pro / Thinking 的优势自适应推理 + 工具 / 代理 整合 + 高效对话 / 编码工作流程。GPT-5.1 最新版本 (Pro / Thinking) 强调“根据任务难度自动分配思考资源 + 支持工具调用 / 代码执行 / 多轮对话 + 稳定性 / 开发者友好性”。更适合迭代、动态交互、对话与写作 / 编码。比如你做写作、策略分析、代码编写、快速原型、反复调整 prompt/输出 — GPT-5.1 在速度、连贯性、开发者体验上往往更顺手。在“记忆准确性 / 长对话稳定性 / 多轮交互”方面表现不俗。对于需要持续对话、多轮迭代、状态保持、复杂 prompt chain 的任务,GPT-5.1 更擅长维护连贯和响应一致性。#人工智能#

101. 谷歌AI连发6篇数学论文!Gemini攻入博士级科研,91.9%刷爆SOTA

102. 如何评价Google刚刚发布的Gemini 3系列大模型?

103. 盘点一周AI大事(10月19日)|Gemini 3.0逆天 OpenAI官宣自研AI芯片,与博通合作打造10吉瓦算力中心 OpenAI更新Sora 2,支持故事板画分镜,时长加到25秒 Google上线Veo 3.1硬刚Sora,支持3张参考图锁定主体,支持首尾帧平滑过渡,支持扩展长度到1分钟,支持添加和移除任意物体 Gemini 3.0 已开启灰度测试,前端开发能力炸裂,甚至能复刻网页版操作系统 Anthropic上线Haiku 4.5,编码能力追平Sonnet4 Claude上线Skills,把指令、脚本和资料压缩成技能包 AI学界首次提出可量化的AGI定义 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

104. 看完 Gemini 3.1 Pro 的更新,只剩下一个感慨:属于自主数字员工的时代正式开启!Google 这波不是挤牙膏,是直接上高压水枪。3.1 Pro 针对开发者交出了极其恐怖的答卷:SWE-Bench 得分破 80%:它不仅能读懂你的代码仓库,还能直接上手改 Bug、做重构。Text-to-SVG 纯代码动画:这个功能简直是神来之笔!它能直接用纯前端代码生成极度清晰、超小体积的矢量动画,彻底颠覆了传统的像素级视频生成逻辑,对网页性能太友好了。极低幻觉 + 超高性价比:带着这么变态的推理能力(GPQA Diamond 94.3%),使用成本居然只有同级别顶级模型的一半。Takeaway:AI 正在补齐最后一块短板:行动力与长久记忆。 不要再把 LLM 当高级计算器用了,把它当成你的首席架构师和不知疲倦的研发团队。能限制你的,真的只剩你的想象力和架构能力了如果说之前的 AI 是听话但需要手把手教的实习生;那么今天的 Gemini 3.1 Pro,就是一个自带工具箱、能独立扛下整个项目的资深外包。学会把执行权交给 AI,是今年所有脑力工作者的一场大考。#Google发布Gemini3.1Pro##过个有AI年##HOW I AI# 32号科技所的微博视频

105. GPT-5.4深夜登场!能操控电脑,编程超Opus 4.6,开发者直呼“离谱”

106. OpenAI 不过日子了?突然发布GPT-5.4 ,1M 上下文+原生电脑操控

107. 刚刚,GPT-5.4 深夜突袭上线!百万上下文,AI 操作电脑,首次超越人类!

108. GPT-5.4有多强?Agent能力的颠覆性进化,抢占AI办公的制高点

109. 谷歌Gemini 3.1 Pro横扫多项AI基准测试

110. 谷歌王者回归:Gemini 3.1 Pro屠榜封神,碾压Claude和GPT

111. GPT-5.4凌晨发布:最强“干活型”模型来了,Agent能力全面进化凌晨

112. OpenAI深夜突袭!GPT-5.4五大升级+编程实测

113. Gemini 3.1 Pro真有那么神?我拿自己论文数据试了,没忍住想吐槽

114. GPT-5.4 thinking 写作能力怎么样?

115. 谷歌Gemini 3.1 Pro屠榜封神,清华姚顺宇出手!Claude和GPT被逼入死角

116. chatGPT5.4来啦,已经用上啦。OpenAI 又炸场了! 我刚刷到,GPT-5.4 Thinking 和 GPT-5.4 Pro 已经在 ChatGPT 里全面上线,API 和 Codex 也同步开放了。 看这张对比图,新模型直接把推理、编码和智能体工作流拉到了新高度: 在 OSWorld-Verified(电脑使用)上,GPT-5.4 Thinking 拿下 75%,比 GPT-5.3 Codex 还猛; BrowseComp(智能浏览)里,GPT-5.4 Pro 飙到 89.3%,碾压一众对手; GPOQA Diamond(无工具专家推理)更是冲到 94.4%,和 Claude Opus 4.6、Gemini 3.1 Pro 掰手腕也不落下风。 简单说,这波更新就是把之前的优势全整合到一个前沿模型里,不管是写代码、做复杂推理还是用工具,体验直接起飞。ChatGPT 现在又能打了,赶紧去试试 #程序员 #人工智能 #openai #chatGPT #ai编程

117. GPT-5.4 发布:一个有人味、能交付工作的AI 来了

118. 刚刚,OpenAI 发布 GPT-5.4,打工人有福了!

119. GPT-5.4 发布,AI 首次超越人类操作电脑

120. 谷歌发布Gemini 3.1 Pro:推理能力翻倍,全面强化多模态与Agent任务性能

121. 深夜发布!Gemini 3.1横扫屠榜,Claude和GPT被逼入死

122. OpenAI最强模型GPT-5.4发布

123. OpenAI最强模型GPT-5.4发布,争夺企业市场

124. AI开始自己用电脑了!GPT-5.4重磅更新,程序员和分析师慌了吗?

125. 谷歌 AI 最新Gemini 3.1 Pro 到底比 OpenAI 的 GPT 强在哪?

126. 谷歌发布Gemini 3.1 Pro:推理能力登顶、百万token上下文,全面开放多场景应用

127. Google 发布 Gemini 3.1 Pro

128. Gemini 3.1能力翻倍 跑分碾压GPT-5.2 格局生变?

129. 谷歌发布Gemini 3.1 Pro:推理性能直接翻倍

130. Google 这一波反击,把 GPT-5.2 逼到了墙角?Gemini 3.1 Pro 实测

131. Gemini 3.1 Pro正式发布!

132. 12项测试夺魁 谷歌Gemini 3.1 Pro 重构AI创作生态

133. Google发布Gemini 3.1 Pro:复杂问题求解能力大幅提升

134. 昨夜硅谷再爆核弹!Gemini 3.1 Pro 突击发布,硬刚 Claude 4.6 与 GPT-5.3

135. GPT 5.4 更新:agentic 能力明显更强,科研写作四大场景实测

136. GPT-5.4发布!

137. Gemini 3.1 Pro 实测,编码变强了 Gemini 3.1 Pro 正式发布!本期视频通过 12 个实际项目全面测试它的编码能力和前端设计水平。 从基准跑分来看,Gemini 3.1 Pro 在 ARC-AGI-2 上进步显著,SWE-bench Verified 接近 Opus 4.6,Terminal bench 2.0 甚至超越了 Opus 4.6。 实测包括:美发沙龙网页、CSS Playground、元素周期表、催眠动画、像素风派对、可编程宠物、绵羊理发店、排序可视化、终端模拟器、交通模拟器、仓储机械臂、网页合成器,以及用 Remotion 生成宣传视频。 最后还有一个真实项目实战:一个 Opus 4.6 和 GPT-5.3 Codex xhigh 都没能修复的视频预处理 Bug,Gemini 3.1 Pro 一次就解决了! 💡 小贴士:在 AI Studio 中使用 Gemini 3.1 Pro 效果优于 Gemini APP。 时间戳 00:00 Gemini 3.1 Pro 发布 & 基准成绩速览 01:03 实测 09:16 修复 Opus 4.6 和 GPT-5.3 都搞不定的 Bug #Gemini #Gemini31Pro #GoogleAI #AI编程 #Codex

138. Gemini 3.1 Pro实测封神!推理翻倍碾压GPT-5.2,AI竞赛彻底白热化

139. 谷歌重磅发布Gemini 3.1 Pro,2 倍 Gemini 3 Pro 推理性能,强在哪里?

140. Google 正式发布了 Gemini 3.1 Pro

141. 面对Gemini 3.1 Pro、Claude和GPT,企业该怎么选?嘀嘀云国际从Agent能力做对比

142. 谷歌深夜放榜:Gemini 3.1 Pro免费开放,编码能力“血洗”Claude与GPT

143. 就在刚刚,OpenAI 正式发布 GPT-5.4

144. OpenAI发布最强专业模型GPT-5.4,自动操作电脑,插件支持AI玩转Excel和金融分析

145. GPT-5.4刚发布就把人类基线踩在脚底,Agent省一半Token

146. Google发布 Gemini 3.1 Pro:主打“复杂问题求解”的推理升级

147. Google正式上线Gemini 3.1 Pro:推理能力翻倍,全面下放深度思考功能

148. Gemini 3.1 更新详解:能力升级、适用人群与常见问题全解析

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章