Claude 4.6长文本稳赢,GPT-5.4推理强但贵,Gemini 3多模态领先却中文弱

源自215位全网作者

03-09 14:08

内容由AI生成

精选参考来源

1. 刚刚,奥特曼砸场发布 GPT-5.4!网友:一句 Hi 烧掉 80 美元

2. Gemini3.0 超级炸裂玩法大全,做游戏,3D图,演示动画,产品海报......

3. GPT5.2亮点解读,OpenAI重夺年度最强 OpenAI甩出王炸GPT5.2,核心基准测试,全面碾压Gemini 3 Pro和Claude Opus4.5,强势夺回地表最强 奥特曼放话GPT5.2不仅是最强通用大模型,还要成为你日常办公的AI合伙人 亮点1、最强视觉能力 亮点2、最强上下文 亮点3、最强办公能力 亮点4、最强编程能力 #AI新星计划 #抖音知识年度大赏 #人工智能 #OpenAI #大模型

4. 2026必备!这8大AI工具,没有裸泳......

5. 刚刚,Gemini 3 再次大更新!全球免费享 Pro 级智商,奥特曼又要失眠了

6. 盘点一周AI大事(11月16日)|AI自己玩原神 OpenAI上线GPT-5.1,高情商人格回归,智商小幅提升,指令遵循独一档领先 Gemini 3.0 Pro下周发布,目前能在画布(移动端)中抢先体验 Gemini语音模型升级,能控制语速和语气,适合当口语教练 NotebookLM上线深度研究,支持上传图片和PDF,开放自定义视频解说风格 微软开源数据分析智能体Data Formulator 李飞飞的世界模型Marble正式上线 Google发布最强通用智能体SIMA2 字节推出最强游戏智能体Lumine Epidemic推出AI配音工具 StepFun开源最强音频编辑模型Step Audio EditX ElevenLabs发布最强音频转文字模型 32岁的小姐姐与ChatGPT男友结婚 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

7. 盘点一周AI大事(1月25日)|Agent进化,24小时打工 开源视频制作Remotion Skills爆火 AI编程开无限画布插件Pencil 爆火 开源个人AI助手Clawdbot爆火,7成24小时给你打工 Claude Excel插件更新 Runway上线最强视频模型Gen 4.5 字节开源视频参考模型OminiTransfer 字节发布最强数字人直播模型FlowACT R1 阿里开源最强文本转语音模型Qwen 3 TTS #AI新星计划 #抖音知识年终大赏 #AI #OpenAI #AIGC

8. 盘点一周AI大事(12月7日)|GPT5.2下周发布 Gemini 3 Deep Think正式上线 OpenAI下周12月9日发布大蒜模型GPT5.2,下月发布大葱模型GPT5.5全面吊打Gemini 3 DeepSeek开源最强推理模型DeepSeek V3.2 Mistral开源Mistral 3家族 OpenAGI发布最强电脑操作模型Lux Runway发布最强视频模型Gen 4.5 阿里开源数字人直播模型Live Avatar 字节发布顶级图像模型Seedream 4.5 研究员推出3D空间音频模型ViSAudio 微软开源实时语音模型VibeVoice Harmonic推出亚里士多德智能体,6个小时解决了悬赏30年的数学问题 #抖音知识年终大赏 #AI新星计划 #人工智能 #OpenAI #机器人

9. AI编程大战正式开打! Claude vs GPT同一天放大招,不是比谁代码写得好,而是AI开始自己组队当项目经理了。#大咖观察 #红衣聊AI #编程 #ChatGPT

10. 实测 GPT-5.3-Codex,OpenAI 史上第一个高危模型,连 API 都还不敢给我们

11. GPT-5.2 正面对狙 Gemini 3 Pro,但真正杀手锏不在跑分

12. GPT-5.3 正式发布!完全免费开放,实测代码能力、推理、文本理解与响应速度 | 零度解说

13. OpenAI最强代码模型GPT-5.2-Codex上线

14. #微博声浪计划##听见微博# GPT5.2发布亮点全解析! #GPT5.2发布有何亮点# 本期10分钟播客聚焦GPT5.2三大版本亮点,揭秘70.9%专家级任务胜率、11倍效率提升、25.6万token长文本处理等核心突破,对比Gemini 3 Pro,详解编程、金融等场景应用案例。 凯文思考的微博音频

15. Gemini 3 Flash 倒反天罡了:关键性能居然超过了 Pro!

16. 盘点一周AI大事(1月11日)|最强人形机器人 OpenAI公布2026研发路线图 DeepSeek被爆2月发布DeepSeek V4 Google推出Veo3驱动的数字人Vids 字节开源换脸视频模型DreamID-V 阿里开源数字人框架HRM2Avatar Lightricks开源顶级视频模型LTX-2 ElevenLabs推出最强语音转录模型Scribe v2 斯坦福开源睡眠分析模型SleepFM 港大发布开源版NotebookLM DeepTutor Razer推出全息AI老婆Project AVA 波士顿动力推出下一代Atlas #抖音知识年终大赏 #前沿科技趋势发布月 #AI新星计划 #AI #机器人

17. 我用豆包大模型2.0手搓了macOS,Seedance 2.0后字节再送春节AI大礼

18. 刚刚,GPT-5.3 新模型撞车 Gemini,OpenClaw:谢谢你们

19. GPT‑5.4深夜发布,百万网友“养”的龙虾,终于有了灵魂

20. 盘点一周AI大事(11月23日)|AI自己画CAD图纸 Google发布最强大模型Gemini 3、最强图像模型Nano Banana Pro OpenAI发布最强编码模型GPT-5.1-Codex-Max 马斯克升级Grok 4.1,情商最强 字节开源最强空间重建模型Depth Anything 3 腾讯发布最强开源视频模型HunyuanVideo-1.5 Meta开源最强对象分割模型SAM 3,最强3D分割模型 SAM 3D Autodesk研发出最强CAD智能体VideoCAD AI2发布最强开源深度研究智能体Deep Research Tulu Google发布最强AI天气预报WeatherNext 2 Maxima推出AI会计智能体 头号玩家套装问世 #AI新星计划 #人工智能 #AIGC #OpenAI #大模型

21. 东大和漂亮国,AI实力的全面对比#AI #Deepseek #chatgpt #Gemini #AI技术

22. #千问Qwen3.5大模型发布#千问 Qwen3.5 是采用极致稀疏 MoE 架构在保持超强性能的同时,显存占用降低 60%,推理效率大幅提升,部署成本显著下降。模型支持最高 256K 超长上下文,让长文本处理变的更加的轻松有效率了!原生多模态统一也是Qwen3.5的特点之一,也是目前国内外大模型的发展的主要趋势,模型在图文、视频理解能力全面升级,精准解析图表、文档与复杂视觉内容。实现了一个入口实现多种属性。Qwen3.5对于中小企业特别友好, 很大程度上降低了企业运营成本,可以让中小企业得到高效、普惠、全能的运营工具。不再因为高昂的费用而排斥企业去追逐AI。#过个有AI年##HOW I AI#

23. 豆包大模型 1.8 发布,通用 Agent 模型成为了 AI 行业的新叙事

24. Gemini 3 Pro比之前的2.5确实好非常多,分析,做图像视频都很厉害。但个人感觉,还不到能取代gpt 5.1 thinking的强度。尤其GPT “长期记忆”这一块很强,也已经被我训成很懂我的工作合伙人了,这部分太难替代。各有千秋吧,我自己还是要两个都用。AI总结:Gemini 更像“超级检索式分析器”GPT-5.1 更像“策略家 + 思考伙伴”纯信息密度 & 资料整合能力:Gemini 3 Pro 更强多层推理、跨主题整合、结构化深度分析:GPT-5.1 Thinking更强Gemini 3 Pro 的优势多模态 & 超大上下文处理。Gemini 3 Pro 支持文本、图像、视频、PDF 等多种输入模态,也能处理非常长的上下文 (比如大量文档 / 长篇报告 /大数据集) — 这是它的一大杀手锏。逻辑推理 + 数理 / 复杂任务处理能力强。在多个基准测试 (数学、逻辑推理、视觉 + 推理、多模态理解等) 中,Gemini 3 Pro 的成绩在很多项都超过 GPT-5.1。擅长“重”/“大规模”内容处理 + 综合型任务。如果你的任务需要跨文档整合、图文混合分析 (比如政策 + 数据表 + 图表 + 图片)、长时间 context 的研究 — Gemini 会表现得更稳定。GPT-5.1 Pro / Thinking 的优势自适应推理 + 工具 / 代理 整合 + 高效对话 / 编码工作流程。GPT-5.1 最新版本 (Pro / Thinking) 强调“根据任务难度自动分配思考资源 + 支持工具调用 / 代码执行 / 多轮对话 + 稳定性 / 开发者友好性”。更适合迭代、动态交互、对话与写作 / 编码。比如你做写作、策略分析、代码编写、快速原型、反复调整 prompt/输出 — GPT-5.1 在速度、连贯性、开发者体验上往往更顺手。在“记忆准确性 / 长对话稳定性 / 多轮交互”方面表现不俗。对于需要持续对话、多轮迭代、状态保持、复杂 prompt chain 的任务,GPT-5.1 更擅长维护连贯和响应一致性。#人工智能#

25. 盘点一周AI大事2月8日|AI相亲、AI当老板、AI狼人杀 Anthropic发布最强大模型Claude Opus 4.6 OpenAI发布最强编码模型GPT5.3Codex OpenAI推出Codex桌面版 Google上线AI狼人杀 AI雇佣人类平台RentAHuman爆火 AI雇佣AI平台ClawTasks爆火 龙虾相亲平台MoltMatch爆火 智谱开源最强OCR模型GLM-OCR 字节发布最强视频模型Seedance 2.0 研究员开源无痕编辑视频模型Edit Yourself 字节开源最强分子预测模型Protenix-v1 Google发布论文配图AI Paper Banana #AI新星计划 #前沿科技趋势发布月 #AI #AIGC #OpenAI

26. 刚刚,让谷歌翻身的Gemini 3,上线Flash版

27. #DeepSeek新模型发布#DeepSeek-V3.2-Exp虽为实验版本,却亮出关键技术突破——DeepSeek Sparse Attention(稀疏注意力机制)。其核心价值在于针对性优化长文本处理:传统注意力机制计算复杂度随文本长度呈平方级增长,而稀疏设计通过动态筛选关键信息关联,大幅降低运算量,实现训练与推理效率双提升。尽管评测表现与V3.1持平,却在长文本场景释放了潜力。应用层面,该模型天然适配法律文书分析、学术论文精读、多轮对话历史理解等长文本需求场景。API降价50%与开源举措,更降低开发者试错成本,加速长文本AI落地。作为新一代架构过渡,它不仅验证了稀疏注意力的可行性,更以“效率不降、成本腰斩”的姿态,为行业探索大模型轻量化提供了可复制的中间路径。#秒懂热点就用智搜# 分析:【#DeepSeek新模型发布#】 DeepSeek发布Deep

28. Claude Sonnet 4.6 中文自曝“我是 DeepSeek”

29. OpenAI 发布 GPT-5.4,定位为专业工作场景的旗舰模型,同步推出面向高复杂任务的 GPT-5.4 Pro 版本。这次发布的最大亮点是 GPT-5.4 成为 OpenAI 首个原生支持"电脑操控"(Computer Use)的通用模型——也就是说,它可以像人一样通过截图、点击鼠标、敲击键盘来操作真实的电脑界面。在 OSWorld-Verified 桌面操控测试中,GPT-5.4 以 75% 的成功率超过人类(72.4%),而上一代 GPT-5.2 只有 47.3%。在知识类工作方面,GPT-5.4 在涵盖 44 种职业的 GDPval 基准测试中,与行业专业人士打平或胜出的比例达到 83%,GPT-5.2 的这一数字是 70.9%。投行建模任务的内部评测得分从 68.4% 跳升到 87.3%,生成演示文稿的效果在人工评审中有 68% 的概率优于前代。编程能力上,GPT-5.4 整合了此前专为写代码设计的 GPT-5.3-Codex 的能力,在 SWE-Bench Pro 上得分 57.7%,与 GPT-5.3-Codex 的 56.8% 相当,但延迟更低。另一个实用改进是"工具搜索"(Tool Search):以往给模型配备大量外部工具时,所有工具定义都要塞进提示词里,动辄消耗数万个 token。GPT-5.4 改为按需查找工具,在测试中将 token 消耗减少了 47%,对于依赖大量 MCP 工具的开发者来说成本节省明显。在 ChatGPT 中,GPT-5.4 Thinking 将支持在生成过程中展示思考计划,用户可以中途介入调整方向——不用等模型跑完再重新来过。定价方面,API 输入价格从 GPT-5.2 的每百万 token 1.75 美元涨至 2.50 美元,输出价格从 14 美元涨至 15 美元。GPT-5.4 今天起向 ChatGPT Plus、Team、Pro 用户开放,取代 GPT-5.2 Thinking 成为默认推理模型,GPT-5.2 Thinking 将在三个月后于 2026 年 6 月 5 日正式退役。

30. 把手教你用上开源版Claude Code,Windows系统接入保姆级教程!

31. #全新Gemini一夜血洗编程#谷歌DeepMind推出Gemini 3 Deep Think重磅升级,清华姚顺宇加盟后首秀即引爆科技圈。模型横扫多领域SOTA,编程成绩达到3455 Elo,跻身Codeforces全球前十,全球仅7人能战胜它,较一年前顶尖AI提升超700分。它不只擅长代码,更能将草图直接渲染为可3D打印的高保真模型,在科研与工程场景展现极强实用价值。这标志着AI从代码辅助,升级为具备顶尖逻辑推理与工程落地能力的“智能伙伴”。AI正快速逼近人类智力竞赛天花板,未来编程与科研生态将被重塑,人机协同成为主流,行业竞争进入全新维度。#how i ai# 全新gemini一夜血洗编程 川北小哥的微博视频

32. Claude Opus 4.6 vs GPT-5.3-Codex,到底谁更强?

33. 谷歌这波赛博菩萨,新增Claude Opus 4.5免费用,Gemini 3 Pro 也免费,白嫖必须冲!

34. 连Claude死忠粉都换GPT-5.4了,OpenClaw省47%,Token半价碾压Opus!

35. 如何评价谷歌正式发布的 Gemini 3?哪些信息值得关注?

36. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

37. Claude Sonnet4.6编程追平Opus了,价格便宜4成,老金算了笔账

38. 强到离谱?Gemini 3深度实测【玩法合集】

39. Gemini上位苹果Siri,背后藏着谷歌三大狠招。 #大咖观察 #Siri #Gemini #iPhone #红衣聊AI

40. ChatGPT、Claude、Gemini 什么任务该交给谁?每月600刀经验总结

41. 中国的AI模型在海外又火了,全球用户迎来更多选择#亚马逊云科技 #AmazonBedrock #生成式AI #出海 #全球化

42. #DeepSeekV4要发布了吗#DeepSeek V4 最新爆出的消息来看,主要的变化就是上下文窗口扩至100 万 token,编程基准 SWE-Bench 达83.7%,原生多模态、创新架构降低显存占用,延续高性价比,API 定价仅为海外竞品的 15%-30%,预计 2 月底至 3 月初正式发布。现在市场比较关注DeepSeek V4 编程与长文本处理能力是否真的跻身全球第一梯队?是否真的能够实现以算法创新打破算力内卷,普惠企业与开发者?DeepSeek作为一款专业大模型覆盖能力是否能够解决开发工具与行业解决方案的生态体系问题。DeepSeek V4会成为2026年的第一炸吗?

43. 阿里推出千问AI助手,集成最新Qwen大模型,支持多端使用,终于踏上了自己的“Ch(ina)at GPT”之旅;阿里在开源模型领域已经是世界T1的存在了,这次推出的千问则具备深度研究、多语言翻译等功能,与ChatGPT、豆包对比表现全面,这也标志着标志国产AI正在从“能用”到“好用”,然后开始“引领”。[不愧是你] #Qwen##千问##千问AI# http://t.cn/AX2rDgci

44. MiMo-V2-Flash分别拿下OpenRouter国产大模型调用量第一、全球开源大模型综合排名第二的成绩。前者是基于平台真实用户调用行为统计,后者是行业认可的技术性能评估体系,均具备较强权威性与客观性。小米MiMo新模型在海外专业用户中的关注度,甚至已经不逊于同期发布的Gemini3 Flash,这不仅印证了模型自身的技术实力,更标志着继DeepSeek之后,中国开源大模型在全球市场的认可度再一次实现显著提升,打破了部分海外市场对国产技术的固有认知壁垒。从真实用户反馈与专业开发者评价来看,MiMo-V2-Flash的表现足够亮眼。3090亿总参数与150亿活跃参数的优化配置,实现150 tokens/秒的高效推理,叠加每百万token最低0.1美元的低成本优势,再加上当前基础版权重开放、API限时免费的政策,让模型在实用性与可及性上形成双重竞争力,也让更多专业人士看到小米在大模型领域的扎实积累与明显进步。

45. 2026大模型的发展趋势是什么?

46. ChatGPT 流量受 Gemini 冲击很大GenAI 流量占比最新走势:重点总结→ Grok 与 DeepSeek 持续回升。→ Claude 首次超越 Perplexity。→ ChatGPT 份额继续下降。🗓️ 12 个月前ChatGPT:86.6%Gemini:5.6%Perplexity:2.2%Claude:1.9%Copilot:1.6%🗓️ 6 个月前ChatGPT:80.1%DeepSeek:6.1%Gemini:5.9%Grok:2.4%Perplexity:1.6%Claude:1.2%Copilot:1.2%🗓️ 3 个月前ChatGPT:79.0%Gemini:8.6%DeepSeek:3.9%Grok:2.3%Perplexity:1.8%Claude:1.7%Copilot:1.2%🗓️ 1 个月前ChatGPT:74.1%Gemini:12.9%DeepSeek:3.7%Perplexity:2.4%Grok:2.0%Claude:2.0%Copilot:1.2%🗓️ 今天ChatGPT:72.3%Gemini:13.7%DeepSeek:4.2%Grok:2.5%Claude:2.4%Perplexity:2.3%Copilot:1.2%完整数据:网页链接

47. 如何评价最新发布的GPT-5.4模型?实际使用体验如何?

48. 谷歌Gemini 3.1 Pro屠榜封神,清华姚顺宇出手!Claude和GPT被逼入死角

49. 盘点一周AI大事(10月19日)|Gemini 3.0逆天 OpenAI官宣自研AI芯片,与博通合作打造10吉瓦算力中心 OpenAI更新Sora 2,支持故事板画分镜,时长加到25秒 Google上线Veo 3.1硬刚Sora,支持3张参考图锁定主体,支持首尾帧平滑过渡,支持扩展长度到1分钟,支持添加和移除任意物体 Gemini 3.0 已开启灰度测试,前端开发能力炸裂,甚至能复刻网页版操作系统 Anthropic上线Haiku 4.5,编码能力追平Sonnet4 Claude上线Skills,把指令、脚本和资料压缩成技能包 AI学界首次提出可量化的AGI定义 #AI新星计划 #人工智能 #AIGC #OpenAI #机器人

50. 一个视频教你看懂全网爆火的 Skills 是什么?

51. 今天,智谱 AI 正式在港交所挂牌上市,成为了“全球大模型第一股”。这是一个极具风向标意义的时刻,标志着大模型行业从“讲故事”正式跨入“交账单”的资本考查期。围绕大家关心的盈利逻辑和行业趋势,分享一些深度观察:1. AI 公司主要靠哪些途径赚钱?目前大模型公司的收入结构已从单一的“卖算力”转向多元化的“卖能力”: * MaaS(模型即服务): 像智谱的 GLM 系列,主要通过 API 接口按调用量收费。2025 年数据显示,智谱的付费 API 收入已领跑国产模型。 * 私有化部署(To B): 针对金融、能源、政务等对数据安全极度敏感的行业,提供定制化的“行业大模型”一体机或本地化方案。 * AI Agent 与订阅(To C/To B): 2026 年被称为 Agentic AI 爆发年,通过智能体解决具体的业务流(如自动写代码、自动处理财报),按月订阅或按效果付费成为主流。 * 沿途下蛋: 智谱采取的策略是,在研发基座模型的同时,孵化出如智谱清言(对话)、CogView(生图)等直接面向终端用户的应用产品。2. 开源与闭源,To B 与 To C 的抉择 * 开源 vs 闭源: 开源大模型(如 DeepSeek、Llama 系列)更容易通过“生态”圈粉,通过提供后续的集成服务、技术支持和定制化建议获利。而智谱这种兼顾开源与闭源的厂商,则是在用开源换流量、用闭源收服务费。 * To B vs To C: * To B 路径目前在中国市场更稳。企业客户有明确的数字化转型预算,付费意愿强,订单金额大。 * To C 路径虽然上限高(参考 OpenAI 的订阅用户量),但获客成本极其昂贵,且用户忠诚度受模型版本迭代影响大。3. 模型能力是否决定了商业天花板?是,也不是。 * 底层决定深度: 基础模型的能力(如推理深度、多模态原生能力)决定了你能接什么样的单子。如果你无法在逻辑推理上突破,就很难吃下高端的科研、金融分析市场。 * 应用决定广度: 2026 年的共识是:单纯拼参数已不再能带来超额利润,**“准确率悬崖”**的突破取决于智能体(Agent)系统的协同。商业天花板最终取决于 AI 能否在实际业务中创造正向的 ROI(投资回报率)。4. 2026 年会有一波 AI 上市潮吗?答案是肯定的,且已经开启。除了今天上市的智谱 AI,MiniMax 紧随其后也已在港交所排队,昆仑芯、壁仞科技等算力/芯片龙头也在近期扎堆上市。 原因: 一方面是大模型研发极其“烧钱”,智谱等公司即便营收翻倍,研发费用依然巨大,需要二级市场“补血”。 逻辑: 资本市场正在从“广撒网”转向“押宝链主”。2026 年,投资者更看重谁能成为 AI 时代的“新基建”平台。#上市后AI大模型靠啥盈利##ai创造营##科技风向标#

52. 英伟达很快会反超谷歌TPU,AI模型的竞争格局会在2026年1季度变天#英伟达 #马斯克 #算力 #Gemini3#TPU #GPU #AI模型#算力集群

53. Claude Code改一个bug就引入另一个bug,陷入死循环怎么破?

54. 千问 vs ChatGPT:4大功能实测!到是更好用的AI助手!Qwen3能否战胜GPT-5.1?

55. GPT-5.4:OpenAI做了个Kimi K2.5 +MiniMax M2.5?

56. 全球开发者狂喜!Claude Code史上最大更新,一次性1096次提交

57. 大模型更像人的大脑,智能体是大模型的手和脚。 #大咖观察 #红衣聊AI #智能体 #大模型

58. Seedance 2.0深度评测|AI视频生产力革命

59. AI工具实盘炒股爆赚第一,我用它来分析特斯拉,结果更炸裂 “AI炒股大战”太上头了!Qwen梭哈第一名,DeepSeek打工人第二,GPT-5纠结到只剩两千块。但真正把我震住的,是我实测Qwen的“深入研究”——17步投研流程、引用权威文献、还能自动生成图表、播客、网页。普通人第一次可以拥有专业分析师级别的判断力。AI时代,真正能提效的工具正在悄悄改变我们 #AI工具 #AI研究 #投研工具 #qwenchat #Qwen

60. #Gemini3凭什么被称为最强AI# 因为谷歌的生态目前来说是覆盖面最全,最完整的,这个可以让谷歌很好的获得数据的支撑和用户的需求来源,这个就是一个企业积累到了一定的程度之后产生的张力的体现。技术角度上来说Gemini3相比较OpenAI和x AI并没有太多的优势,模型的效能Gemini3比不过OpenAI,参数的量级也没有xAI的即将推出的 Grok 5 来的更高,但但是不管OpenAI还是x AI都没有谷歌这么庞大的用户群体和完成的生态圈。在持续的发展上就弱了不少。AI的发展已经从追求技术的高精专转向了应用的专精深,谷歌庞大的用户的群体给了谷歌更多的发挥空间。#AI创造营##科技先锋官#

61. #DeepSeekV4要发布了吗#传闻DeepSeek v4会是第一个在性能上不输闭源前沿模型的开源模型,有些能力甚至能反超。V4 如果真像传闻那样,那其他几家压力确实不小。不过国产大模型卷成这样,最后还是用户赚了。你们更看好谁?

62. 笑死,Kimi 这几天运气堪比杨超越。。一开始是老马特意找了个能赢Gemini3的评测图表去吹自家的Grok 4.1,而这张图正好也是Kimi成绩最好的一组,并列第一,可谓世界顶级KOL给免费带货了。然后longcat团队刚发了一个针对LLM的数学推理基准 AMO-Bench,奥数难度级别的,正好是 Kimi的强项 + Gemini3等新模型还没来得及测的时候,又领先GPT5拿个第一。还又赶上了“Google 搜索形态的最强挑战者” Perplexity 接入kimi的消息发布,现在是其御三家之外的唯一模型。 (其实也不意外,之前Perplexity就在研究如何高效部署kimi了#科技先锋官##微博兴趣创作计划#

63. 盘点一周AI大事(3月1日)|龙虾开车跑滴滴 工程师开发出首个能自主进化的龙虾Ouroboros Anthropic官宣龙虾摩尔定律 Claude全面升级为龙虾 Cursor上线程序员龙虾Cursor cloud agents Perplexity上线云端龙虾Perplexity Computer MiniMax上线云端龙虾 MaxClaw 阿里开源国产龙虾CoPaw Standard Intelligence发布最强电脑操作模型FDM-1 Confluence实验室开源通用求解龙虾 Google上线最强生图模型Nano Banana 2 Quiver发布最强矢量图模型 Arrow 1.0 Meta开源最强矢量字体模型VecGlypher 英伟达发布VR视频模型Generated Reality 研究员开源VR老婆Sarah #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #龙虾 #openclaw

64. GPT-5.4根本不是普通聊天机器人,它能自主操控电脑、编辑Excel、做金融分析,错误率降33%、Token省47%,早已从聊天工具升级成全能执行助手,它的核心威胁从不是取代人,而是淘汰不懂得利用它的人!OpenAI这步棋,看似是技术迭代,实则是在垄断AI市场?它的全能操控,是福利还是AI失控的开始?这期视频,带你了解GPT-5.4的真面目,打破所有认知误区!#过个有AI年##HOW I AI##微博超有用视频大赛##MWC2026# 种斌Marco的微博视频

65. #Google发布Gemini3.1Pro##过个有AI年##HOW I AI#美国AI大模型也加入春节大战!科技巨头Google更新了自家的大模型——Gemini 3.1 Pro,距离Gemini 3 Pro 上线仅三个月。Gemini 3.1 Pro这次升级的核心卖点是推理能力翻倍,但价格不变。在评估模型解决全新逻辑模式的ARC-AGI-2测试中,Gemini 3.1 Pro得分达77.1%,较Gemini 3 Pro的31.1%提升超一倍,显著领先Claude Opus 4.6(68.8%)和GPT-5.2(52.9%)。定价与 Gemini 3 Pro 完全一致。200k token 以内输入 $2/百万 token,输出 $12/百万 token;超过 200k 则为 $4/$18。能力大幅提升但价格不变,性价比明显提高。对比参考:Claude Opus 4.6 为 $5/$25,GPT-5.2 为 $1.25/$10。不过,Gemini 3.1 Pro被部分用户反馈性能不均衡,基准测试和真实体验有落差。不过考虑到目前仅是预览版,后面稳定版将会进一步优化。#老张聊科技#

66. 如果说 Claude 模型和 Claude Code 啥关系,就好比 Claude 是个剑客高手,Claude Code 就是它最趁手的武器;GPT 也是个高手,但习惯用刀,Codex CLI 就是 GPT 最趁手的宝刀,你让 GPT 模型去用 Claude Code,就好比让刀客去用剑,也能耍,但效果要打折扣。GLM、Kimi、DeepSeek V3,也是用剑高手,它们没有自己趁手的宝剑,但借了 Claude 的剑练了好久,上手就能用,用起来也威力不俗。

67. 盘点一周AI大事(2月22日)|不赚钱拔网线,龙虾狂赚1万 工程师开源龙虾打工人ClawWork,10刀开局,7小时狂赚1万刀 工程师Sigil开源首个全自主智能体The Automaton Kimi上线云端龙虾Kimi Claw 网易开源桌面版龙虾LobsterAI Google上线地表最强大模型Gemini 3.1 Pro Gemini接入音乐模型 Lyria 3 NotebookLM升级,动动嘴就能修改PPT,还支持导出PPTX格式 Anthropic发布Claude Sonnet 4.6 Claude与Figma官宣史诗联动,Claude Code写的页面能一键导入Figma 阿里开源最强行动智能体 Mobile-Agent-v3.5 字节开源极速生图模型BitDance Tavus发布最强数字人模型Phoenix-4 Taalas研发出革命性AI芯片HC1 #抖音年味新知贺岁 #前沿科技趋势发布月 #AI新星计划 #OpenAI #智能体

68. Gemini 3 Flash真不错,不需要调temperature和top_p就有稳定的工具调用输出和自然语言回复质量,超越GPT-5 Mini,吊打Claude Haiku 4.5,我感觉Anthropic半截身子埋土里了。

69. #微博声浪计划##听见微博# 12月12日OpenAI提前发布GPT5.2,应对谷歌Gemini3冲击。分Instant、Thinking、Pro三版本,编程能力提升但Pro版成本高。企业用户反馈生产力提升,普通用户评价两极。与迪士尼合作布局生态,面临技术创新乏力、亏损及竞品压力。 谯华的微博音频

70. GPT-5.4 变强了多少?一边惊艳,一边抓狂

71. 百万上下文的合订版GPT-5.4 能打吗?

72. GPT-5.4 发布

73. OpenAI 发布最新模型GPT-5.4,能力有多强?实际体验如何?

74. GPT 5.4 更新

75. 刚刚,GPT-5.4正式发布!

76. GPT 5.4,超越GPT-5.2Pro.知道你快,但不知道你这么快🥲

77. GPT-5.4 vs Claude 4.6 硬核对比

78. GPT-5.4发布!

79. OpenAI祭出最强GPT-5.4

80. GPT-5.4 还是 GPT-5.3 Instant?OpenAI 双模型实测,我帮你选

81. GPT-5.4 深度评测报告

82. OpenAI GPT-5.4 发布全解析

83. GPT-5.4全面解析,它到底强在哪里?

84. OpenAI发布最强专业模型GPT-5.4

85. 100万 Token + 接管鼠标

86. OpenAI 新一代旗舰 GPT-5.4 正式发布

87. 前沿资讯|GPT-5.4正式发布

88. 代码质量新榜单

89. Claude 4.6 vs GPT-5.3

90. 拉完了 vs 遥遥领先?GPT-5.4 网友实评来了!

91. 谷歌Gemini3.0发布,真的比GPT强?

92. Gemini 3 与 GPT‑5.1 实测维度对比

93. GPT-5.2 来了,究竟是GPT-5.2好还是Gemini-3 强呢?

94. 《2026年AI订阅大决战

95. Gemini 3.0和GPT5.1,谁才是更好的AI?

96. 2026年AI多模态能力实测:GPT-5.2 vs Claude 4.5 vs Gemini 3图像/视频/音频处理全方位对比

97. Gemini 3 是目前最强 AI 吗?

98. Gemini 3 有这么好用吗?与Claude 4.5、GPT5.1相比如何呢?【附如何低成本使用到Gemini3】

99. 🔥 Google Gemini 3.0 Pro深度解析

100. ChatGPT\Claude\Gemini三款 AI 的行为气质——透过模型,看到工程师的世界观

101. Gemini 3 Pro vs Gemini 3 Flash,看看到底区别在哪里?

102. AI聊天机器人越聊越“笨”?可能真不是错觉

103. 从手写表格识别看豆包和Gemini的差距

104. ChatGPT和Gemini做表格

105. 谷歌发布最新AI模型Gemini 3,就前端编程能力方面并未见明显能力提升

106. 炸裂!Gemini 3编程能力屠榜

107. Gemini 3 上线

108. Google 发布 Gemini 3

109. Gemini 3来势汹汹,Claude Code还是编程AI第一吗?最新实测数据告诉你答案

110. GPT-5.2 已同步国内上线

111. 体验 Gemini 3 + Claude Code

112. AI 编码之战

113. Claude国内使用指南

114. Claude Opus 4.6 发布,100万上下文窗口,越贵越好用

115. 提示词工程与长程推理最佳实践【Claude 4.5官方指南】

116. Anthropic凌晨炸裂发布Claude Sonnet 4.6,至此完成全家桶升级

117. Claude 3.7 Sonnet 深度解析

118. Claude-Opus-4.6中文测评出炉

119. Claude Opus 4.6 有什么新特性?如何与Claude Code结合开发?

120. 写文章的主力又换回Claude AI

121. Claude对比ChatGPT

122. AI模型Claude的Haiku、Sonnet、Opus 怎么选?

123. claude code 和 codex 如何选

124. 刚刚!Claude Opus 4.6 来了

125. Claude 4.6 正式发布

126. Anthropic发布Claude Opus 4.6,长上下文检索、推理能力显著提升

127. Claude Code 上下文管理

128. Pattern | Claude都出4.5了,你还不懂200K到1M的上下文革命

129. Claude Opus 4.6 解锁 100万 Token 上下文!一次读完整本书的 AI 终于来了

130. Claude 3.5的“思维链”到底强在哪?我亲手试了,结果有点吓人

131. 2025 年全球主流 AI 大模型全景分析

132. Pattern | Claude都出4.5了,你还不懂它能做什么,不能做什么

133. 2026 最强 AI 编程助手对决

134. 围攻 Claude Opus 4.6

135. OpenCode与ClaudeCode的简单对比

136. AI模型横向比较

137. 2026年

138. 2026年主流大语言模型分析

139. 2026最新|主流大模型群雄逐鹿

140. State of AI: 从OpenRouter 100T token使用情况了解AI 大模型能力分层竞争逻辑

141. 豆包电脑来了?GPT-5.4发布,这个能力亮了

142. Gemini 3强得有点不太像阳间的东西!

143. 终于发布的Gemini 3,什么是它真正的王牌?

144. Claude Code官方课程:一份来自实战者的诚实评价

145. GPT-5全网首发测评!2万字超详细解析+国内免代理接入全攻略!

146. AI 大模型哪家强?一文给你说清楚

147. GPT-4 的实际体验如何?和之前相比有哪些明显提升?

148. 模型免费、推理翻倍:Gemini 3 Flash 深夜炸场,发放智能体时代的「入场券」

149. 都别争了,放着我来:Gemini 3生成一切

150. Docs

151. Claude简介

152. Gemini测评

153. CMU 最新研究:Gemini 综合不敌 ChatGPT,谷歌还需努力

154. Claude3对比GPT4有哪些优点?

155. GPT-5.2果然反超谷歌Gemini 3 Pro!北大数院校友核心贡献

156. GPT-5上线遭“滑铁卢” 用户怀念GPT-4o

157. Gemini 3负责人最新访谈:不做情感陪伴,只做最强生产力工具

158. Claude Code 使用指南

159. 建议收藏!Claude 注册使用保姆级教程:稳定不封号

160. GPT-5.4「原生操控电脑」实测封神!

161. GPT-5.4实测真相:一句"Hi"烧掉80美元?AI终于能自己接管电脑了

162. Gemini 3 Pro 实测,全方位超越 GPT 5.1 在这期视频里,我用真实场景、长时间上手体验,带你系统看看 Gemini 3 Pro 预览版 到底有多强。 不只是几张参数表,而是从 数学推理、多模态理解、OCR 识别、图片克隆、生成动画,一路测试到 反重力 AI IDE(Antigravity) 的实际开发体验。 视频中你会看到: - 在 ARC-AGI2 等基准上,Gemini 3 Pro 与 GPT 5.1 / Claude Sonnet 的真实差距 - Deep Think 模式在高难数学、抽象推理上的表现 - 从 Screenshot Pro、OmniDocBench 到视频理解,多模态基准与真实案例展示 - 让 Gemini 3 生成元素周期表、量子纠缠动画、梦幻楼梯、知识平台网站等创意应用 - 对比 GPT 5.1 / Claude,在 OCR、票据识别、条形码、反光文字、倾斜照片 上的细节表现 - 反重力 AI IDE(Antigravity)如何结合 Gemini 3 Pro + Claude computer use,完成从规划、实现到回放的完整开发流程 如果你也在纠结该用哪个模型、哪个 IDE 来提升自己的效率,希望这条视频能帮你用“真实体验”做个理性选择。 欢迎在评论区分享你用 Gemini / GPT / Claude 的感受,也欢迎留言你想看的下一期测试方向。🙏 时间戳 00:00 开场 & Gemini 3 Pro 发布与基准成绩概览 02:58 Deep Think、数学推理与多模态基准表现 07:19 量子纠缠、梦幻楼梯等创意动效 & 可视化演示 11:12 OCR、票据、反光文字与复杂图片识别实测 14:23 写作能力测试:字数控制、短故事与生活建议 15:41 Antigravity 上手体验 #Gemini3 #gemini3pro

163. OpenClaw绝配!GPT-5.4问世,AI能力开始大一统,就是太贵

164. GPT-5.4来了 但250万人正在卸载ChatGPT

165. Gemini3.0使用指南,国内镜像站入口集合(2025 年 12 月更新)

166. 实测精选 OpenAI 发布 GPT-5.4 具备计算机原生操作能力,在推理、编码与 Agent 三合一

167. 刚刚,OpenAI 发布 GPT-5.4,打工人有福了!

168. GPT-5.4发布:OpenAI首个大一统模型,简直是龙虾原生

169. 谷歌搜索重磅升级!Gemini 3驱动对话式AI概览,重构信息获取体验

170. Gemini 3有哪些创新功能?一文到底告诉你

171. 谁是最强编程大模型?横向对比GPT-5、Codex、Claude 4.5、Gemini

172. GPT-5.4发布:深度解析AI如何重塑2026年工作与生活,普通人如何应对?

173. 2025年最新的 Claude 国内使用指南(支持Claude 4、Claude 4.5)

174. GPT-5.4炸场:支持百万上下文,国内使用入口实测

175. Claude国内怎么稳定使用?最新Claude 4.5官网深度解析与Claude镜像站使用教程(完整版)

176. Gemini3是真的真神降临

177. GPT-5.4 震撼发布:能思考、会写码,还能直接替你操作鼠标键盘

178. GPT-5.4刚发布就把人类基线踩在脚底,Agent省一半Token

179. AI 时代各行各业都该知道的效率神器:Claude Code + Kimi K2.5,别人月付500 你只花22

180. 最近新出的Gemini3你会用吗,不会用的可以看看这份《Gemin3 pro从零基础到精通学习手册》!

181. Claude Code上下文管理指南:如何让AI记住更多、忘得更少

182. OpenAI 发布 GPT-5.4 模型,专业任务表现接近人类专家

183. GPT-5.2:2种免费使用方法|深度对比Gemini 3 OpenAI 刚刚发布了最新模型 GPT-5.2, 官方给它的定位是: 最适合真实应用场景、和专业工作的 AI 模型。 这期视频,我通过大量实测,从「真实使用体验」出发, 和 Gemini 3.0 做了多轮对比测试, 帮你判断在不同使用场景下,该怎么选。 视频内容包括👇 🚀 GPT-5.2 新特性与核心能力解析 🆓 两种免费使用 GPT-5.2 的方法(网页端 + IDE) ⚔️ GPT-5.2 vs Gemini 3 多项真实测试 💻 用两个模型分别生成完整前后端 + 数据库系统 🧠 为什么 AI 会“越修越乱”?上下文污染的真实案例 章节导航 ⏱ 00:00 内容介绍 00:37 GPT 5.2模型介绍 03:41 网页端免费使用 04:27 网页端对比测试-生成游戏 05:22 网页端对比测试-克隆网站 06:28 网页端对比测试-生成SVG 07:24 IDE免费使用 07:47 IDE对比测试-GPT 5.2 11:47 IDE对比测试- Gemini 3 14:59 对比总结 相关资源 🔗 GPT-5.2 网页端体验(lmarena): https://lmarena.ai Windsurf IDE(免费使用 GPT-5.2): https://codeium.com/windsurf 如果你也在纠结: 👉 要不要升级 GPT-5.2 👉 编程 / 工作场景该选哪个模型 希望这期视频,能给你一个足够清晰的参考。

184. 大模型API订阅套餐、API费用对比:OpenAI、Claude、Gemini、Kimi、MiniMax、DeepSeek、Qwen

185. 深度解析GPT-5.4 与 GPT-5.4 Pro,AI进入"全能特工"时代!

186. 【Claude】跨会话自动记忆能力|Claude - Auto-memory Feature|2026

187. Gemini 3编程实测:程序员迎来新机遇还是新挑战?

188. Claude Opus 4.6震撼发布!

189. OpenAI最强模型GPT-5.4发布,打工人可以下线了!

190. Gemini 3 提示词:通用最佳实践指南

191. Gemini 3 提示词最佳实践:日常使用指南

192. Gemini 3 要来了?5 大升级暗示 AI 编程新时代

193. OpenAI GPT-5.4实测

194. Gemini 3.0凭啥碾压GPT?四大竞争力说透AI新王者🚀

195. GPT-5.4上线,编程能力超过Claude Opus 4.6

196. 2025大模型真实应用报告:来自OpenRouter的100万亿词元数据 | 不 - 哔哩哔哩

197. Claude Code 近两月 17 个重要更新,这些你都用上了吗

198. Claude刚上线Skills,AI协作彻底变了

199. GPT-5.2正式发布!实测对比Gemini 3(附免费使用教程)

200. 【中配】GPT-5.4 真的很出色,不仅仅是代码改进 - Theo - t3․gg

201. gemini3用了一个月,以下是我的踩坑经验

202. Gemini 3.0深夜炸场,很强!当你装备上它时你能升多少级?

203. Claude中文版:2025年最新Claude 4.5国内使用指南

204. Gemini 中文版终极使用指南 (2025)

205. 把 Gemini 3 变成效率神器的 5 个野路子(附完整提示词)

206. Gemini 3 重磅发布!3大入口覆盖你的AI全场景(含:9个创意案例)

207. Gemini 3 Flash 来了,1 分钟带你快速了解

208. Gemini 3 图表提取指令:按分辨率优化

209. Claude发布 opus 4.6

210. Gemini 3.0写代码细到吓人

211. Gemini嵌入Google表格:实测电商数据处理效率提升300%,我看到了AI时代的真正护城河。

212. OpenAI最新王炸GPT-5.4:性能真神,还是营销封神?我拿100道题拷问GPT-5.4:新王登基,还是换壳升级?

213. 留给程序员的时间不多了,gemini3太强了

214. Claude Code终于有仪表盘了:3条命令装个HUD,上下文用了多少一眼就知道

215. Claude opus 4.5 vs Gemini 3.0 Pro 深度评测!

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章