中美大模型差距收窄至2.7%,国产追分容易追效果难

源自517位全网作者

19:35

内容由AI生成

精选参考来源

1. 盘点一周AI大事(8月30日)|OpenAI年底实现AGI 智谱正式开源「GLM-5.3-Flash」 OpenAI完成下一代模型「Bel」预训练,参数规模10T 奥特曼透露OpenAI内部AGI最快年底达成 Anthropic发布硬件通用协议「MHS」 Qwen开源下一代架构Flash模型「Qwen3.8-Flash-Next」 鹅厂开源下一代混元模型「Hy4 Preview」 Google发布SOTA语音识别模型「Gemini 3.5 Transcribe」 Google升级「Gemini Omni 1.1 Flash」 Yutori推出SOTA电脑操作模型「Navigator n2」 Skild重磅发布机器人大脑模型「S1」 #抖音前沿科技首发计划 #vibecoding大赏 #AI新星计划 #AI #AIGC

2. 美国估计要大失所望了,根据斯坦福大学最新研究,中美顶尖大模型差距已经收窄至2.7%,而且双方头部模型已多次互换领先位置。 看到中国大模型这种表现,估计美国人始终想不通,过去两年他们一直想方设法禁止向中国出口最顶尖的AI芯片,试图以此来构造他们在AIi领域的护城河,从而拉开跟中国的差距,但让他们万万

3. 全球首个通用决策大模型,AI推演现实世界的技术揭秘

4. GPT 6深夜炸场,两大核心测试接近满分,操作电脑自主干活

5. GPT-6 真的要来了,奥特曼:后果不敢想

6. #中美AI大模型对比#当前中美大模型竞争已从美国明显领先演变为性能接近、路径分化的格局。斯坦福《2026 AI指数报告》显示,中美最强模型性能差距已收窄至约2.7%,双方头部模型多次互换领先位置。美国仍在绝对前沿、算力、资本和生态上占优;中国则在开源、性价比、工程效率和工业落地方面形成强势。在场景应用上,美国更强于软件、医疗、科研、安全等高端应用;中国在制造、机器人、自动驾驶、工业自动化等物理世界场景布局更深、企业数量更多。算力与芯片方面,美国仍大幅领先,尖端训练算力占比高、高端GPU供应链优势。中国受出口管制影响,更多依赖算法与架构效率、电力优势和国产芯片补充。中国新增电力装机远超美国,利于大规模推理部署。总之,性能上美国微弱领先前沿闭源,但差距已很小;开源领域中国全面领先。当下两国的竞争焦点已从谁的模型最强转向谁的成本更低、落地更快、生态更广。中国模型在高性价比和开源渗透上已实质性冲击全球市场。未来,美国依托算力与资本可能继续在自我改进闭环和绝对前沿上领先;中国依托工程效率、开源生态和实体产业优势,在规模化应用和成本端更具优势。双方已进入能力趋同、体系分化阶段。

7. 刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位

8. #AGI时代真的来了吗#AGI是指具备与人类相当的通用认知能力的人工智能系统。AGI时代指的是人工通用智能真正实现并开始广泛影响社会的时期。AGI可能还没有一个公认的出生证明,但AGI时代的很多经济和技术特征,已经开始出现了。OpenAI发布了GPT-6 Astra,并公开把它描述为可能意味着AGI时代的开始。Astra重点强化了自主使用电脑、软件操作、编程、数学、科研和复杂职业任务等能力,令全网沸腾。过去的问题是:AI什么时候能达到人类水平?现在的问题开始变成:它到底是不是已经达到,只是我们还没有统一承认?

9. 世界模型没那么热了,我们却看到了最好的一个

10. Astra接管OpenAI!创立第三代智能体文明的新模型有多猛?

11. OpenAI 最近发布的 GPT‑6 Astra,最大亮点是可以直接操控电脑,自主完成多步骤复杂任务,各项自家基准跑分几乎拉满。训练动用了十万块以上 GPU,网安漏洞挖掘能力也很强。#GPT6正式发布# 不过 API 价格直接涨到上代的 2.5 倍,开放也是分批灰度,先给机构再给到付费用户。总裁直接喊出进入 AGI 时代,但他自己也说这只是个人判断。#OpenAI称AGI时代到来# 外界争议挺大,第三方测试分数缩水不少,学界觉得还没达到真正通用人工智能,不少人认为这个 AGI 说法有商业宣传成分。能力确实进步很猛,但距离真正不受限制的通用AI,感觉还有不小距离。#AGI时代真的来了吗#

12. #中美AI大模型差距缩至2.7%# 斯坦福最新AI指数报告出炉,一组数据让人意外——中美顶尖大模型性能差距已缩小到仅2.7%,两国模型多次交替登顶榜单。几个值得关注的趋势:· 美国主攻通用AGI,Claude/GPT/Gemini在复杂推理、多模态上仍保持领先· 中国走「低成本+产业落地」路线,DeepSeek、Qwen、Kimi等中文场景和性价比全面反超· 2026年8月更出现戏剧性一幕:OpenAI旗舰模型降价33%,DeepSeek却涨价1100%,定价曲线历史性交叉一个有趣的反差:美国AI私人投资2859亿美元,是中国124亿的23倍,但差距反而在缩小。中国靠工程优化和场景落地,把「可用」做成了「好用、便宜、规模化」。你觉得这场竞赛的下半场,决胜点会在哪?是算力突破、行业落地,还是生态话语权? #微博AI创作季#

13. 【网络热门AI鉴定】GPT-6 Astra 超详解析!AGI时代真的来了吗?史上最强模型到底如何?

14. GPT-6 砍掉思考 Token,俄罗斯人砍掉通信 Token,Token 经济开始崩了?

15. 刚才看了看国产大模型公司智谱的财报,顺便聊一聊。作为行业头牌,它上半年收入同比增长接近 400%。有人嫌总数不够高,我倒觉得正常,国产模型大规模商用也就最近几个月,高增长还在后面。智谱说,8 月单月收入约 1.33 亿美元,合人民币九亿多,年化下来 ARR 有 16 亿美元。信息量很大,挑几个重点说。先说模型。GLM-5.3 的提升全来自后续训练:训练任务从普通写代码,换成接近专家真实工作的完整任务,底座没动,任务完成率就提高五成以上。智谱认为,模型上限由基座规模、有效深度、训练深度、任务环境四要素决定,哪个环节空间大就先做哪个。所以 5.1、5.2、5.3 都长在同一个大基座上,先把底座榨透,收益见顶再换更大的。下一步他们打算同时做大总参数、控制推理时真正激活的参数量、提高有效计算深度。定价会出现两条曲线。一边,同智商水平的模型持续降价,GLM-5.3 Flash 就用更低成本提供接近甚至超过上一代旗舰的能力;另一边,能打开新任务边界的前沿模型依然有溢价。所以 5.3 冲智能上限,做复杂编程、Agent 和高价值任务;Flash 走性价比,扛高频大规模调用。还有个指标叫算力乘数,指每投一块钱算力能换回多少 API 收入,上半年同比涨了 14 倍。国产芯片也用起来了,GLM-5.3 Flash 背后是国产芯片集群,六天跑了六十多万亿 Token;重做推理引擎和底层优化后,同样的硬件端到端性能提升三倍,单位 Token 推理成本比年初降八成。智谱也直说算力受约束,只能靠数据、训练和工程效率补,出口管制反而逼出了国内极强的工程效率文化。模型会不会沦为商品?单次跑分第一维持不了长期定价权,基础任务上各家已没差距。真正拉开差距的是迭代速度、真实任务完成率、单位智能成本,还有能不能进入客户的工作流。任务越长差距越明显,答一道题可能只差几分,但连续跑几小时的软件工程任务,要调工具、处理失败、重新规划,能不能干完就高下立判。模型进了客户的代码库,换模型就不只是换 API 地址,迁移成本会越来越高。所以简单能力越来越商品化,能进真实工作流的前沿模型依然有定价权。智谱还想让模型参与训练下一代模型,比如用 Model vs Model 自动生成筛选数据,让 Agent 收集任务、搭环境、生成验证器,甚至优化推理系统。唐杰管这叫 Fully Self-training,也就是 OpenAI 说的 RSI。跑通以后,数据生产、环境搭建这些活都可能交给模型自己。#科技先锋官##How I AI#

16. 刚刚,Claude 5.1 发布!全球最强模型来了

17. OpenAI 也搞 A\ 那一套GPT-6 Astra 今晚发布,然而之后 Daybreak 项目成员可以拿到访问权,Plus 和 Pro 用户要等「未来几天」 。价格也涨了。今年上半年 GPT-5.4 还是 $2.50 和 $15,Sol 涨到 $5 和 $30,Astra 又涨价到了 $10 和 $50…OpenAI 的说法当然是按 token 计价没有意义,要看完成任务的成本,因为 DeepSWE 完成任务成本降了 57%, 也就是说Astra 完成同样任务只用约四分之一的 token 而已。扯这么半天,不让用就是没意义,非要提前几天发布阻击 Fable 5.1 干啥呢

18. 盛大创始人再出手,上海本土AI公司StartLux打赢万亿大模型

19. #AGI时代真的来了吗#北京时间9月4号凌晨,OpenAI发布了GPT-6 Astra,直接喊出“欢迎来到AGI时代”。通用人工智能(AGI),指具备跨领域学习、推理与决策能力,在任何认知任务上达到或超越人类水平的人工智能系统。官方将GPT-6 Astra定义为代际跃迁,不再局限简单问答,重点强化自主操作电脑,完成复杂长链条任务的能力,同时模型新增网络安全相关能力,设置严格访问限制。Astra在ARC-AGI-3测试里拿了99.9分,上一代才7.8分,网络安全测试ExploitBench更是直接满分,能自己发现软件漏洞。你看着屏幕能干啥,Astra就能干啥,填表格、做PPT、搞电路板设计都行,你认为AGI时刻到来了吗?

20. 大模型的逐字生成模式,正在拖慢你的Agent,有人跑出了5倍提速

21. GLM 6 这么牛的吗?都能自训练了---智谱创始人唐杰:GLM-6.0定位全自训练技术路线8月31日晚间,智谱召开2026年半年度业绩发布会。智谱创始人唐杰在会上解读了智谱下一代GLM-6.0大模型的技术定位与研发方向。他将GLM-6.0定义为Full Self-Training(完全自训练,海外相关概念也称RSI),核心特征是模型具备自净化能力,可覆盖从预训练、中期训练到后训练的全流程,实现完全自主训练与自我进化。唐杰指出,全自训练范式的最大挑战并非单纯扩大模型规模,而是模型能否实现自我判断——自主把控训练停止时机、自主完成错误修正。这是该技术路线的核心难题,也将是未来模型研发的重点方向。唐杰进一步表示,在后续模型研究中还将把伦理、社会治理维度纳入考量,作为下一步技术演进的重要考量。

22. 转:国内头部模型目前在通用能力上与头部模型GPT和Fable差距不大,但在专业任务领域能力上与头部模型的差距正在日趋拉大。图2:GPT-6 Astra用一个15秒的视频,演示了在KiCad环境中进行印刷电路板布局的过程。#ai#

23. 近期系列动态的6个信号:1.硬核算力-RSI通道-快速实验-模A一体,四大引擎加速以模型为基础的智能迭代,头部AI集体大步狂奔而不是小步快跑,史诗级的算力投入不是泡沫,是有效供给不足的短缺刚需;2.工程级深度智能差距扩大,常规智能彼此差距缩小,依托用户-流量-场景-应用等,Google、Meta、SpaceX AI等后进者想再度完全拉齐不太可能但切分部分市场依然有基础,全栈AI-全场景AI-全生态AI有联系有区分;3.一线前沿模型的财务模型可能被二线改变,常规任务、中低端市场被中低价模型、免费服务掏走一部分,开放权重、MaaS、SaaS等一起重塑生态,但模A一体、工作台等短期的生态重塑力度和生态意义更大,Agent C、Agent B都是亿万用户万亿市场级别的,Agent A是不是终局不好说;4.参数-训练-算力-(持续)学习-Loop-现实,至少6重视角的Scaling正在发生,不同于此前Scaling Law概念,其中looped transformer和OpenAI最近披露的Astra的recurrent depth方向差不多,场景-应用-用户的规模和复杂度,其实也是AI在Scaling中实现能力增长的一部分;如何在不被吸干的同时还能持续塑造自身价值是企业级用户正在破解的难题,token资产不是核心资产,爬山机爬不到山上,Nadella看到了问题但没提供有效答案;5.美国2+3+N格局,中国4+6+N格局,都还在智能水准增长甚至能力跳变通道上,比如GPT 5.6与Fable 5.1虽然前后脚但有不是同代产品即视感。Mythos、Astra(以及号称未来有望实现Full RSI的GLM-6)都是不同程度接近智能水准与智能安全的临界点的一部分,但算力差距-RSI能力差异与闭环速度,决定谁先进入AGI-ASI以及内生与自主智能通道,能源只是个性价比费效比变量不是智能水准的核心变量,AGI-ASI这两个词已经让人起腻,但事情恰恰是在对AI 已经逆反了的时候发生;6.一旦越过山丘,的确不只是个AI能力水准与应用问题,而是资源属性、各类资本(包括人力资本)、竞争力、比较优势、产业分布、财富分配、增长模型、经济形态都会跟着变,而跨越点已经很近很近,4重harness正在发生但后三者一个比一个慢(参见此前分析)。

24. 国产AI芯片与大模型,2027-2028年能并肩吗?

25. OpenAI宣布实现AGI,再次领先世界?AGI(通用人工智 OpenAI宣布实现AGI,再次领先世界?AGI(通用人工智能)是一场竞赛,Anthropic本来是跑在了前面,但现在OpenAI联合创始人兼CEO萨姆·奥尔特曼宣布实现了反超。他表示OpenAI刚推出的GPT-6 Astra模型是目前最佳、最智能的模型。按照OpenAI提出的AGI五级发展标准,GPT-6 Astra模型已经跨越了聊天机器人的第一级别,以及第二级推理者,进入了智能体级别。大概是这个世界对AGI的猝然到来准备不足,9.3深夜突发,美国AI大宕机:ChatGPT、Claude、Grok服务出现异常,谷歌Gemini、微软Copilot收到大量中断报告,持续了三个多小时。不过领先是暂时的,Claude、Grok等都在快马加鞭,你追我赶,而且中国的人工智能大模型也在加速发展,有后来居上的势头。OpenAI说自己实现了A

26. 别盲目吹或踩,中美大模型差距要看场景

27. 美媒:中国以具身智能角逐通用人工智能竞赛

28. GPT-6 Astra发布,大模型下一步拼什么?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章