7月是近一年大模型行业旗舰发布最密的一个月:从月初腾讯混元Hy3正式版,到月末Anthropic的Claude Opus 5,中间夹着Kimi K3、Qwen3.8-Max预览版、Grok 4.5等,粗数下来9款旗舰,相当于每3.3天就来一款。36氪很多人追这类新闻的第一反应是“跟不过来了”,但把这一轮发布拆开看,结论可能正好相反:更新越快,你越不需要追。

为什么“最强模型”不再值得追
先说一个反直觉的事实:“谁最聪明”已经是个没有答案的问题。8月初LMArena文本榜上,榜首到第十名的Elo差距不到30分,而官方口径是25分以内的差距属于噪声,谁坐第一基本取决于当周的投票样本。知乎对选模型的人来说,真正该问的是场景、上下文、价格和生态,而不是那10分的排名差。
“最强”这个位置的保质期也在崩塌。过去头把交椅能坐三到六个月,现在可能三周就被顶下去,围绕“最强”做的发布会、白皮书、KOL投放,ROI都在崩。知乎所以各家索性不追单一维度的绝对领先,改在不同任务上找优势位:OpenAI绑定程序员,Anthropic押大型项目的工程复杂度,Grok 4.5守速度和低成本,三家的打法已经完全分叉。
开源则追到了“半步”距离。Kimi K3、DeepSeek V4 Pro、Qwen 3.7 Max距离闭源头部只有30–60 Elo,开源与闭源的差距从“代差”缩小到“半步”。知乎当第一名和第五名的体感差别不到5%的时候,用户选的就不再是“最强”,而是“适合我且更便宜的那个”。知乎
把问题换成“你拿它干什么”
写代码的人是这轮收敛里受益最大、也最容易被“登顶”新闻带偏的群体。在LMArena人类偏好的前端编码榜上,Kimi K3以约1679 Elo登顶第一,超过Claude Fable 5与GPT-5.6 Sol,发布当天就登上Code Arena前端编程榜第一。知乎36氪如果你的场景是agent长循环、多文件改动、前端整页生成,K3是当前性价比极高的选项。
但单项登顶不等于全面领先。在Artificial Analysis综合智能指数上,Kimi K3得57分,与闭源头部仍有2–4分差距,一次性深读大代码库这类任务,闭源头部更稳。知乎编码agent这边,刚在OpenRouter周调用量登顶的DeepSeek-V4-Flash,官方基准里在Terminal Bench 2.1、DeepSWE等任务上全面压过GLM-5.2等开源同侪,与闭源头部的差距收窄到几分,而该平台调用量前五已全是国产模型。知乎

参数规模竞赛也让“开源等于差一档”的旧印象过时了:Kimi K3以2.8万亿参数开放权重,以约3/15的公开价格跑出与GPT-5.6 Sol几乎持平的Terminal-Bench分数,DeepSeek的开放前沿参数也到了1.6T。知乎中国开源模型累计下载量突破100亿次,全球占比41%,开源正在编码板块复制“先拉平能力门槛、再抢占有率”的剧本。知乎

至于日常聊天、写文档、通用问答,头部模型之间的体感差比你想象的小,优先看免费额度、生态接入和稳定性,别盯着那十几分Elo差——那正是噪声区。
多模态才是下半年的真变数
文本榜在收敛,多模态还在猛打。只统计2026年8月第一周,就有至少七款重量级多模态发布,密度不输7月的模型大战。知乎
其中MiniMax H3不是一个视频模型加一个音频模型的拼装,而是统一的全模态生成系统,文本、图像、视频、音频一套权重出,视频能到2K还带原生立体声,上架即拿下Artificial Analysis视频编辑榜第一。知乎字节SeedRealtime则把音视频全双工往前推:模型能边听边说、看着画面实时回应,人机交互正从“打字-回车”推向“说话-看着-回应”。

这波变化对普通人的含义很直接:只聊文本的,不用动;但你的工作若涉及视频、图像、语音,下半年的工具换代窗口已经打开——这是实打实的能力变化,比文本榜上几分波动更值得行动。
普通人记住这几条,比追新发布有用
别急着锁年费会员。“无限调用”时代正在过去,高阶套餐普遍仍有额度上限和“合理使用”条款,按月付或先薅免费额度更稳。
用“一主一备”:主力覆盖80%日常场景,备用补编码、视频这类专长;换模型时只迁移核心场景,别全家桶搬家。
看到新发布别急着换。只有当你“核心场景的主导模型”被换掉时才评估切换,榜单上的头部轮换大多是噪声。
有API或批量调用需求的,先算账再选档:同档性能差距20分以内、价格差可达12倍,选对档位能省一个数量级的成本。知乎
下半年值得继续观察的三个信号
一是“旗舰发布”会不会贬值成常规更新。年底之前可能有厂商主动放弃旗舰叙事,改成滚动更新加版本号迭代,发布会这种形式本身会越来越少见。知乎
二是竞争重心是否真的从榜单转向单位任务成本。以后大家比的不是谁答得好,而是完成同一个任务谁花的钱少,这对擅长性价比的国产模型是顺风。知乎
三是开源与闭源的边界会模糊到什么程度。Qwen-Max级模型首次开放权重开了口子,综合维度2–4分的差距按当前速度有望在6–12个月内抹平,届时“闭源一定更强”的假设大概率失效。
月抛时代,被抛掉的应该是厂商的发布会和榜单焦虑,该留下的是你自己的使用节奏。模型越来越像、越来越便宜的时候,对真正在用的人来说,这是近两年来最友好的时刻。