当前位置:
AIGC文章详情

Kimi K2.5下月底退役,7个月万亿参数模型让位2.8万亿K3

源自59位全网作者

08-24 19:52

内容由AI生成

精选参考来源

1. #it那些事儿# ①K3确实在编程等重要领域达到了与Claude Fable 5同一梯队的水平,得分互有胜负;②K3每任务成本比Fable 5便宜约70%,API定价仅为后者的三分之一;③虽然美国在基础创新上仍领先,但中国的科研产出、工业机器人部署均领先全球,且中美顶尖模型性能分差已缩小至2.7%。Anthropic高管认为中国落后6-12个月,而学界认为差距仅2-3个月,都印证了中国正在快速逼近。现在缺的不是模型能力,缺的是高端算力卡。//@月之暗面Kimi:「逝者如斯夫,不舍昼夜」

2. 这张图表来自国际AI评测机构 Artificial Analysis,展示的是其“AA智能指数”对全球主流大语言模型的综合能力排名。图中红框标注的两款模型——Kimi K3 (max) 与 GLM-5.3 (max),均获得60分,并列开源模型第一,同时跻身全球前沿模型能力区间,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰模型处于同一水平。

3. Vercel它是一个类似于网站部署的公司,会给很多小型网站提供免费的部署方案。我也有好几个网站部署在上面,非常好用。他们其实也很多地用到大模型。根据他们最近披露的一个数据,其大模型的使用从以前闭源模型占主导,到现在开源模型占主导,这个改变的进程其实非常短。因为随着技术进步的速度放缓,闭源模型的最强者已经不再是遥遥领先,而只是在某些部分领先。比如说 Anthropic 的 Claude Fable 5 这个模型,在前三四个月可能还是断崖式领先;但最近一两个月中国模型相继发布,比如智谱的 GLM 5.3、Kimi K3 模型,以及 DeepSeek 的 V4 Pro 等,都会或多或少挑战到 Fable 的绝对领先地位。同时,开源模型最大的优势就是便宜,意味着只要有自己的设备,就可以自己去部署运行。这也是为什么 Hugging Face 提到,公司使用的开源模型比例已经从之前的 28.4% 涨到现在的 62%,而闭源模型则从之前的 76% 相当于减半到现在的 38%。我觉得这可以说是攻守之势异也。

4. 智谱的GLM-5.3终于也在AA竞技场开分,暑期档的这一轮国产模型上新基本上算是告一段落了,目前的成绩如下:Kimi K3和GLM-5.3并列60分,是中国唯二能过挤进T1阵营里的模型,咬住了GPT-5.6和Claude Opus 5,当然Kimi K3是已经发布超过1个月了,含金量更高。T2档位排下来依次是58分的Qwen3.8 Max、53分的DeepSeek-V4-Pro、52分的Qwen3.8 27B,也是兼顾性能与经济性的高竞争区间,凡尔登绞肉机的市场。T3则属于上桌吃饭的底线,有45分的MiniMax-M3、43分的小米MiMo-V2.5-Pro、42分的腾讯Hy3,主打一个量大管饱的供应,够用就行,要啥自行车呢。再往下数,T4就很深海了,蚂蚁Ling 3.0 Flash是38分,美团LongCat 2.0是34分,阶跃Step 3.7 Flash是31分,已经不太适用通用场景了,只能卖给垂直领域。什么,你问22分的百度文心模型是不是位于马里亚纳海沟?好吧,我稍微说句公道话,自从文心5.0拉了这坨大的之后,百度就没有再把新发布的文心5.1上传AA竞技场了,所以22分虽然不是百度的真实表现,但一个小版本的迭代估摸着也好不到哪里去。对了,字节也没有在AA竞技场上传Seed参展,就憋大的吧。

5. 英伟达计划向人工智能初创公司 Poolside投资 60 亿美元,以打造世界上最强大的开源 AI 模型之一,与 DeepSeek 和 Kimi K3 等中国巨头展开竞争。Poolside 由软件开发人员 Eiso Kant 和 GitHub 前首席技术官 Jason Warner 于 2023 年创立。美国人工智能行业将更多资源投入到专有或“封闭”的人工智能模型中。这些模型不与开发者共享源代码或数值权重。其中包括像 Anthropic 和 OpenAI 这样家喻户晓的初创公司,以及像 Alphabet 旗下谷歌这样的老牌科技公司的研究部门。而中国的大模型行业普遍采取了开源模式,受到了世界上更多国家/地区和企业的欢迎。

6. 【美媒:#英伟达计划打造中国AI模型竞品#】据知情人士透露,英伟达已同意支付60亿美元,获得人工智能初创公司Poolside的AI模型授权,英伟达计划利用这项协议,开发人工智能模型,以挑战DeepSeek、Kimi K3等中国头部AI模型。 8月22日,据《华尔街日报》报道,超过100名Poolside员工将加入英伟达,参与这家科技巨头的开放权重模型研发项目,该项目被称为 Nemotron。Poolside的工程师将负责改进Nemotron项目目前正在开发中的最大规模模型。 此次交易凸显中美AI竞赛的激烈程度。西方媒体指出,尽管美国对华实施先进AI芯片出口管制,中国AI模型性能正迅速追赶美国产品,研发成本却显著更低。中国初创公司月之暗面推出的Kimi K3,其性能已逼近美国Anthropic旗舰模型,开发投入远低于后者。 英伟达此次巨额投资被视为对美国AI技术护城河的加固,以及对崛起中中国AI力量的直接回应。目前双方尚未就交易细节发布正式公告。 RT今日俄罗斯的微博视频

7. Arena(arena.ai)平台发布 2026 年第 33 周(8 月 10 日 ~8 月 16 日)AI 大模型盲测排名,本期最大看点是 Anthropic 多款 claude-opus-4 系列模型密集入榜并占据综合榜前五位,国产模型 kimi-k3-max 排名上升 2 位至综合榜第 12 位,在前端开发榜也保持第 2 位,qwen3.8-max 首次跻身智能体榜 Top 10。国产模型整体仍处于中上游位置,在前端开发等细分领域已经形成对头部海外模型的紧追态势。IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。综合榜本期综合榜头部几乎被 Anthropic 新模型包揽,claude-fable-5 以 1506 分蝉联榜首,新入榜的 claude-opus-4-6-high 以 1505 分紧随其后位列第二,同样新入榜的 claude-opus-4-7-high 以 1502 分排名第三。前三名分数差距均在 5 分以内,属于误差范围内的并列。谷歌 gemini-3.7-flash-high 作为新模型首次入榜即拿到第 9 名,表现亮眼。国产模型方面,kimi-k3-max 上升 2 位至第 12 名,是排名最高的国产模型。国产模型整体处于榜单中上游,具体排名如下:月之暗面 kimi-k3-max 位列第 12 名,ELO 1489 分,较上周上升 2 位;阿里 qwen3.8-max 位列第 8 名,ELO 1491 分,较上周下降 2 位;阿里 qwen3.7-max-preview 位列第 26 名,ELO 1474 分,较上周下降 3 位。#桃黑黑回应控诉#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章