Anthropic包揽AI盲测前三,国产Kimi-k3-max升至第12

源自178位全网作者

08-17 21:18

内容由AI生成

精选参考来源

1. 🚨再也不能在你的机器上运行大型 AI 模型了!kimi-k3-in-c 是一个纯 C99 引擎,仅 176 KB,它直接从磁盘传输 Kimi K3 的专家从不加载到内存中!- 无需 GPU- 无需 CUDA- 无需框架在仅配备 8.24 GB RAM 的 CPU 上运行一个拥有 2.78 万亿参数的模型 🤯100% 开源代码。AI 的未来刚刚到来……而且它能装进你的笔记本电脑。网页链接

2. Jia-Bin Huang(美国马里兰大学帕克分校计算机系教授)的一个Kimi K3的技术解析视频。#微博视频号续航计划# 在K3发布之前,AI 行业很多人认为把MoE模型做到超大规模、超稀疏(专家多到成百上千)会让训练崩溃,而 Kimi K3 却靠 2.8 万亿参数、单层 896 个专家的极端稀疏设计成功了——这个视频就是讲它到底用什么"防崩溃"的技术(潜在混合专家、RMS 归一化、有界激活、分位数均衡)把训练稳定下来的。 蚁工厂的微博视频

3. 【网络热门AI鉴定】全网刷屏的Kimi K3,真的那么强?

4. Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。IT之家注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。综合榜本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。国产模型在综合榜已有多款进入中上游,具体排名如下:阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。#杨幂百花奖座位第一排#

5. 硅谷大佬最新爆料:“Anthropic大客户集体撤离,被Kimi抢光。”Figma、11Labs、Lovable,大客户每年给OpenAI和Anthropic砸1亿美元,业务还可能被巨头抢走,无奈之下,他们选用Kimi建自研模型,成本会便宜90%,还能保证自身业务安全。

6. 从DeepSeek、Kimi到“黄仁勋联盟”:AI模型开源,到底“开”了什么?【硅谷101】

7. 2026年7月中文大模型基准测评结果发布!Qwen3.8、Kimi-K3并列第一,DeepSeek轻量版并列第二

8. #马斯克打了一场AI翻身仗# 现在这个结果比车的销量有用,大家猜猜会不会对特斯拉的股价有立竿见影的作用?下次马斯克见到奥特曼,要继续开嘲讽了。有意思的是,这里面混进一个小米?下次雷总是不是也需要和马斯克PK一下AI 大模型了斯克这场AI翻身仗,Grok 4.6 前天发布,智能指数 61,追平 OpenAI 的 GPT-5.6 Sol,只落后 Anthropic 两家,压过 Kimi K3 的 60。今年5月 Grok 4.3 还排第17,跟头部差一截,几个月就并驾齐驱,这爬坡离谱。马斯克现在眼睛里面只有AI 啊。#大v聊车##马斯克#

9. 我用TraeWork,把一天的工作量压缩到了一小时#TraeWork#TRAE#AI#职场#AI办公

10. DeepSeek官网把V4 Pro 0813的发布公告给撤了,疑似打算回滚,但API文档没变。V4 Pro 0813昨天深夜上线之后,从各路测试来看,表现比较一般,没太对得上之前期待的氛围值,大模型竞技场Artificial Analysis今天的开榜在全球第9,和GLM-5.2相当,比不上Kimi K3。目前DeepSeek官方一直没说话,全是用户在乱猜,有说部署出了问题的,有说推错模型了的,有说要配合Harness端上来的才是满血版,有说故意虚晃一枪的⋯⋯好笑的是,不少媒体应该是早就把稿子准备好了,今天上午发出来一顿梁圣乱吹,根本没了解模型实际表现,现在就很尴尬了哈哈哈。

11. WorkBuddy 是有部署Kimi-K3 模型的,今天才试了一下。夸张哦😯整理个简单的表格就花了我 460 积分。与此同时腾讯自家的混元 3 月底前免费,DeepSeek-V4-Flash也是只需要K3 的八十分之一但是 K3 的输出的表格确实是很漂亮

12. Workbuddy 对 GLM 和 DSV4F 的支持不错,但是 kimi k3 就一塌糊涂而且还贵。难道,腾讯认为 workbuddy vs kimiwork ,他们打不过?另外,Qwen 你在 workbuddy 里面压根见不到。所以,GLM 和 DeepSeek 可以在 workbuddy 里面用。Kimi K3 在 kimiwork 里面用。Qwen 在 codex 里面用。在 workbuddy 里面用 kimi 的。。。傻。。。

13. Arena盲评第32周:国产模型五大赛道全面入围 Arena第32周盲评榜单8月10日发布! 阿里qwen3.8-max新上榜就杀入综合榜第6名,ELO 1497分,与Anthropic头部模型仅差10分! 不只是综合榜——代码、前端、智能体、生图、视频,国产模型五大赛道全面入围: 💻 代码榜:kimi-k3-max第6、qwen3.8-max第8 🌐 前端榜:qwen3.8-max第4(ELO 1667) 🤖 智能体:KimiK3第5,净提升10.08% 🎨 生图榜:阿里第7、字节第8 🎬 视频榜:MiniMax首次入榜即第4,黑马! 国产大模型,正从追赶者变成竞争者。 你觉得什么时候能登顶全球第一?评论区聊聊👇 #大模型 #人工智能 #阿里 #国产AI #Arena榜单

14. 千问3.8 Max首发进入全球AI大模型智能榜单第五 第33周全球AI智能指数更新,Claude系列与GPT稳居前三。Kimi K3第四,继续领跑国产;千问3.8 Max第五,国产头部模型竞争力持续提升。#AI #人工智能 #大模型 #千问 #Kimi Artificial Analysis Intelligence Index(智能指数)是一个综合性的AI基准测试指标,旨在全面衡量大语言模型在推理、知识、数学和编程等领域的综合能力。 该榜单的核心机制与特点如下。多维度综合评估:最新版本汇总了9项高难度评估基准。其最终得分通过加权平均计算,权重分布为:智能体任务(34%)、编程(24%)、科学推理(24%)及通用任务(18%)。侧重真实智能体工作流、标准化严苛计分、效能与成本追踪等多个维度。

15. 2026年7月中文大模型基准测评结果发布!Qwen3.8、Kimi-K3并列第一,DeepSeek轻量版并列第二

16. Kimi K3拿下AI编程Agent综合第一:国产模型终于不谈性价比了

17. 登顶 HF 趋势榜!详解 Kimi K3 凭什么比肩全球第一梯队模型

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章