Inkling-Small开源:四分之一规模推理反超原版

源自56位全网作者

11:29

内容由AI生成

精选参考来源

1. Kimi K3 正式开源!全球最强开源模型,免费下载!性能直逼 Claude、GPT 5.6 旗舰模型 | 零度解说

2. 月之暗面的K3居然真开源了,权重、技术报告、Github仓库都放出来了,包括高性能Attention Kerne、MoE通信库,还有大规模运行Agent环境的基础设施也一起开了。真大方啊 #月之暗面开源kimik3##ai创造营##微博兴趣创作计划#

3. 「Github一周热点124期」Kimi K3、AI网关、开源部署平台、反AI味设计Skill和人与Agent 协作工作台

4. 当「变大」不再是唯一的路,又一国产模型开源了

5. #月之暗面正式开源KimiK3# 别人开源顶多发个权重让你自己跑,月之暗面这回把后厨连锅带灶一起端出来了——K3 的权重能免费下,连支撑它训练的通信库、注意力算子、Agent 沙箱三个底层 Infra 也一块开源了。K3 是个 2.8 万亿参数的 MoE,激活 1040 亿,带原生视觉、100 万 token 上下文,规模是上代 K2.5 的三倍,也是目前全球最大的开源模型。月之暗面说自己在算力并不宽裕的条件下,靠 KDA 混合注意力、注意力残差加自研通信库 MoonEP,把规模化效率干到了 2.5 倍。三项 Infra 里,FlashKDA 是个高性能注意力算子,在英伟达 H20 上 prefill 速度比基线快 1.72 到 2.22 倍;MoonEP 管专家并行的通信、AgentEnv 是和 KVCache.ai 合搞的 Agent 沙箱,后两个都是这次头回开源。说白了,开源权重现在谁都干,真敢把训练系统的底——通信怎么扛不均衡、算子怎么榨 H20、沙箱怎么快照分叉——全亮出来,是另一码事。这等于把行业训练门槛往下砸了一截。Hugging Face 上它半小时登顶趋势榜,上线前三千多开发者蹲守下载,反应很实。不过也别捧过头:官方自己都认,综合性能还够不着 Fable 5、GPT-5.6 那批闭源塔尖,开源不等于登顶。

6. Eval丨 14天450人500辆Agent坦克大混战:我们完成了一场大规模 Agent 众测

7. #DeepSeekV4Flash正式版上线#DeepSeek V4-Flash正式版API开启公测,对比之前预览版提升幅度相当亮眼。模型本体规模没有改动,核心依靠后训练优化完成能力升级,最核心的突破集中在Agent智能体能力。 从公开基准测试数据能直观看到,在工具调用、代码工程、终端任务多项榜单里,新版V4-Flash大幅甩开旧预览版本,不少指标甚至超越V4-Pro预览版。同时原生适配Responses API,针对Codex做了兼容,对开发者相当友好。 有意思的一点,没有更换模型结构,只靠后期调优就能实现性能跃升。这也说明大模型行业不再单纯比拼参数量,精细化训练、对齐优化的价值越来越重要。 当然也要客观看待,部分复杂推理任务距离顶级旗舰依旧存在差距。但这款高速模型定位很清晰:兼顾响应速度与智能体执行能力,适合大批量自动化Agent任务落地。 接下来低成本、高性能的Agent模型会越来越多,普通开发者搭建自动化AI应用门槛也会持续降低。大家看好这类轻量化智能体模型的落地前景吗?

8. DeepSeek-V4预览版、智谱GLM-5.2、Kimi K3把美国的AI联盟炸的四分五裂的! DeepSeek-V4预览版展示了开源大模型的性能,智谱GLM-5.2实现了100万Token超长上下文,Kimi K3的2.8万亿参数拉平了技术代差。这三家玩的就是精准制导,直接摧毁了闭源大模型的拿来叙事的核心点。同等性能下同等的任务量,中国模型的API调用成本仅为美国闭源模型的几十分之一,更是让闭源大模型难以招架,OpenAI等企业举起的镰刀没有了刀刃。投入增加收入反而出现停滞。#AI创造营##科技股大跌原因##科技先锋官#

9. 少即是多,这次轮到大模型来证明

10. #DeepSeekV4能力在GLM5.2和KimiK3之间#根据现有评测,DeepSeek-V4、GLM-5.2与Kimi-K3虽同属国产开源第一梯队,但定位各异:· Kimi K3:综合能力最强,以2.8T参数登顶多项Agent和编程榜单,但API定价也最贵。· GLM-5.2:结构化推理与工具调用扎实,且吞吐量极高,兼顾性能与成本。· DeepSeek-V4:极致性价比之选。Flash版仅激活130亿参数,Agent能力已超越GLM-5.2,逼近顶级闭源模型,且价格极具竞争力。整体来看,国产模型已形成差异化竞争,DeepSeek凭后训练优化以轻量参数实现高性能,性价比优势显著。

11. 【月之暗面如约发布Kimi K3的模型权重和技术报告】『Kimi K3是我们最有能力的模型:具有原生视觉理解和1M令牌上下文窗口的2.8T MoE模型。新模型架构:每单位计算的智能度是2.5倍,而不仅仅拥有更多的参数。与Kimi K3一起,我们正在打开它背后的更多堆栈——高性能注意力内核、MoE通信库和大规模运行代理环境的基础设施』

12. 不er?谁家大模型12B版本跑分比975B的高啊

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章