AI不再是你延伸的手指,而是真正替你扛活的同事
源自647位全网作者
08-20 11:50
精选参考来源
1
AI智能体的24小时革命:当聊天机器人开始自主工作
2
Kimi K2.6开源了! Kimi K2.6开源了,能自己跑13小时
Kimi K2.6 刚开源,主打三件事:编程、长任务执行、agent swarm。
MoE 架构,总参 1T / 激活 32B,256K 上下文,384 个专家每 token 选 8 个,注意力用 MLA。
📌核心特性
· 长周期编程:泛化到 Rust、Go、Python 及前端、DevOps、性能优化
· 编程驱动设计:提示或视觉输入直出可投产界面与轻量全栈
· Agent Swarm:300 子 agent 并行 4000 步,一次跑完文档、网站、表格,官方 RL infra 团队还用 K2.6 agent 自主跑了 5 天,做监控、告警和事件处理。
· 主动式编排:24/7 后台 agent,自主调度、执行、跨平台协作
🌟关键 benchmark
· Kimi Code Bench: 57.4 → 68.2
· SWE-Bench Pro: 58.6,超过 GPT-5.4、Claude Opus 4.6、Gemini 3.1 Pro
· HLE-Full w/ tools: 54.0,同样第一
· Terminal-Bench 2.0: 66.7
官方提供的两个有趣的实测案例
1️⃣Mac 本地跑 Qwen3.5-0.8B
K2.6 用 Zig从头实现推理优化,跑了 4000+ 工具调用、12 小时连续执行、14 轮迭代,把吞吐从 ~15 tokens/s 干到 ~193 tokens/s,比 LM Studio 还快 20%。
2️⃣重构 8 年的 exchange-core
一个老牌开源金融撮合引擎,K2.6 自主执行 13 小时,试了 12 种优化策略,1000+ 工具调用,改动 4000+ 行代码。中位吞吐 +185%,性能吞吐 +133%。靠的是自己分析 CPU 和内存火焰图,重构了核心线程拓扑。
除了单点分数,K2.6还做到了“长时程不崩”。跑久了上下文飘、工具调用乱套一直是 agent 落地最难受的问题,这两个案例一个 12 小时、一个 13 小时,一个 5 天,说明它在连续任务下的稳定性已经能撑得起真实工程场景了。
🔗模型链接:modelscope.cn/models/moonshotai/Kimi-K2.6
#月之暗面 #ai模型 #魔搭社区 #开源社区 #ai
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹