10 月 10 日凌晨,B 站 UP 主「无机酸-_-」用社区双盲测试题库重新测了一遍 Kimi K3,配文只有一句「究竟何时能看到 Kimi 再次起飞」,测试排行榜来源于亿模亿样的双盲测试。这条「AI 前端/3D 能力测试」,正是热搜「实测 Kimi K3 前端 3D 能力」指向的内容。对七月押注它做前端和 3D 的用户来说,现在要回答的不是当时的口碑有没有水分,而是那套能力今天还灵不灵。哔哩哔哩
对一遍官方榜单、发布期实测与十月的返修记录,结论是:上限确实真过。Arena 的 WebDev Overall 榜单曾给 K3 打出 1679 分、暂列第 1,前端是它最硬的标签。但十月的实测集中暴露了下限:视觉和动效第一稿依旧能打,摄像机、操控、物理这些工程细节却反复翻车;用户「明显降智」的体感从九月下旬起开始发酵,一条 9 月 29 日的回答写得直接:今天2026.9.29k3明显降智。而官方至今没有确认任何能力调整。小红书知乎
七月的封神,是真有成绩垫的
7 月 16 日月之暗面正式发布 K3:2.8 万亿参数、百万 token 上下文、原生多模态,同时宣布 7 月 27 日全面开源。官方博客给出的前端基准数据甚至超过了 Fable 5 和 GPT-5.6 Sol(xHigh)一大截,这也是它发布当天最被业界关注的点。微博知乎
3D 随即成了博主们的实测主战场。有人让它用 Three.js、WebGPU 和 GPU 计算,搭出一款完全程序化生成、跑在浏览器里的 3D 开放世界游戏。海外博主 Matthew Berman 用它写了一个带 3D 反射效果的魔方模拟器,跑起来完整流畅。小红书微博
但官方从一开始就没把话说满。同一篇发布博客里,「前端编码榜登顶了」和「整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol」两条结论被同时写了进去。藏师傅拿它和 Opus 4.8 对打后的判断也留了余地:在复杂前端和复杂开发的情况下,它跟 Opus 4.8 差不多是相当的水平。所谓「前端之神」,从一开始就是单项冠军,而不是全能冠军。知乎微博
十月的复测,翻车全在交互工程
UP 主「威龙厨」的 AI 日晷挑战用统一的 GPT-5.6 Sol 提示词考察物理、美术、建模能力,K3 首轮交付直接翻车:摄像机位置错误,旋转中心没有和画面中心对齐,也做不出日夜环境变化。返修两轮、修掉这两个 bug 之后,他的结论依旧是差强人意,并追问那句被置顶的反问:我超大参数提升呢?哔哩哔哩哔哩哔哩
另一位 UP 主在 VSCode 的 Kimi Code 环境里让 K3 从零做《我的世界》仿作,成品《方块前线》的清单拉出来相当长:区块生成、音效、阴影、猪、僵尸、饥饿值、物品栏和合成界面,一应俱全。但直到成片,玩家还是无法正常拾取和放置方块,核心玩法断裂。触发这轮热搜的那条视频评论区里,跑完同一套双盲题库的用户给出的判断更直白:k3 全区,ds4.1f 和 mimo 全都是吊打 k3。这些仍是社区自测,口径和官方榜单不可直接相比,但方向一致:K3 的 3D 短板不在「好不好看」,在「能不能玩」。哔哩哔哩哔哩哔哩
在线体验不等于开源权重
开源权重从 7 月起没有变,变的是围绕 K3 的在线供给。9 月,Kimi 开放了 256K 上下文的 k3-256k,官方口径下它的额度消耗只有标准 K3 的一半。10 月 3 日又有快讯称,Kimi K3.1 已被开发者发现能从 API 调用、官方尚未确认。与此同时,永远算力不足!kimi 为何会走到今天这一步呢?——这成了 B 站热视频的标题,额度机制和 5 小时限额是用户退坑的第二条主线。知乎哔哩哔哩哔哩哔哩
必须把边界说清:算力紧张、产品线切换与「降智」体感之间的关联,目前只有时间上的重合和个体经验,没有官方披露的路由、版本或量化改动依据,不能写成「K3 被故意降级」这类结论。证据能到的地方只到这里——线上输出稳定性在下降是可复现的体感,原因尚无官方确认。
现在拿 K3 做前端 3D,怎么判断
如果你要的是「好看」:静态页面、动效叙事、3D 展示类第一稿,K3 依旧是国产模型里值得先试的选项,深色科技风的克制审美是多个测评共同承认的长板;同题对打里它也确实在整站动效一致性上占优,站点其它前端,Kimi 更懂 GSAP。但同一场对打的另一半结论也要记住:纯 3D 产品体验(旋转、切开、籽粒细节)Opus 5 明显更强,「要炸裂 3D」的场景别只指望它。小红书
如果你要的是「能玩」:按复测的通行成本留预算。做《方块前线》那位 UP 主的账单很清楚:等待约两小时、花费订阅和用量共约 50 美元。而拿到的是「画面惊艳、玩法缺失」的半成品;想要闭环,至少预留两轮人工返修和更高的思考档位。哔哩哔哩
如果你想绕开体感争议:别再只刷单个 UP 主的一次性演示。可以上亿模亿样的双盲测试页,用同一道题横向对比多家模型,并盯住两个官方信号——K3.1 是否转正,以及月之暗面对额度、路由与版本变化的说明。