实测Kimi K3前端3D能力:从“前端榜第一”到“白月光翻车”,这三个月发生了什么

源自166位全网作者

18:10

10 月 10 日凌晨,B 站 UP 主「无机酸-_-」用社区双盲测试题库重新测了一遍 Kimi K3,配文只有一句「究竟何时能看到 Kimi 再次起飞」,测试排行榜来源于亿模亿样的双盲测试。这条「AI 前端/3D 能力测试」,正是热搜「实测 Kimi K3 前端 3D 能力」指向的内容。对七月押注它做前端和 3D 的用户来说,现在要回答的不是当时的口碑有没有水分,而是那套能力今天还灵不灵。哔哩哔哩

对一遍官方榜单、发布期实测与十月的返修记录,结论是:上限确实真过。Arena 的 WebDev Overall 榜单曾给 K3 打出 1679 分、暂列第 1,前端是它最硬的标签。但十月的实测集中暴露了下限:视觉和动效第一稿依旧能打,摄像机、操控、物理这些工程细节却反复翻车;用户「明显降智」的体感从九月下旬起开始发酵,一条 9 月 29 日的回答写得直接:今天2026.9.29k3明显降智。而官方至今没有确认任何能力调整。小红书知乎

七月的封神,是真有成绩垫的

7 月 16 日月之暗面正式发布 K3:2.8 万亿参数、百万 token 上下文、原生多模态,同时宣布 7 月 27 日全面开源。官方博客给出的前端基准数据甚至超过了 Fable 5 和 GPT-5.6 Sol(xHigh)一大截,这也是它发布当天最被业界关注的点。微博知乎

3D 随即成了博主们的实测主战场。有人让它用 Three.js、WebGPU 和 GPU 计算,搭出一款完全程序化生成、跑在浏览器里的 3D 开放世界游戏。海外博主 Matthew Berman 用它写了一个带 3D 反射效果的魔方模拟器,跑起来完整流畅。小红书微博

但官方从一开始就没把话说满。同一篇发布博客里,「前端编码榜登顶了」和「整体性能仍落后于 Claude Fable 5 和 GPT 5.6 Sol」两条结论被同时写了进去。藏师傅拿它和 Opus 4.8 对打后的判断也留了余地:在复杂前端和复杂开发的情况下,它跟 Opus 4.8 差不多是相当的水平。所谓「前端之神」,从一开始就是单项冠军,而不是全能冠军。知乎微博

十月的复测,翻车全在交互工程

UP 主「威龙厨」的 AI 日晷挑战用统一的 GPT-5.6 Sol 提示词考察物理、美术、建模能力,K3 首轮交付直接翻车:摄像机位置错误,旋转中心没有和画面中心对齐,也做不出日夜环境变化。返修两轮、修掉这两个 bug 之后,他的结论依旧是差强人意,并追问那句被置顶的反问:我超大参数提升呢?哔哩哔哩哔哩哔哩

另一位 UP 主在 VSCode 的 Kimi Code 环境里让 K3 从零做《我的世界》仿作,成品《方块前线》的清单拉出来相当长:区块生成、音效、阴影、猪、僵尸、饥饿值、物品栏和合成界面,一应俱全。但直到成片,玩家还是无法正常拾取和放置方块,核心玩法断裂。触发这轮热搜的那条视频评论区里,跑完同一套双盲题库的用户给出的判断更直白:k3 全区,ds4.1f 和 mimo 全都是吊打 k3。这些仍是社区自测,口径和官方榜单不可直接相比,但方向一致:K3 的 3D 短板不在「好不好看」,在「能不能玩」。哔哩哔哩哔哩哔哩

在线体验不等于开源权重

开源权重从 7 月起没有变,变的是围绕 K3 的在线供给。9 月,Kimi 开放了 256K 上下文的 k3-256k,官方口径下它的额度消耗只有标准 K3 的一半。10 月 3 日又有快讯称,Kimi K3.1 已被开发者发现能从 API 调用、官方尚未确认。与此同时,永远算力不足!kimi 为何会走到今天这一步呢?——这成了 B 站热视频的标题,额度机制和 5 小时限额是用户退坑的第二条主线。知乎哔哩哔哩哔哩哔哩

必须把边界说清:算力紧张、产品线切换与「降智」体感之间的关联,目前只有时间上的重合和个体经验,没有官方披露的路由、版本或量化改动依据,不能写成「K3 被故意降级」这类结论。证据能到的地方只到这里——线上输出稳定性在下降是可复现的体感,原因尚无官方确认。

现在拿 K3 做前端 3D,怎么判断

如果你要的是「好看」:静态页面、动效叙事、3D 展示类第一稿,K3 依旧是国产模型里值得先试的选项,深色科技风的克制审美是多个测评共同承认的长板;同题对打里它也确实在整站动效一致性上占优,站点其它前端,Kimi 更懂 GSAP。但同一场对打的另一半结论也要记住:纯 3D 产品体验(旋转、切开、籽粒细节)Opus 5 明显更强,「要炸裂 3D」的场景别只指望它。小红书

如果你要的是「能玩」:按复测的通行成本留预算。做《方块前线》那位 UP 主的账单很清楚:等待约两小时、花费订阅和用量共约 50 美元。而拿到的是「画面惊艳、玩法缺失」的半成品;想要闭环,至少预留两轮人工返修和更高的思考档位。哔哩哔哩

如果你想绕开体感争议:别再只刷单个 UP 主的一次性演示。可以上亿模亿样的双盲测试页,用同一道题横向对比多家模型,并盯住两个官方信号——K3.1 是否转正,以及月之暗面对额度、路由与版本变化的说明。

内容由AI生成

精选参考来源

1. Kimi K3:我的白月光级模型,为何你如今已...... - AI 前端/3D 能力测试

2. Kimi K3 前端榜登顶

3. KimiK3的实际表现真有被吹捧的那么强吗?

4. 《实测KimiK3,这次我们真的追上了》此时此刻,那种热血澎湃的感觉回来了。今天凌晨,KimiK3终于正式发布。2.8万亿参数,一百万上下文,原生多模态。同时,会在7月27日全面开源。不夸张地说,我觉得这件事对世界来说,是又一个DeepSeek时刻。我们先看个东西。这个3D黑胶唱机...全文

5. Kimi K3 第一手测评,前端能力直接封神!

6. Kimi K3实测——3D开放世界游戏

7. KimiK3的发布很可能是开源领域的又一个里程碑。作为一个拥有2.8万亿参数、百万token上下文的巨无霸模型,它在前端开发和写作等多个基准测试中直接冲到了全球第一,甚至超越了Fable5和GPT5.6。在实际测试中,技术博主MatthewBerman用它写一个带3D反射效果的魔方模拟器,运行起来非常完...全文

8. Kimi K3 登顶前端榜,然后它反手给所有 AI 出了一套不及格卷子

9. 藏师傅的KimiK3测评来了,这次确实非常牛逼!可以说是一个比较小的DeepSeek时刻我直接拿它跟Opus4.8做了对比测试。从结果来看,互有胜负。在复杂前端和复杂开发的情况下,我觉得它跟Opus4.8差不多是相当的水平。至于Fable5和5.6,我觉得还差一些,但已经是一个非常牛逼的成绩...全文

10. AI日晷挑战|KimiK3:前端大王竟然翻车

11. AI日晷挑战|KimiK3(修改返场):我超大参数提升呢?

12. KIMIK3也太离谱了

13. 国产大模型里kimik3为啥定价敢这么贵?

14. KimiK3.1泄露?月之暗面API现身新模型,豆包个人助理「Spell」内测|AI快讯第3期

15. 永远算力不足!kimi为何会走到今天这一步呢?普通用户还值得使用吗?

16. Opus 5 vs Kimi K3 前端对打:3D 和 GSAP

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章