张大妈

Kimi K3前端3D能力实测:AI会重塑前端开发岗位吗

源自193位全网作者

18:08

凌晨发的这条实测,没有发布会,也没有跑分截图。UP主无机酸-_-把 Kimi K3 放进自建的双盲基准里测试前端与 3D 生成能力,结果公开挂在网上,任何人都可以继续提问、上传成绩、参与双盲评测,用他的话说,是要“共同建造可维护的、贴合实践的 AI 前端/3D 测试基准”。 这条视频上线不到一天,播放量超过 2.8 万、评论超过 200 条。标题里没说完的那半句“为何你如今已……”,正是前端开发者此刻最想知道的事:登顶前端榜的 Kimi K3,真实水平到底还剩多少。哔哩哔哩

这轮实测给出的答案分两层。技术层面,能力边界被清晰量出来了:一句话生成一个可交互的 3D 网页已经成立,但让相机、物理和交互细节一次性全对,仍然很难。岗位层面的信号更直接——前端开发不会被 AI 消灭,但这份工作的考试题正在跟着模型能力被重写。

一道日晷题:前端之王的翻车现场

B站 UP 主威龙厨发起的“AI 日晷挑战”是这轮争议的具体样本:各家模型用同一套提示词生成一个带昼夜旋转的日晷网页,同时考察物理、美术与建模能力。B站

Kimi K3 一轮交付、不做返修,交出的版本摄像机位置放错、旋转中心没有和画面中心对齐,昼夜变化也没做出来。 9 日的返场评测里,UP 主改用高思考档位、追加两轮修复,相机与旋转对齐的 BUG 被解决了,K3 还自行加上了隐藏其他面板的功能,但修复后的结论依然不客气:美术建模和功能性都不如很多参数量更低的选手,甚至连昼夜环境变化都没做出来。B站B站

7 月的光环,和它自带的“截止日期”

要看懂这轮测试的落差,得先回到发布时刻。7 月 16 日,月之暗面发布了 2.8 万亿参数级的开源模型 K3。 官方给它的标签是:2.8 万亿参数、全球最大开源模型、原生视觉、100 万 token 上下文、前端编码榜第一。知乎知乎

Frontend Code Arena 靠全球开发者匿名投票加盲测投出结果,不是刷题跑分。 同一场盲测里,K3 在 7 个前端细分领域拿到 6 个第一,只在游戏赛道输给 Fable 5。知乎知乎

光环旁边有官方自己写下的限制条件:“尽管其整体性能仍落后于最强大的闭源模型 Claude Fable 5 和 GPT 5.6 Sol”。 发布后一周左右 K3 完成开源,按开发者实测,权重文件约 1.56TB、每次生成只激活约 104B 参数,单机最低需要 8 卡 AMD MI355X 服务器才能跑起来,官方技术文章则建议大型服务使用 64 张以上处于同一高速互联域的加速卡。 换句话说,绝大多数前端开发者接触 K3 的方式只有 API 和 Kimi Code,它的日常可用性始终和月之暗面的算力供给绑在一起。知乎知乎

还有一块被官方掀开的短板:月之暗面推出视觉感知基准 PerceptionBench,把视觉定位、计数、深度关系这些“看清楚”的基础能力拆成考题,结果全部参测模型不及格,最高分 GPT-5.6 Sol 只有 59.7%。 3D 网页生成恰恰重度依赖看清空间关系,日晷翻车暴露的相机错位、旋转中心偏差,和这份不及格卷子在方向上是一致的。知乎

是“降智”,还是“一直被过誉”

实测变差的另一半原因在产品侧。近两周,开发者对 K3 的抱怨集中在额度与速度上,评论区里“额度少的要命”的说法获得高赞。 新版本也还没落地:10 月 10 日已有微博帖称月之暗面 API 后台出现了 kimi-k3-1 的注册标识、开发者能探测到,但官方尚未正式发布 K3.1。B站微博

评论区里两种叙事正面相撞。一种是“降智论”:k3 还在竞技场盲测时做出的前端落地页惊为天人,如今连能不能过上一代闭源模型都成了问题。 另一种声音则认为 K3 从头就被过誉了——按这位用户的说法,实测从未降智,只是慢和名不副实。B站

点赞最高的评论在怀念 7 月的格局:“要性价比有涨价前的 V4flash,要性能有能跟 sol 和 fable 同一级别的 K3”,并留言“希望 10 月这轮能发力吧”。 两种说法目前没有官方回应可以裁决。证据的边界在这里:7 月榜单测的是落地页盲评投票,10 月实测测的是物理与 3D 任务,题目类型、思考档位、额度状态都不相同,两组结果不能直接相减得出“退步了多少”。能确认的只有一件事:当光环被换到一套新题库上,当下版本的 K3 更接近“头部、但不无敌”。哔哩哔哩

3D 的另一面:一句话成场景,最后一公里靠人

把这轮翻车放回三个月的曲线里看,能力并没有归零,只是边界露了出来。7 月中旬起,一句话建 3D 场景的成功案例就成批出现,“KimiK3的建模能力,真的太顶太离谱了”曾是前端创作者的高赞结论。 到 10 月,仍有开发者用它组合出二战飞行网页游戏、多轮生成开放世界式场景。K姐研究社的实测里,K3 依据三张参考图搭出的体素风世界杯场馆可以自由旋转、切换视角,点击任何一名球员都会显示他的名字、位置与战术职责。B站知乎

月之暗面甚至展示过 K3 连续自主运行 48 小时、为自家 Nano 模型设计可运行芯片的案例——该案例暂无第三方复核,但它和日晷返修时“无提示词要求自行加功能”的表现指向同一件事:长链路的搭建 AI 已经能接手,正确性的验收还不能。 场景完整度、美术风格、交互骨架可以一次生成,物理正确、相机标定、动态光照和性能优化仍需人工兜底——这就是这轮 3D 实测划出的真实边界。知乎

岗位重塑:先是考题变了

标题里那个问题,证据不在裁员传闻里,而在十月的面试间。有候选人分享刚结束的 AI 前端岗面试:一面不问闭包、不问原型链,直接甩出一段 AI 生成的虚拟滚动组件代码,要求边讲边改、当场找出内存回收漏洞。知乎

AI 偏偏在前端最像“主场”。有开发者分析其结构性原因:编程语言规则化越强,AI 表现越好,而数十年的互联网化留下了大量高质量开源代码库,恰好是模型的养料。 招聘端的压力也因此被部分从业者直言:标准化的 CRUD 与页面交互已可由 AI 生成,初级前端需求正在收缩。 这是单个受访者的判断,目前还没有权威招聘数据能量化收缩幅度。知乎知乎

回到那位候选人的转述:二面要求现场设计多 Agent 协作的前端状态管理方案,包括模型超时后的降级策略;面试官的一句话被他记到现在——“AI 能写出 80 分的代码,我们要的是能拿到剩下 20 分溢价的人”。 可以当作“重塑”二字的注脚:这个岗位的价值正从写代码,转向审代码、兜底,以及把 3D 和 AI 效果真正送进生产环境。知乎

接下来盯什么

想持续跟踪这件事,有三个可验证的信号。一是亿模亿样这类开放双盲基准本身——结果公开可查、人人可加题,K3 及其后继者的 3D 真实水平会在新一轮投票里拿到光环之外的分数。 二是 K3.1 的发布节奏与实测定级,社区普遍把 10 月这轮当成月之暗面的翻身节点。三是 AI 前端岗面试内容的继续漂移——如果“审 AI 代码、兜 AI 的底”从大厂面试题变成全行业标配,那才是岗位重塑完成度的最好温度计。哔哩哔哩

回到“AI 会重塑前端开发岗位吗”:这轮实测给出的答案是,重塑不以岗位消失的方式发生,而以技能迁移的方式发生——考核点正从“你能不能写出来”,变成“你能不能审出来、兜得住”。K3 的 3D 能力可以在两轮返修里修好相机,前端职业的下半场,比的恰恰是谁来按下返修键。

内容由AI生成

精选参考来源

1. Kimi K3:我的白月光级模型,为何你如今已...... - AI 前端/3D 能力测试

2. AI日晷挑战 | Kimi K3:前端大王竟然翻车

3. AI日晷挑战 | Kimi K3(修改返场):我超大参数提升呢?

4. 如何评价7月16日Kimi发布的2.8万亿级开源模型K3?

5. Kimi K3 登顶前端榜,然后它反手给所有 AI 出了一套不及格卷子

6. Kimi k3发布,前端coding已超越Fable 5,位于榜首

7. 如何评价KIMI K3正式开源,以及同步发布出技术报告?

8. Kimi K3 深度评测 – 前端开发能力登顶全球第一

9. 十月面了两家AI前端岗,普及一下面试真实强度

10. 未来三年,前端工程师会因为AI而减少招聘需求吗?哪些前端岗位会更安全?

11. 为什么AI写前端写的很好?

12. KimiK3的建模能力,真的太顶太离谱了

13. KimiK3.1要来的消息刷了屏,但这条爆料里真正值得盘的,是里面藏着的一个算力判断:国产芯片跑推理没问题,做预训练,短期替代不了英伟达。先说能核实的部分。月之暗面API后台出现了kimi-k3-1的注册标识,开发者能探

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章