通过一个为逝去宠物打造的“赛博天堂”项目,对七款主流AI模型进行了真实场景下的编程能力大横评。这次评测超越了单纯的基准测试,深入考察了模型从零构建完整应用、迭代修复bug以及代码质量的真实表现,揭示了不同AI在工程实践中的优势与短板。
智能速览
Claude在完成度和代码质量上断层领先,展现了顶尖水准。
国产模型表现分化,Qwen 3.5速度最快但稳定性差,智谱GLM-5中规中矩。
迭代修复环节暴露了模型间显著的工程能力差异,Kimi文件管理混乱。
代码审查发现智谱GLM代码中存在硬编码后门账户,MiniMax密码保护薄弱。
面向对象架构的模型在前端效果和迭代维护上更具优势。
作者认为,严肃项目首选Claude,追求性价比则推荐MiniMax。
精华内容
这场测评不仅是一次速度与完成度的比拼,更深入挖掘了各AI模型在编程细节、迭代能力和代码安全性上的差异。从首轮交付的惊喜与翻车,到多轮修复的耐心与无奈,结果出人意料。
统一起跑线
为了公平对比,测试设定了统一的项目:为去世宠物打造一个赛博乐园。所有模型均在同一服务器、同一套详细提示词下,从零开始编写完整的前后端应用。项目虽不复杂,但涵盖登录、图片上传、场景展示和相机跟随等综合功能,足以考验AI的编程综合能力。
除了六个国产模型Qwen 3.5、GLM-5、Seed 2.0、MiniMax、Kimi、Step,还邀请了顶尖模型Claude作为对照组,全程录屏记录,旨在探明国产AI与海外巨头的真实差距。
首轮表现速览
第一轮测试中,各模型的速度和完成度差异显著。Step 3.5 Flash起手速度高达130 tokens/秒,但因频繁复读和中断,总耗时反而更长。多数模型速度稳定在40 tokens/s左右,而GLM-5最慢,首轮耗时18分钟。
在功能完成度上,仅智谱GLM-5勉强达到及格线。Qwen 3.5前端可爱但存在恶性登录bug,Seed 2.0和MiniMax的前端渲染均出现问题,Kimi K2.5更是直接未能渲染出前端,表现远低于预期。
迭代修复的拉扯
修复bug的过程最能体现模型的工程能力。Qwen 3.5经历了一次“自己把代码改坏再救回”的大翻车,但最终修复了核心问题,迭代能力尚可。Seed 2.0和MiniMax虽修复了基础功能,但场景简陋,效果提升有限。
最令人失望的是Kimi,一个简单的相机锁定功能修改三轮均未成功,且文件管理混乱,将代码写在了错误的总目录,暴露了在遵循指令和理解能力上的短板。GLM-5的bug基本修复,但部分文字显示问题因理解偏差未能解决。
代码质量的彩蛋
由于非专业程序员,评测者邀请Claude Code对七个模型的产出进行代码审查。结果发现了一些“彩蛋”:智谱GLM-5的代码中硬编码了一个后门账户(admin/admin123),交付时并未告知。MiniMax是唯一一个使用明文存储密码且未加盐的,安全保护形同虚设。
此外,Claude和GLM-5采用了面向对象架构,前端效果和迭代便利性更优。其他模型均为过程式代码,导致迭代时容易越改越乱。最难的相机跟随功能,只有Claude正确实现了坐标转换。
排名与使用建议
综合首轮表现、迭代能力、代码质量、完成度、速度和安全性六个维度,Claude以绝对优势位居第一。国产模型中,Qwen 3.5凭借较高的完成度和迭代能力排名第二,GLM-5第三。
评测者给出了个人使用建议:严肃或正式项目,Claude能节省时间并带来信心,贵有所值。追求性价比,MiniMax便宜且轻量,适合接一些小型机器人。Qwen 3.5和Seed 2.0作为新模型值得关注。GLM-5曾是领头羊,但涨价和会员权益缩水影响了用户体验。
这场横评直观地展示了当前AI编程工具的能力边界。尽管国产模型在此次测试中暴露了诸多问题,但其快速迭代和性价比优势也让人看到希望。随着技术演进,它们与顶尖模型的差距是否会缩小?未来的编程工作流又将因此发生怎样的改变?
关键评论
有评论指出测试工具可能存在不公平,建议统一使用Claude Code以实现更公平的对比。
有用户高度评价Claude的体验,称其如同‘神笔马良’,极大提升了开发效率。
部分开发者表示评测结果与个人体验相符,并认为丰富的提示词经验是弥补模型能力差距的关键。
一条高赞评论提醒,模型在编程时可能读取并参考其他文件夹的文件,存在数据泄露风险。
不少观众认为此次测评贴近实际使用感受,并直言在预算充足的情况下Claude仍是首选。