当大模型从写函数走向构建完整应用,GLM-5通过三类真实场景验证了其工程级落地能力:复刻3D竞速游戏、从零开发可部署的奖惩管理软件、精准定位万行代码项目的GPU报错根源。它不再停留于代码生成,而是展现出系统性规划、模块化实现与跨栈调试的真实生产力。
智能速览
GLM-5总参数量745B,采用DeepSeek-V3同款稀疏注意力与Slime框架,编程任务平均性能较GLM-4.7提升超20%
在SWE-bench-Verified和Terminal Bench 2.0中分别取得77.8和56.2分,为当前开源模型最高分
成功复刻N2O风格3D隧道竞速游戏,完整实现六棱柱旋转、粒子特效、Web Audio音效及UnrealBloom发光效果
基于用户需求从零开发TypeScript+Next.js奖惩管理应用,支持本地持久化、数据导入导出与安卓打包
对超万行代码的‘卡卡字幕助手’项目进行深度Debug,准确定位faster_whisper.py第105行并给出可运行修复方案
API调用成本极低,相比Claude Opus 4.6单次调试约5美元的成本,GLM-5提供可持续使用的工程替代路径
精华内容
大模型能否真正参与软件生命周期?不是生成单个函数,而是主导需求分析、架构设计、模块实现、联调验证与问题修复——GLM-5在三个强约束场景中给出了明确答案。
3D游戏复刻
使用相同提示词指令,GLM-5独立完成N2O风格竞速游戏开发,包含Three.js场景搭建、六边形隧道动态旋转逻辑、EdgesGeometry线框渲染、UnrealBloomPass发光后处理、粒子系统及Web Audio API实时音效生成。
代码全程模块化组织,注释覆盖率高,importmap确保依赖精确加载。对比Claude Opus 4.6,视觉表现接近;对比Kimi 2.5,后者缺失隧道轮廓且碰撞检测失效。
GLM-5将任务拆解为15个执行步骤,并对每步置信度评分,确认可行性后才启动编码,体现强规划能力。最终项目经贴图美化后可直接部署上线。
需求驱动开发
针对家长提出的‘日常行为奖惩系统’需求,GLM-5输出7步实施路径:任务管理→完成确认→分数统计→奖励商店→质量检查,并分4阶段交付功能。
产出TypeScript+Next.js前端应用,集成Tailwind CSS样式、framer-motion交互动画与recharts数据图表,所有状态本地存储且刷新不丢失。
后续追加任务重复完成、完成备注、CSV导入导出等功能均一次性实现。最终通过PakePlus打包为可安装安卓APP,验证端到端交付闭环能力。
百万行级Debug
面对开源字幕工具‘卡卡字幕助手’在50系显卡GPU模式下的持续报错,GLM-5未做盲目猜测,而是先拉取项目结构、解析报错日志、检索GitHub历史issue、分析依赖树,最终锁定faster_whisper.py文件第105行_build_command函数。
提出3种修复方案,主推方案要求在return cmd前插入cmd.extend([“–compute_type”, “float16”]),修改后GPU转录成功率从0%提升至100%。
整个过程未依赖人工代码预筛选,输入即为原始项目地址与错误日志,验证其在超大规模代码库中的自主推理与精准定位能力。
GLM-5标志着开源大模型正式进入Agentic Engineering实践阶段:它不只输出代码,更承担起系统工程师角色。在编程基准、真实项目复刻、定制化开发与复杂Debug三重维度上,已形成稳定可用的技术路径。当算力成本与工程效率成为开发者核心关切,这个免费、开源、可私有化部署的模型,正为国产AI工具链提供关键支点。下一个问题是:它何时能支撑起企业级CI/CD流水线中的自动重构与回归验证?