张大妈

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!

源自知乎:量子位

02-17 12:25

GLM-5的发布,标志着开源大模型迎来了一次质变,从辅助工具进化为能够独立完成复杂工程任务的‘工程师’。它连续运行24小时,自主完成了从零构建GBA模拟器等高难度项目,展现了前所未有的长任务处理能力,为开发者揭示了全新的AI协作范式。

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!智能速览

  • GLM-5连续运行超24小时,自主从零手搓出GBA模拟器。

  • 整个过程涉及700次工具调用和800次上下文切换,精准无误。

  • 在多项权威评测中,GLM-5编程能力与闭源的Claude Opus 4.5比肩。

  • 用户已借助GLM-5开发出3D大富翁、学术版“抖音”并提交App Store。

  • GLM-5的出现,标志着AI角色从‘助手’向‘独立工程师’的转变。

GLM-5真够顶的:超24小时自己跑代码,700次工具调用、800次切上下文!精华内容

GLM-5的突破性不仅体现在评测分数上,更在于其解决复杂现实问题的实际能力。它不再是简单的问答工具,而是一个能够自主规划、执行并完成长周期项目的智能体,这从其惊人的实战案例中可见一斑。

零代码构建GBA

构建一个Game Boy Advance模拟器对AI而言是一项绝对无法取巧的工程任务。它涉及500多条CPU指令集、内存分页机制、音频子系统和图形渲染时序,任何微小偏差都会导致项目在数小时后崩溃。

GLM-5在无并行、无参考代码、无网络搜索的严苛条件下,连续运行超过24小时,完成了700次工具调用与800次上下文切换,最终用JavaScript从零手搓出一个功能完整的GBA模拟器。整个过程表现稳定,展现了强大的逻辑闭环与纠错能力。

比肩顶级模型

GLM-5的实力不仅体现在单一项目上,更获得了权威评测机构的认可。在Artificial Analysis榜单中,其综合能力与闭源的Claude Opus 4.5处于同一梯队。在衡量模型编程能力的主流基准测试中,GLM-5同样实现了与Claude Opus 4.5的对齐。

此外,在专门考察经营能力的Vending Bench 2测试中,GLM-5取得了开源模型排名第一的成绩,证明了其在复杂任务处理上的领先地位。

多元能力实测

除了构建模拟器,GLM-5在各类复杂任务中均表现出色。它能根据要求,从零生成一个可玩的3D版《大富翁》游戏,功能实现完整。

已有用户利用它开发出学术版“抖音”应用,并成功提交至苹果App Store审核。面对创建具有复杂物理规律的3D玻璃十二面体这类高难度视觉任务,GLM-5也能精准理解Prompt并生成高质量效果。此外,制作完整电商网站和3D可交互《我的世界》等实例,进一步证明了其全栈开发潜力。

重塑行业生态

GLM-5的出现,预示着AI角色的根本性转变——从需要不断Prompt调试的“助手”,进化为设定目标后可自主执行的“独立工程师”。这种转变对SaaS行业构成了潜在冲击,因为一个能现场手搓CRM系统的AI,可能会颠覆传统的软件订阅模式。

更重要的是,这种曾被闭源巨头垄断的强大能力,现在通过GLM-5的开源交到了所有开发者手中,这预示着AI应用开发的创新速度将大幅加快。

GLM-5不仅是一个强大的开源模型,更是一个里程碑,它将长任务的自主执行能力带到了开源社区。从24小时不间断编码到全栈应用开发,它展示了AI作为独立生产力的巨大潜力。未来,随着这种能力的普及,开发模式与软件行业格局无疑将被深刻重塑,一个由AI驱动的创造新纪元正在开启。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章