张大妈

Opus级开源模型现身!老外吹爆的神秘模型Pony,真身竟然是国产GLM-5

源自公众号:刘小排r

02-12 15:59

最近一个名为Pony-Alpha的神秘模型在海外刷屏,性能远超Claude Sonnet 4.5,与Opus系列打得有来有回。最终揭晓其真身是国产GLM-5,而且是开源的。经过深度实测,这个模型在编程能力上确实达到了Opus级别,成为开发者值得关注的新选择。

Opus级开源模型现身!老外吹爆的神秘模型Pony,真身竟然是国产GLM-5智能速览

  • GLM-5作为国产开源模型,性能媲美Claude Opus

  • 金门大桥测试首次一次性通过,细节表现出色

  • 塔罗牌全栈应用53个文件35分钟完成

  • 成功为43000星开源项目贡献核心修复

  • 长任务记忆和语法准确性与Opus仍有微小差距

  • 为不想被API价格绑架的开发者提供可用选择

Opus级开源模型现身!老外吹爆的神秘模型Pony,真身竟然是国产GLM-5精华内容

AI编程正在从’对话式写代码’进入’端到端做工程’的新阶段。在这个背景下,GLM-5的出现时机很有意思,它直接对标Opus级别的系统工程能力——而且还是开源的。

金门大桥测试

金门大桥测试是检验大模型编程能力的经典项目,涉及3D图形学、着色器编程、性能优化等多项复杂技术。GLM-5首次实现了国产模型的一次性通过,无需任何修改。

视频展示了桥上车流的流畅细节,车尾灯效果完整呈现。对比GLM-4.7的版本,进步非常明显。这个单文件项目成功验证了GLM-5在复杂场景建模和实时渲染方面的能力。

测试要求模型同时具备世界知识、图形学、动画系统等多项能力,GLM-5的表现达到了Opus 4水平,成为开源模型中的新SOTA。

全栈塔罗牌应用

升级测试选择了通过摄像头识别表情抽塔罗牌的像素风网页应用,这个项目涉及全栈开发、实时系统、Canvas动画等多重技术栈。总共生成了53个文件,耗时35分钟完成。

GLM-5完美适配了Claude Code的Agent Teams功能,7个Agent协同工作。虽然不是一次就完美完成,需要几轮调试,但最终质量相当高。

过程中暴露了GLM-5的两个问题:超长任务会丢失部分记忆,出现反复提醒;处理React相关语法时错误率较高。这些是相比Opus 4.6的主要差距。

开源项目实战

在真实开源项目修bug的测试中,GLM-5展现了强大的代码理解和问题定位能力。成功为两个重要开源项目解决了棘手bug。

第一个是1380星的hapi项目,解决了’新建会话’时偶尔出现重连横幅的问题。GLM-5准确识别出这是路由优先级陷阱,只修改2行代码就彻底修复。

第二个是43000星的everything-claude-code项目,发现并修复了影响数万用户的配置丢失问题。这个PR让GLM-5的使用者成为了该项目仅有的24名贡献者之一。

工程能力评估

GLM-5最大的亮点是整体的’靠谱感’,像一个干活稳的同事。它能扛住复杂任务,遇到问题能自己想办法修复。这种能力在以前的开源模型中很稀缺。

reasoning过程偏短是特点也是短板。好处是省Token,坏处是难以提前排查思路问题。对于关注过程的开发者来说可能不太适应。

在代码质量上,语法错误和lint错误比海外顶级模型多一些,但最终都能修复。这种’90分和95分的差距’对于实际工程影响有限。

GLM-5的出现标志着开源模型在工程能力上实现了重大突破,为开发者提供了摆脱API价格绑架的可行选择。虽然仍有改进空间,但已经具备了处理真实复杂项目的实力。在AI编程进入Agentic Engineering的时代,这样的开源模型值得更多关注和期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章