GLM 4.7 Flash刚刚发布,作为一款300亿参数的大模型,它在多个维度展现出强劲实力。通过全面测试发现,这款模型在30B以下参数量中几乎没有对手,在代码能力方面甚至可以媲美Gemini 2.5 Flash和Claude 4 Sonnet,堪称里程碑式的开源模型。
智能速览
30B参数量以下模型中综合性能最强
代码能力接近顶级商业模型水平
本地部署占用31.84GB显存,推理速度43.15tokens/s
数学物理测试表现优异,接近满分
创意写作中英文字数达标率优于竞争对手
最终得分75.8分,略逊于GLM4.5 Air
精华内容
这款模型在多项基准测试中表现出色,特别是在代码生成和数理逻辑方面,展现了令人惊艳的能力。以下是详细的测试结果分析。
基础性能测试
在基准测试中,GLM 4.7 Flash开源可本地部署,支持20万上下文长度,获得4分基础分。中文创意写作得分分别为4分、7分和8分,英文创意写作为6.5分、8.5分和9分,字数控制明显优于Gemini 3 Pro。应用文写作获得9.5分、7分和9分的不错成绩。
推理速度方面,使用苹果MLX的巴比特量化版,在12万上下文下达到43.15tokens每秒,显存占用31.84GB,5090显卡可流畅运行。
数理逻辑表现
数学测试中表现惊艳,获得10分、9分和9分的高分。物理测试同样出色,得分达到10分、9.5分和9.8分。这两项测试几乎接近满分,展现了模型在逻辑推理和数理计算方面的强大能力。
在问答部分结束后,GLM4.7 Flash累计得到54.7分,为其后续代码测试打下了良好基础。
代码生成能力
SVG动画代码生成测试中,虽然醍醐形象尚可,但自行车效果不佳,动画播放也不正确,仅得5.2分。但在重头戏代码智能体测试中表现亮眼。
生成HTML网页手机操作系统模拟器的测试中,画面美观、动画丝滑,除返回按键外其他APP均可正常打开,获得6.8分。Python六边形小球测试表现更佳,支持重力方向、护轮力和科室力调节,60帧运行,获得7.5分。
综合对比分析
最终GLM4.7 Flash总得分75.8分,略逊于GLM4.5 Air的77.6分。去掉上下文和多模态限制后,纯模型性能为71.8分,与Cloud SysNet持平。
代码能力单独计算为21.1分,超过Cloud SysNet,与DeepSync满血版持平。在所有测试过的GLM系列中排名第三,仅次于更大体量的Air和满血版4.7。
市场定位价值
在300亿参数量级对比中,GLM 4.7 Flash呈现断层式领先,通杀所有同体量竞品。作为一款可离线运行的代码智能体模型,它在保持相对较小参数量的同时,实现了接近顶级商业模型的代码能力。
这种平衡使其成为开发者的理想选择,既保证了性能又控制了部署成本,是开源模型发展的重要里程碑。