张大妈

300亿参数量之王!GLM 4.7 Flash 一手评测! 大家久等了的GLM 4.7 flash就在刚才发布了。直接说结论:30B以下无对手,30B以上代码能力可以摸到Gemini 2.5 flash和Claude 4 Sonnet。 #ai新星计划 #智谱ai #GLM大模型 #大模型评测 #ai编程

源自抖音:AI踩坑指南

01-22 11:10

GLM 4.7 Flash刚刚发布,作为一款300亿参数的大模型,它在多个维度展现出强劲实力。通过全面测试发现,这款模型在30B以下参数量中几乎没有对手,在代码能力方面甚至可以媲美Gemini 2.5 Flash和Claude 4 Sonnet,堪称里程碑式的开源模型。

300亿参数量之王!GLM 4.7 Flash 一手评测! 大家久等了的GLM 4.7 flash就在刚才发布了。直接说结论:30B以下无对手,30B以上代码能力可以摸到Gemini 2.5 flash和Claude 4 Sonnet。
#ai新星计划 #智谱ai #GLM大模型 #大模型评测 #ai编程智能速览

  • 30B参数量以下模型中综合性能最强

  • 代码能力接近顶级商业模型水平

  • 本地部署占用31.84GB显存,推理速度43.15tokens/s

  • 数学物理测试表现优异,接近满分

  • 创意写作中英文字数达标率优于竞争对手

  • 最终得分75.8分,略逊于GLM4.5 Air

300亿参数量之王!GLM 4.7 Flash 一手评测! 大家久等了的GLM 4.7 flash就在刚才发布了。直接说结论:30B以下无对手,30B以上代码能力可以摸到Gemini 2.5 flash和Claude 4 Sonnet。
#ai新星计划 #智谱ai #GLM大模型 #大模型评测 #ai编程精华内容

这款模型在多项基准测试中表现出色,特别是在代码生成和数理逻辑方面,展现了令人惊艳的能力。以下是详细的测试结果分析。

基础性能测试

在基准测试中,GLM 4.7 Flash开源可本地部署,支持20万上下文长度,获得4分基础分。中文创意写作得分分别为4分、7分和8分,英文创意写作为6.5分、8.5分和9分,字数控制明显优于Gemini 3 Pro。应用文写作获得9.5分、7分和9分的不错成绩。

推理速度方面,使用苹果MLX的巴比特量化版,在12万上下文下达到43.15tokens每秒,显存占用31.84GB,5090显卡可流畅运行。

数理逻辑表现

数学测试中表现惊艳,获得10分、9分和9分的高分。物理测试同样出色,得分达到10分、9.5分和9.8分。这两项测试几乎接近满分,展现了模型在逻辑推理和数理计算方面的强大能力。

在问答部分结束后,GLM4.7 Flash累计得到54.7分,为其后续代码测试打下了良好基础。

代码生成能力

SVG动画代码生成测试中,虽然醍醐形象尚可,但自行车效果不佳,动画播放也不正确,仅得5.2分。但在重头戏代码智能体测试中表现亮眼。

生成HTML网页手机操作系统模拟器的测试中,画面美观、动画丝滑,除返回按键外其他APP均可正常打开,获得6.8分。Python六边形小球测试表现更佳,支持重力方向、护轮力和科室力调节,60帧运行,获得7.5分。

综合对比分析

最终GLM4.7 Flash总得分75.8分,略逊于GLM4.5 Air的77.6分。去掉上下文和多模态限制后,纯模型性能为71.8分,与Cloud SysNet持平。

代码能力单独计算为21.1分,超过Cloud SysNet,与DeepSync满血版持平。在所有测试过的GLM系列中排名第三,仅次于更大体量的Air和满血版4.7。

市场定位价值

在300亿参数量级对比中,GLM 4.7 Flash呈现断层式领先,通杀所有同体量竞品。作为一款可离线运行的代码智能体模型,它在保持相对较小参数量的同时,实现了接近顶级商业模型的代码能力。

这种平衡使其成为开发者的理想选择,既保证了性能又控制了部署成本,是开源模型发展的重要里程碑。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章