智谱新开源GLM-4.5V!一秒破解谷歌验证码

简单说就是前段时间开源的GLM-4.5的视觉升级版(Vision-Language Model, VLM),它不光会聊,还能看图像、视频、文档、应用界面,什么都行~
具体的模型参数也不小,总 106B,激活 12B。
更厉害的是,它还在41个公开视觉多模态榜单中综合效果达到同级别开源模型 SOTA 性能

这成绩看着是相当唬人啊。不过咱们都知道,有时候榜单那套跟亲身体验就不是那么一回事
于是莫理今天干脆找了一些素材来亲自测试,看看这次的GLM-4.5V到底行不行~

GLM-4.5V
这次测试我们使用的是官方接口,在它们家的网站(z.ai)就能直接使用。
毕竟模型106B的体量,咱们一般人要本地部署还是不太现实…

首先测试的是去年就已经测试过的读配料表环节。我给它上传了一份零糖可乐的配料表并问它减肥期间到底能不能喝?

从测试来看,GLM-4.5V在开源模型里,这个能力水平已经相当不错了,甚至拿去和一些顶级的闭源模型比,也不见得会落下风
它能稳住常规的图片识别、地点判断,也能在网页复刻、视频理解这些相对复杂的任务里交出不俗的表现。
假如大伙刚好想找一个能看、能想的开源多模态模型,不妨去亲手试试~
网页地址:
https://z.ai
