张大妈

智谱放大招!实测GLM-4.6V,它也太会“看图做事”了

源自公众号:极智视界

02-03 12:46

智谱新发布的GLM-4.6V多模态模型实现了从感知到执行的一体化推理,其原生工具调用能力在实测中表现突出。虽然部分能力尚未达到顶尖水平,但在复杂视觉任务处理上已展现出显著优势。

智谱放大招!实测GLM-4.6V,它也太会“看图做事”了

智谱放大招!实测GLM-4.6V,它也太会“看图做事”了智能速览

  • GLM-4.6V发布106B云端版和9B本地版两个版本

  • 原生支持多模态工具调用,无需外部工程化

  • 支持网页复刻、文档解读、商品比价等多种场景

  • 图文同时输出能力突破,可生成图文并茂内容

  • 地图推理和疑难字识别表现出色

智谱放大招!实测GLM-4.6V,它也太会“看图做事”了精华内容

通过多个实际场景测试,GLM-4.6V展现了从视觉理解到工具执行的完整能力链路,这在当前VLM模型中实属罕见。

网页复刻能力

在复刻抖音电脑版和小红书网页的测试中,GLM-4.6V能够准确识别页面结构并生成对应的HTML代码,包括图片素材的搜索和替换。虽然前端能力相比Gemini 3 Pro还有差距,但支持多轮视觉交互修改,可在生成的网页截图上框选区域进行精确调整。这种交互式编辑功能大大提升了实用性。

文档图文解读

GLM-4.6V解决了图文同时输出的技术难题。测试中,模型能够读取Transformer论文,并自动提取其中的架构图和图表,生成图文并茂的公众号文章。所有配图都来自论文原文,而非AI生成或联网搜索。这种能力对于需要处理复杂文档的场景特别有价值。

智谱放大招!实测GLM-4.6V,它也太会“看图做事”了

商品比价功能

在实际购物比价测试中,GLM-4.6V能够准确搜索商品信息、价格和用户评价。测试者使用麦克风商品进行比价,模型提供了准确的市场价格和用户反馈信息。这个功能有望简化用户的购物决策过程,减少在多个平台间切换的麻烦。

智谱放大招!实测GLM-4.6V,它也太会“看图做事”了

疑难字识别

在识别豆瓣小组的疑难杂字测试中,GLM-4.6V表现出色。即便是手写的模糊字迹,如古诗中的’君不见’或难以辨认的日常书写,模型都能准确识别。这种能力在处理非标准化文字输入时非常有用,比如ICU留言、手写笔记等场景。

智谱放大招!实测GLM-4.6V,它也太会“看图做事”了

地图推理能力

通过北京中关村创业大街和昆明老街的照片测试,GLM-4.6V能够准确推理出拍摄地点。即使在飞机上拍摄的照片,模型也能根据建筑特征、地理环境等信息推导出具体位置。这种空间推理能力在旅游、地理教育等领域有广阔应用前景。

图片提示词反推

对NBP生成的教学图片进行提示词反推测试,GLM-4.6V给出了详细的英文提示词描述,准确还原了图片的中国水墨风格、教育信息图特性、色彩搭配和构图细节。使用反推的提示词在即梦平台成功生成了类似图片,验证了反推的准确性。

GLM-4.6V凭借原生多模态工具调用能力,为AI Agent应用提供了强有力的技术基座。虽然个别能力仍有提升空间,但其’图像即参数,结果即上下文’的特性已经展现出巨大潜力,智谱的开源策略令人期待后续发展。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章