智谱新发布的GLM-4.6V多模态模型实现了从感知到执行的一体化推理,其原生工具调用能力在实测中表现突出。虽然部分能力尚未达到顶尖水平,但在复杂视觉任务处理上已展现出显著优势。

智能速览
GLM-4.6V发布106B云端版和9B本地版两个版本
原生支持多模态工具调用,无需外部工程化
支持网页复刻、文档解读、商品比价等多种场景
图文同时输出能力突破,可生成图文并茂内容
地图推理和疑难字识别表现出色
精华内容
通过多个实际场景测试,GLM-4.6V展现了从视觉理解到工具执行的完整能力链路,这在当前VLM模型中实属罕见。
网页复刻能力
在复刻抖音电脑版和小红书网页的测试中,GLM-4.6V能够准确识别页面结构并生成对应的HTML代码,包括图片素材的搜索和替换。虽然前端能力相比Gemini 3 Pro还有差距,但支持多轮视觉交互修改,可在生成的网页截图上框选区域进行精确调整。这种交互式编辑功能大大提升了实用性。
文档图文解读
GLM-4.6V解决了图文同时输出的技术难题。测试中,模型能够读取Transformer论文,并自动提取其中的架构图和图表,生成图文并茂的公众号文章。所有配图都来自论文原文,而非AI生成或联网搜索。这种能力对于需要处理复杂文档的场景特别有价值。

商品比价功能
在实际购物比价测试中,GLM-4.6V能够准确搜索商品信息、价格和用户评价。测试者使用麦克风商品进行比价,模型提供了准确的市场价格和用户反馈信息。这个功能有望简化用户的购物决策过程,减少在多个平台间切换的麻烦。

疑难字识别
在识别豆瓣小组的疑难杂字测试中,GLM-4.6V表现出色。即便是手写的模糊字迹,如古诗中的’君不见’或难以辨认的日常书写,模型都能准确识别。这种能力在处理非标准化文字输入时非常有用,比如ICU留言、手写笔记等场景。

地图推理能力
通过北京中关村创业大街和昆明老街的照片测试,GLM-4.6V能够准确推理出拍摄地点。即使在飞机上拍摄的照片,模型也能根据建筑特征、地理环境等信息推导出具体位置。这种空间推理能力在旅游、地理教育等领域有广阔应用前景。
图片提示词反推
对NBP生成的教学图片进行提示词反推测试,GLM-4.6V给出了详细的英文提示词描述,准确还原了图片的中国水墨风格、教育信息图特性、色彩搭配和构图细节。使用反推的提示词在即梦平台成功生成了类似图片,验证了反推的准确性。
GLM-4.6V凭借原生多模态工具调用能力,为AI Agent应用提供了强有力的技术基座。虽然个别能力仍有提升空间,但其’图像即参数,结果即上下文’的特性已经展现出巨大潜力,智谱的开源策略令人期待后续发展。