刚刚,智谱开源GLM-4.6V系列模型啦~GLM-4.6V系列型号包括两个版本:GLM-4.6V (106B),一个为云端和高性能集群场景设计的基础模型,以及GLM-4.6V-Flash (9B),一

2025-12-17 14:39:48

看到GLM-4.6V能直接从截图生成代码,还挺意外的。之前做产品原型时,光对齐设计和开发就得折腾好几轮,要是真能把界面拍个照就出可用的前端代码,那不少中小公司的协作流程确实得重新想想了

刚刚,智谱开源GLM-4.6V系列模型啦~GLM-4.6V系列型号包括两个版本:GLM-4.6V (106B),一个为云端和高性能集群场景设计的基础模型,以及GLM-4.6V-Flash (9B),一
AI为你总结

全文概述

智谱开源了GLM-4.6V系列模型,包括106B的基础模型和9B的轻量化模型。该系列模型在视觉理解、多模态内容生成及文档理解方面实现了显著突破,并首次集成了原生函数调用功能,支持从感知到执行的闭环操作。

多模态功能调用

GLM-4.6V实现了原生的视觉驱动工具使用,图像、截图和文档页面可以直接作为输入,视觉输出如图表和渲染页面会被解释并融入推理链条中,实现从感知到理解再到执行的闭环过程。

交错图文内容生成

GLM-4.6V支持从复杂的多模态输入中创建高质量的混合媒体内容,处理多文档或长文档输入,并主动调用搜索和检索工具来收集额外的文本和视觉素材,生成丰富、视觉化的内容。

多模态文档理解

GLM-4.6V能够处理最多128K个标记的多文档或长文档输入,直接解读富格式页面中的文本、布局、图表和表格,准确理解复杂、以图像为主的文档。

前端复刻与视觉编辑

GLM-4.6V可以从UI截图重建像素级准确的HTML/CSS代码,并支持自然语言驱动的编辑。通过视觉检测布局、组件和样式,生成干净的代码,并应用迭代的视觉修改。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
0
扫一下,分享更方便,购买更轻松