看到GLM-4.6V能直接从截图生成代码,还挺意外的。之前做产品原型时,光对齐设计和开发就得折腾好几轮,要是真能把界面拍个照就出可用的前端代码,那不少中小公司的协作流程确实得重新想想了
刚刚,智谱开源GLM-4.6V系列模型啦~GLM-4.6V系列型号包括两个版本:GLM-4.6V (106B),一个为云端和高性能集群场景设计的基础模型,以及GLM-4.6V-Flash (9B),一
AI为你总结
全文概述
智谱开源了GLM-4.6V系列模型,包括106B的基础模型和9B的轻量化模型。该系列模型在视觉理解、多模态内容生成及文档理解方面实现了显著突破,并首次集成了原生函数调用功能,支持从感知到执行的闭环操作。
多模态功能调用
GLM-4.6V实现了原生的视觉驱动工具使用,图像、截图和文档页面可以直接作为输入,视觉输出如图表和渲染页面会被解释并融入推理链条中,实现从感知到理解再到执行的闭环过程。
交错图文内容生成
GLM-4.6V支持从复杂的多模态输入中创建高质量的混合媒体内容,处理多文档或长文档输入,并主动调用搜索和检索工具来收集额外的文本和视觉素材,生成丰富、视觉化的内容。
多模态文档理解
GLM-4.6V能够处理最多128K个标记的多文档或长文档输入,直接解读富格式页面中的文本、布局、图表和表格,准确理解复杂、以图像为主的文档。
前端复刻与视觉编辑
GLM-4.6V可以从UI截图重建像素级准确的HTML/CSS代码,并支持自然语言驱动的编辑。通过视觉检测布局、组件和样式,生成干净的代码,并应用迭代的视觉修改。
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
最新文章
热门文章
已收藏
去我的收藏夹