【开源】glm-5.3-flash-vision RAG:三个 GLM 视觉应用

2026-09-03 07:38:16 0点赞 0收藏 0评论

glm-5.3-flash-vision 视觉多模态大模型昨天发布了!大佬们测试都说惊喜:

imageimage


imageimage

不多说了,就是好东西! 马上基于它进行开发和应用,我先开发3个实用的skill给佬:

github.com

【开源】glm-5.3-flash-vision RAG:三个 GLM 视觉应用

GitHub - liangdabiao/glm-5.3-flash-vision-rag: glm-5.3-flash-vision RAG:三个 GLM 视觉技能总览 > 同一套"让 AI...

glm-5.3-flash-vision RAG:三个 GLM 视觉技能总览 > 同一套"让 AI 看懂资料"的技术,嫁接到智谱 GLM-5.3-Flash 视觉大模型上, > 做成了三件趁手的工具:**看懂 PDF**、**看懂视频**、**把带货视频变成提示词

imageimage

功能类似deepseek版本:

最近在社区发布了3个基于deepseek-v4-flash-vision 视觉deepseek理解 的开源skill项目: 佬友评论说,怀疑和有问题。所以我完整测试一次看看行不行: 1 我先找一本扫描版的lego图书,这种其实一般都很难用常规方法进行rag,最难搞的进行测试: [image] 几百页的图文图书,让deepseek先理解,然后索引好知识和数据: [image]

核心原理就是模仿人类怎样做信息检索和利用的, 先索引后笔记,应用时候粗看目录,细看(视觉)文档图文,最后反复检验和多次查询(thinking),得到很好的RAG效果:

imageimage

开源不容易,感谢意见感谢支持!

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松