RAG工作做视觉全能RAG Skill deepseek-v4-flash-vision-rag

2026-09-03 00:21:51 0点赞 1收藏 0评论

deepseek-v4-flash-vision 是真正的好东西! 但是我发现大家都不积极利用好它! 所以我试试做一个给佬参考,看看是不是好东西!

deepseek-v4-flash-vision :图片在 API 中会先转换成 token 再按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。例如:

处理整本图书, 100 万上下文 +600 图/请求 ⇒ 一次请求装下一整本书的视觉内容在配额内完全可以这样:120 页 × 384 token ≈ 4.6 万 image token

所以,我的skill方案就是, 直接一本几百页的书直接 利用deepseek-v4-flash-vision 转为 可利用信息, 转为很好用的RAG:

github.com

RAG工作做视觉全能RAG Skill deepseek-v4-flash-vision-rag

GitHub - liangdabiao/deepseek-v4-flash-vision-rag: 让 AI 真正"看懂" 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, >...

让 AI 真正"看懂" 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, > 并把那一页的原图展示出来给你核对。 基于 DeepSeek 视觉大模型 deepseek-v4-flash-vision-exp 的 PDF 深度问答与检索 (vision RAG)agent skill。支持文字版 PDF,也支持**扫描版**;能看懂 图表、表格、代码块、公式,而不只是认字。

核心原理:

** 每一页先被渲染成图、被deepseek-v4-flash-vision视觉模型读过、生成页级摘要与元数据 。
便宜的方法粗定位、贵的眼睛做确认、最贵的推理只用在刀刃上。节约成本,视觉RAG!

imageimage

实际演示:

❯ 利用 deepseek-v4-flash-vision-rag skill 对 test2.pdf 进行工作

imageimage

imageimage


imageimage


实际使用效果:

imageimage

imageimage


imageimage


imageimage

开源不容易,感谢佬支持

项目有参考学习了 pageIndex 的一些解决方案。感谢开源。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松