RAG工作做视觉全能RAG Skill deepseek-v4-flash-vision-rag
deepseek-v4-flash-vision 是真正的好东西! 但是我发现大家都不积极利用好它! 所以我试试做一个给佬参考,看看是不是好东西!
deepseek-v4-flash-vision :图片在 API 中会先转换成 token 再按 token 计费,一张图片最多占 384 tokens,计费价格与 V4-Flash 模型一致。例如:
处理整本图书, 100 万上下文 +600 图/请求 ⇒ 一次请求装下一整本书的视觉内容在配额内完全可以这样:120 页 × 384 token ≈ 4.6 万 image token
所以,我的skill方案就是, 直接一本几百页的书直接 利用deepseek-v4-flash-vision 转为 可利用信息, 转为很好用的RAG:

GitHub - liangdabiao/deepseek-v4-flash-vision-rag: 让 AI 真正"看懂" 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, >...
让 AI 真正"看懂" 一份 PDF,然后你对它提问:它告诉你答案、答案在第几页, > 并把那一页的原图展示出来给你核对。 基于 DeepSeek 视觉大模型 deepseek-v4-flash-vision-exp 的 PDF 深度问答与检索 (vision RAG)agent skill。支持文字版 PDF,也支持**扫描版**;能看懂 图表、表格、代码块、公式,而不只是认字。
核心原理:
** 每一页先被渲染成图、被deepseek-v4-flash-vision视觉模型读过、生成页级摘要与元数据 。
便宜的方法粗定位、贵的眼睛做确认、最贵的推理只用在刀刃上。节约成本,视觉RAG!
image
实际演示:
❯ 利用 deepseek-v4-flash-vision-rag skill 对 test2.pdf 进行工作
image
image
image
实际使用效果:
image
image
image
image
开源不容易,感谢佬支持
项目有参考学习了 pageIndex 的一些解决方案。感谢开源。
