当前位置:
AIGC文章详情

DeepSeek终于能看图了,但你的Chatbox不一定能:V4-Flash-Vision 接入、避坑和花钱账,一篇讲清

源自20位全网作者

15:48

DeepSeek 终于能看图了。但这两天如果你泡在 Chatbox 的圈子里,会发现大家问得最多的不是"识图效果好不好",而是"为什么我的用不了"。

有人发图过去,模型有模有样地接住了;有人把视觉、OCR 的勾全打上,模型照样装死;还有人在别的软件里能识图,偏偏 Chatbox 不行。8 月 21 日之后,小红书的求助帖和评论区里全是这种问题。

其实答案不复杂:多数情况不是 DeepSeek 看不见,而是 Chatbox 里差了一步。这篇把时间线、原因、接法和成本一次讲清楚。

这几天发生了什么

先把事情捋一遍,信息来自 DeepSeek 官方更新日志的转述和多个社区的交叉核对:

  • 8 月 21 日:DeepSeek 在 API 平台上线多模态视觉模型 V4-Flash-Vision-Exp,模型 ID 是 `deepseek-v4-flash-vision-exp`,带 `-exp` 后缀,说明是实验性质。官方口径是纯文本能力没有缩水,在 Agent、推理、世界知识等任务上,Vision-Exp 与 V4-Flash 正式版持平。知乎视觉按 Flash 的价格走,没有单独的"视觉附加费"。

  • 8 月 22 日:第一批 Chatbox 用户开始尝鲜,然后集体卡壳。有用户模型的视觉能力勾了、OCR 也勾了,发图还是识别不了;有用户反映视觉勾选保存不住,关掉设置就跳回普通 flash。求助帖评论区一排"+1,我也不行"。

  • 8 月 24 日:Chatbox 官方小红书账号发布 v1.22.6 更新,第一条就是"支持 DeepSeek-V4-Flash-Vision-Exp 视觉模型"。小红书求助帖的评论区里,第一条回复就是"现在可以了,更新到1.22.6版本"。小红书

  • 同一天:硅基流动把 DeepSeek-V4-Flash 更新到正式版(模型广场标注 0731),价格维持预览版不变:缓存命中 0.02 元/百万 token、输入 1 元/百万、输出 2 元/百万。V4 Pro 则还是预览版。

DeepSeek终于能看图了,但你的Chatbox不一定能:V4-Flash-Vision 接入、避坑和花钱账,一篇讲清

一句话总结:模型侧的"眼睛"早就到位了,客户端侧的官方支持晚了三天,这个时间差就是"有人能用、有人不能用"的根源。

为什么"有人能用,有人不能用"

综合社区反馈,大致是三种情况:

  1. 老版本 Chatbox + 内置 DeepSeek 接口:模型列表里还没有这个视觉模型,或者视觉能力标记没生效,发图就是"不支持"或者装死。这是 8 月 24 日之前最常见的情况。

  2. 更新到 v1.22.6 后用内置接口:官方已补齐支持,理论上直接可用,不少用户升级后问题解决。

  3. 自定义模型服务商接 DeepSeek 官方或硅基流动的 API:这条路不依赖客户端的更新节奏,模型 ID 自己填,是社区互相安利最多的方案。

另外有个说法在 RP 圈流传:客户端内置接口会附带额外的安全提示词,让模型"甲更厚"、更容易出戏。这个说法没法核实,但很多玩角色扮演的用户确实更愿意走自定义 API——除了体验上的偏好,还有个更实际的理由:自定义模式下新模型当天就能用上,不用等客户端发版。

自定义 API 接入:社区踩出来的清单

社区里教程最多、反馈最稳的路线是自定义服务商,桌面端和手机端都适用:

  1. 设置 → 模型提供方,添加自定义服务商OpenAI API 兼容);

  2. API 主机:DeepSeek 官方填 `https://api.deepseek.com`,走硅基流动就填它的接口地址;

  3. 模型名称:`deepseek-v4-flash-vision-exp`,也可以点"获取模型"从列表里勾;

  4. API 模式选第一种主流的兼容模式

  5. 打开模型设置,把对话、视觉、OCR 三个能力都勾上,上下文可以设到 1M、输出 384K;

  6. 保存后,回到会话里手动把当前对话切换到这个模型——只加载模型不够,当前会话切过去才真正生效;

  7. 发一张图试试,能正常描述画面内容,就说明配好了。

DeepSeek终于能看图了,但你的Chatbox不一定能:V4-Flash-Vision 接入、避坑和花钱账,一篇讲清

第一个坑:直接用内置接口识图失败时,社区通行的解决办法是切换到 OpenAI 自定义模式。哔哩哔哩

第二,API 模式不要选"OpenAI Responses API 兼容"。小红书有用户遇到过"视觉勾上但保存不住"的情况,先升级到最新版再设置。

第三,图片只能放在你发出的消息里。如果不小心把图发给了普通的 `deepseek-v4-flash`,会直接得到一句"This model does not support image"。知乎

玩之前,先看三个能力上限

这个模型有三条边界,先知道再玩,不容易失望:

第一,每张图最多折算 384 个 token。 不管你发 800×800 还是 3000×3000,系统都会先缩放到 800×800 左右的总像素再看,一张 2000×2000 的照片和一张 5000×5000 的照片收一样的钱。知乎好处是便宜,坏处是:图里的小字、表格里的细格子、密密麻麻的标注,识别效果会打折扣。实测里大字海报的中文能一字不差读出来,但别指望它当高精度 OCR 用。

第二,它只"看图",不"画图"。 这是视觉理解模型,官方演示的看图问答、读表格、读网页截图,都属于"看懂了再输出文字",不具备图像生成能力。知乎想让它给角色画立绘的,可以省省了。

第三,`-exp` 后缀意味着实验版。 能力和定价后续都可能调整,正式版时间官方还没给。尝鲜没问题,但别把它当成长期稳定依赖。另外官方说的"视觉能力接近 Opus-4.8",出自 DeepSeek 自己的基准测试,参考就好,别当第三方结论。

文游和 RP 党能拿它干嘛

社区里已经玩起来的几个方向:

  • 给角色发表情包:6 月就有人在问"现在能发表情包玩吗",当时识图能力跟不上;现在 DeepSeek 能看图了,这条路才算真正走通。尽量用古早的、无归属问题的表情包或者自制图。小红书直接拿有版权的图喂模型,有侵权风险。

  • 让角色"看见"你:发穿搭照、桌面照、风景照,让 ta 按人设给反应,这是 RP 圈等了很多年的玩法。

  • 拿图当设定素材:世界观、场景氛围以前只能靠文字描述,现在可以直接丢图过去。

接好之后的效果大概是这样的——发一张图过去,模型会把画面内容、氛围细节一条条接住:

DeepSeek终于能看图了,但你的Chatbox不一定能:V4-Flash-Vision 接入、避坑和花钱账,一篇讲清

一个小提醒:这个模型默认开着思考模式。实测同一个"用一句话描述这张图"的任务,开着思考时输出在几十个到四百多个 token 之间浮动,关掉后只有二十个上下;总账能差出近一半,而看到的答案两边一样。知乎日常闲聊和轻松向的 RP,用不上它深度推理时,把思考关掉或调低,省钱还回得快。

花钱的账:图片很便宜,贵的是"长文复读"

先说结论:图片输入本身几乎可以忽略。 每张图封顶 384 token,按硅基流动输入 1 元/百万 token 算,发一百张图的输入成本也就几分钱。小红书

DeepSeek终于能看图了,但你的Chatbox不一定能:V4-Flash-Vision 接入、避坑和花钱账,一篇讲清

真正烧钱的还是老规矩:AI 没有记忆,每回一句都要把全部聊天记录重读一遍。 文游写到五万字,你每发一句十个字,模型就要重新读"五万字 + 十个字"。这是长文游越玩越贵的根本原因,跟这次的新模型没关系。

能省钱的机制是缓存命中:只要不改动前面的聊天内容、并且在缓存有效期内继续发,前面的内容就按缓存价复用。官方服务器一般会把前面的消息保存一小时左右,没改动的部分直接复用,这部分重叠的内容就是命中缓存,价格通常很低。小红书硅基流动的缓存命中价是 0.02 元/百万 token,只有正常输入价的 1/50。所以文游党的省钱习惯很朴素:别手欠改前文;隔了一两个小时再回来续写,就要做好这条消息按全价计费的准备。

走 DeepSeek 官方 API 的话还有峰谷价:谷时半价,峰时是北京时间 9:00–12:00 和 14:00–18:00,其余 17 个小时都按低价计。知乎用官方 API 跑长文游的话,晚上玩天然比白天便宜。

最后一句隐私提醒:缓存机制意味着聊天记录会在服务端暂存一段时间,真正私密的内容别跟 AI 讲;接中转站的话,所有消息还会经过第三方服务器,自己掂量。小红书

值得继续盯的信号

  • `-exp` 什么时候转正、定价会不会调整;

  • V4 Pro 的视觉版什么时候上(目前还是预览版);

  • Chatbox 什么时候兼容 Responses API 的思考模式;

  • v1.22.6 把"重新生成"改成了折叠分支,评论区骂声不小,可以留意下个版本会不会回调。

如果你已经在 Chatbox 里把识图跑通了,欢迎在评论区聊聊你的接法和玩法——这波坑,是先行者一个一个踩平的。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章