当前位置:
AIGC文章详情

1000张图别人收29元,DeepSeek只收1块1:V4-Flash-Vision-Exp上线,先算清这笔账再接入

源自95位全网作者

00:56

8月21日晚上,DeepSeek低调上线了一个分量不轻的东西:DeepSeek-V4-Flash-Vision-Exp,首个可通过API调用的多模态模型。新智元说低调,是因为没有发布会,官方只是更新了API文档,模型就直接可以调用了。说分量不轻,是因为它补上了DeepSeek生态一直缺的最后一块拼图——在此之前,开发者想让DeepSeek"看图",得自己再接一个视觉模型。

这件事其实有伏笔。今年4月底,DeepSeek先以灰度测试的方式上线了识图模式,6月在网页端和App全量开放,但面向开发者的多模态API,一直等到了今天。智东西等得有多急?上线前就有开发者自己写补丁:微博上流传的codex-deepseek-vision开源项目,在Codex和DeepSeek之间插一层本地代理,再借另一个能读图的模型帮忙看图,这条帖子拿到了83次转发。微博一个生态位缺不缺,看有没有人给它写民间补丁就知道了。

V4-Flash长出了"眼睛",但先看清它的身份

先把基本事实说清楚。这个模型基于DeepSeek-V4-Flash打造,模型名deepseek-v4-flash-vision-exp,后缀"Exp"说明它是实验性质版本,定位相当于之前的预览模型,目前已经上线DeepSeek API平台,即刻可调用。

1000张图别人收29元,DeepSeek只收1块1:V4-Flash-Vision-Exp上线,先算清这笔账再接入

能力方面,按DeepSeek公布的基准测试:纯文本能力(Agent、推理、世界知识等)与V4-Flash正式版持平。智东西在需要视觉理解的Agent基准测试上,新模型大幅超过原版V4-Flash,多模态Agent能力已接近Opus 4.8。微博不过先把丑话说在前面:「接近Opus 4.8」是DeepSeek自己的基准数据,模型上线才几个小时,社区的深度复测还没出来,这句话先别全额相信。

最值得看的不是能力,是这笔账

这次上线真正值得停下来看的,是DeepSeek又干了它最擅长的事:把别家要单独收费的能力,打成了"赠品价"。

计费规则很简单:图片先转成token,再和文本一起计费,单张图片封顶384个token,单价与V4-Flash完全一致。智东西算下来,高峰时段理解一张图最多0.001152元,1000张图约1.15元,谷时不到6毛。

1000张图别人收29元,DeepSeek只收1块1:V4-Flash-Vision-Exp上线,先算清这笔账再接入

第三方平台TokenMix做过一次视觉API横评,同一张1024×1024的图,各家模型的token消耗和价格差距一目了然。新智元

模型

单图token消耗

1000张图价格

Claude Sonnet 4.6

1334

4美元(约29元)

GPT-5.4 Vision

765

1.9美元

Gemini 3.1 Pro

258

0.5美元(约3.6元)

DeepSeek V4-Flash-Vision-Exp

封顶384

约1.15元(谷时不到0.6元)

和最贵的Claude差25倍,挪到谷时差50倍;即便和名单里最便宜的Gemini 3.1 Pro比,也还有3倍的成本优势。

对这个差距,一句评价值得咂摸:1000张图30块和1000张图1块钱,是两种产品设计。前者你得认真想清楚"这一步到底要不要看图",后者可以让Agent每跑一步都截个屏。新智元当成本压到这个量级,改变的不只是账单,是Agent的架构设计。

实测表现:复刻网页、一句话出PPT

上线几个小时,已经有人上手测了。有媒体丢给它一张OpenAI官网截图,要求1:1复刻成单文件HTML——布局、色值、交互、响应式全都要还原,结论是"简直一模一样"。随后又用一句模糊需求让它做精品咖啡烘焙工坊的B端合作PPT,它交出一份11页提案,五公斤起订、三档供货方案一样不落,全篇没有行业黑话。新智元

1000张图别人收29元,DeepSeek只收1块1:V4-Flash-Vision-Exp上线,先算清这笔账再接入

极客公园则拿它复刻了《牛来》小游戏,把原版画面截图和AI重制的SVG/CSS版本放在一起对比,角色姿态和字幕的还原度都相当可观。极客公园微博上,AI博主梁赛晒出用它制作黏土怪物风格动态特效的前端Mini Demo,并提到在需要视觉理解的Agent基准上,这版模型相比原版V4-Flash是"大幅跃升"。微博官方给的演示则是PPT生成(能理解"野性、原始、探索感"这类抽象风格要求)和视觉编程(给Harness官网二创加上玻璃UI、ASCII原子像素元素)。

周边生态也在同步就位:8月13日DeepSeek Harness开源,8月19日大版本更新主打多模态输入和子代理协作,8月21日又跟着新模型发了0.1.1版,模型适配器直接加入V4-Flash-Vision-Exp选项,原生支持图片请求,适配代码一行不用写。8天之内,运行时、输入端、工具链全部铺好,这个节奏说明今天的上线不是临时起意。

该不该接:分情况,别一刀切

接入方式几乎没有门槛:把模型名改成deepseek-v4-flash-vision-exp,其余请求照旧。API同时兼容Chat Completions、Messages、Responses三种格式;图片传入支持base64内联、外部URL、Files API三条路,其中同步上线的Files API免费——图片上传一次,之后凭file_id引用,对反复查看同一份设计稿、报表、截图的Agent来说,省的是每一轮的重复传输开销。智东西

但要不要现在就接,得分情况:

现在就可以试的:后端已经跑在V4-Flash上、目前靠第二个视觉模型拼图片理解的开发环境,可以直接砍掉一个模型简化链路;成本敏感的截图解析、表单识别、页面理解类非核心链路;已经在用DeepSeek Harness的Agent玩家。

建议再等等的:对稳定性要求高的核心业务链路,Exp是实验版,相当于预览模型,后续API行为可能变动。知乎等开源权重做本地部署的也要再观望,这次只有API,权重是否开源还没有消息。需要视频、音频理解的同样不适用,这次只有图像。

后续值得盯的三个信号

一是Exp何时转正,实验期多长,转正后纯文本能力是否保持;二是权重是否开源,如果开源,以DeepSeek的生态影响力,本地部署会多一个狠角色;三是「接近Opus 4.8」这个基准的第三方复测——官方数据需要独立验证,复测出来之前,投入别太重。

DeepSeek的一贯路数,是把别人卖高价的能力打成地板价。对成本敏感的开发者来说,这条消息不是刷过去就完的新闻,是一笔值得重新算的账。

内容由AI生成

精选参考来源

1. 刚刚,多模态版DeepSeek「长眼」了!1000张图只要1块钱

2. DeepSeek多模态模型终于来了!一张图最高只要0.001元

3. 我们知道deepseekv4flash的一大遗憾是它不是多模态的。这个项目可以让你在Codex中使用该模型时,体验和用多模态模型差不多。(当然需要提供另一个能读图的模型api)地址:github.com/Anionex/codex-deepseek-vision项目在Codex与原有DeepSeek上游之间插入127.0.0.1:19100代理;当用户贴图...全文

4. 【#DeepSeekV4视觉模型上线#】今日DeepSeekV4-Flash-Vision-Exp上线,开启多模态API服务,该模型为实验性质模型,纯文本能力与DeepSeek-V4-Flash正式版持平,视觉理解能力大幅提升,多模态Agent能力已接近Opus-4.8(IT之家)

5. DeepSeek上线多模态,我用它做了《牛来》小游戏|AI上新

6. 刚刚,DeepSeek发布多模态API服务。在需要视觉理解的AgentBenchmark上,DeepSeek-V4-Flash-Vision-Exp相比DeepSeek-V4-Flash实现了大幅跃升,多模态Agent能力已接近Opus-4.8。示例图2:制作黏土怪物风格动态特效的前端MiniDemo。提示模型在“一群可爱的3D黏土小怪物加入一个跃动的...全文

7. DeepSeek发布多模态实验版模型V4FlashVision

8. 刚刚,DeepSeek首个多模态模型发布!!

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章