刚涨完价,DeepSeek 反手送了两份大礼
DeepSeek 涨价的公告热度还没散,昨晚(8 月 21 日)连着落了两个炸点。晚上九点多,V4 系列第一个视觉模型 deepseek-v4-flash-vision-exp 悄悄出现在官方 API 文档里,DeepSeek 终于能"看图"了。紧接着官方又宣布,从 8 月 23 日 0 点起,周末全天不再区分峰谷,统一按谷价计费。涨价、送视觉、再给周末谷价,社区的反应比想象中欢乐,有微博高赞评论直接表态:周末全天谷价,认可双休,相当支持。微博
对 Harness 玩家来说,这一周的情绪其实是憋着的:Agent 框架都有了,模型却看不见图。所以这次大家的第一反应不是"又发新模型了",而是"官方的眼睛终于来了"。这篇文章把三件事说清楚:这双眼睛是什么、账怎么算、坑在哪。
这双"眼睛"是什么来头
先把硬事实摆出来。模型叫 deepseek-v4-flash-vision-exp,"Exp"代表实验版,官方没有发布技术报告,目前只有 API 能调,App 和网页端还没有图片入口。最关键的一个数字:一张图片最多占 384 个 token,计费价格与 V4-Flash 完全一致。新智元 官方页面给到的规格是 1M 上下文、最大输出 384K,支持 ToolCalls、JSON Output、Responses API 和 Anthropic API,图片按尺寸折算成 token 与文本一起计费。36氪
能力方面,加了视觉没有拖累文本。官方评测集里,它在七项 Agent 评测里有六项超过了同系的 V4-Flash-0731。新智元 视觉 Agent 评测对上 Claude Opus-4.8,成绩是 2 胜 2 负。哔哩哔哩 从下面这张官方评测表能看得更清楚:上半区七项是文本 Agent 任务,Terminal Bench 2.1 它拿到 83.9,和 Opus-4.8 的 85.0 只差一点;下半区四项是多模态 Agent 任务,Chartography 这种图表理解题它拿到 64.3。

算笔账:一千张图 1 块 1 是什么概念
先看别家怎么收。TokenMix 做过一个视觉 API 横评,同一张 1024×1024 的图,Claude Sonnet 4.6 要吃掉 1334 个 token、一千张图收 4 美元,GPT-5.4 Vision 是 765 个、1.9 美元,Gemini 3.1 Pro 已经算便宜的,258 个、0.5 美元。新智元 折成人民币,最贵那一档一千张图接近 29 块。
DeepSeek 这边给的是封顶值:384。价格与 Flash 相同,同样一千张图,输入成本峰值只要 1.15 元,谷时更是不到 6 毛。新智元 峰值差 25 倍,谷时差 50 倍。这不是折扣,是两种产品设计:29 块一千张,你会纠结"这一步到底值不值得看";1 块一千张,你可以让 Agent 每跑一步都截个屏。
谷价马上还要更香。官方口径是:从北京时间 2026 年 8 月 23 日 0 点起,周末(周六、周日)全天不再区分峰谷时段,统一按照低谷时段价格收取调用费用。哔哩哔哩微博 也就是说,从明天开始,批量跑图的活儿可以直接排在周六周日。
生态比官方还急
这是 Harness 玩家最关心的部分。就在上周,往 Harness 里传一张图,它会直接报错:MODEL_DOES_NOT_SUPPORT_IMAGES。36氪 V4-Flash 和 V4-Pro 在模型目录里都被声明为纯文本模型,图片连会话都进不去。社区只能自己想办法:有人在 DeepSeek 前面接一个别的视觉模型,先把图"翻译"成文字再交给它推理,有人干脆做出了视觉桥接插件。
官方其实早就埋好了伏笔。Harness rc.8 版本的 Release Notes 里,明确给模型适配器加了"配置启用原生图片请求"的能力,/goal、/plan 命令也跟着支持图文输入。36氪 模型上线当天,Harness 跟着发了 0.1.1,开箱即支持新模型,适配代码一行不用写。新智元 于是社区有人感慨:刚装上插件呢,官方的 eyes 就来了。

图片怎么进来,官方备了三条路:base64 内联、外部 URL,以及同步开放、完全免费的 Files API。新智元 传一次之后用 file_id 引用,同一张图反复看也不用重复上传。对要反复读同一份设计稿、同一张报表的 Agent 来说,这省下的是每一轮的往返成本。
三个坑,先看清楚再上手
坑一:分辨率上限 800×800。B 站早报视频下的热评说得很直白:这个多模态分辨率限制到 800*800,好像是训练时候规定的,稍微大一点的图就看不清。哔哩哔哩 评论区甚至衍生出了梗:梁文锋小时候家里的窗户只有 800×800 毫米,想看更大的空间,得把几扇窗拼起来。玩笑归玩笑,处理长截图、大图之前一定记得先切块,不然模型看到的和你想让它看的,可能根本不是一回事。
坑二:实验版身份。没有技术报告、没有公开的视觉 benchmark、只开了 API。早期实测的开发者还碰过小状况:image_url 请求一开始会报错,官方模型表和视觉接口随后才陆续补齐。36氪 按 DeepSeek 以往的节奏,实验版的问题修得快,但要把它接进关键流程,最好先观察几天。
坑三:它会看图,但不会生图。这次的多模态指的是视觉理解:截图、报表、网页图丢进去它能读懂,跟"文生图"完全是两码事。上线当天确实有用户在社区里问"为什么不能画图"——别搞混了,想生图得另请高明。
怎么上手,适合谁
Harness 玩家上手最简单:终端里跑 npx @deepseek-ai/dsh-web,浏览器打开 127.0.0.1:3080,就是熟悉的 Harness 主界面。用 Chatbox 这类客户端也能直接调:切换到 OpenAI 自定义模式,模型名填 deepseek-v4-flash-vision-exp,API 主机指向 api.deepseek.com。哔哩哔哩

按人群给个判断:
Harness 玩家、本地 Agent 搭建者:现在就能玩,生态当天跟进,谷时便宜;
批量 OCR、截图归档、文档解析:值得先跑个成本模型,一千张图几毛到一块出头的试错价;
成本敏感的开发者:明天起周末全天谷价,把批量任务排到周六日;
生产环境、等 App 端的用户:建议等一等,实验版稳定性要观察,800×800 的限制也可能调整。
接下来值得盯的信号
四个观察点:官方 App 和网页端会不会加图片入口,加上才算从 API 实验走向全量;800×800 分辨率上限会不会放开;周末谷价会不会固化成长期规则,这次调整距离 8 月 17 日峰谷计价开跑还不到一周,官方给的说法是根据用户反馈;以及视觉模型会不会补上技术报告。任何一条兑现,都意味着这波成本红利正从"窗口期"变成"稳定能力",到时候再把它接进自己的工作流也不迟。
最后说一句。这次发布真正狠的不是模型本身,而是两个数字的组合:图片 token 封顶 384,多模态与纯文本同价,周末还打折。当"看图"被定价到一千张几毛钱,限制你怎么用 AI 的,就不再是 token 账单了。