内测接口 9 月 10 日就下线:DeepSeek V4.1 Flash 这 48 小时,先跑完四件事,再看穿一个试探

源自223位全网作者

04:45

模型名就叫 `deepseek-v4.1-flash-expires-on-0910`——DeepSeek 这次连倒计时都直接写进了接口名。

9 月 8 日下午,DeepSeek 没有发布会、没有预热、没有更新官网 Changelog,只在官方交流群里丢了一条消息:V4.1 Flash 中间版本开启内测。官方原话四点:新的模型结构、原生多模态支持、能力更强、速度更快、成本更低。小红书计费暂时与 V4-Flash 完全一致,把模型名换掉就能调用,API Key 和 base_url 都不用动。36氪有知乎答主翻完公告后下了个判断:这不是一次发布,是一次试探。知乎

内测接口 9 月 10 日就下线:DeepSeek V4.1 Flash 这 48 小时,先跑完四件事,再看穿一个试探

如果你本来就是拿 V4-Flash 跑 Agent、跑批处理、搞副业调用的人,这个周末(9 月 10 日接口到期)就是全部的窗口期。这篇帮你把 48 小时该怎么花、以及这场"限时体验卡"背后真正在测什么,一次说清。

一、先搞清楚:这次"原生多模态"补的是哪块短板

DeepSeek 的多模态一直是被吐槽最久的地方。8 月 21 日上线的 V4-Flash-Vision-Exp 是"外挂式"方案:在纯文本基座上叠一层视觉编码器和一个对齐器,文字和图像中间隔了一层翻译,一次任务里既要读文档又要看图,就得在文本模型和视觉模型之间来回切换、搬运上下文。知乎做过 Agent 的都懂这种链路的痛:多一次切换,就多一截延迟和一层错误率。

这次 V4.1 Flash 的"原生多模态",按内测上手文章的解读,是视觉能力直接嵌进主干网络、训练时就一起喂多模态数据——图文进同一个脑子,不再是"文字秘书+图像专员"的组合。对普通用户的体感差别不在"能看图",而在于截图→理解→调工具这条链路少了一次模型交接

注意两个尚未坐实的边界:官方公告只说了"原生多模态支持",没有明确包含哪些模态(此前有资料提到 V4.1 计划覆盖文本、图像、音频三种输入,但这轮内测是否开放了音频,还要等实测);B 站首批测评也明确指出该版本暂不支持视频,只测了图片。哔哩哔哩

二、跨平台汇总一天的实测:速度、翻车、和一条"不像同一个系列"的感受

内测开放不到 24 小时,各平台的自测已经攒出一份样本量不小的分布,这里替你看全:

速度:小红书用户报出稳定 260 token/s、“200-300 之间”、“500+ token/s”,B 站测评给的是 400+ token/s,X 上独立反馈在 200+。一天之内这些数字从 200 一直散布到 500+——差异主要来自调用时段(峰谷期带宽不同)、任务长度和测试方法,没有任何一个数字是官方口径,别拿单次跑分下结论,但"比老 V4-Flash 明显快"是几乎所有一致方向。哔哩哔哩有用户形容过去是"一行一行往外吐",现在是"涌出来"。小红书

内测接口 9 月 10 日就下线:DeepSeek V4.1 Flash 这 48 小时,先跑完四件事,再看穿一个试探

看图能力:被转发最多的实测是把一张手写笔记照片还原成 LaTeX 文档——手写字符、公式、彩色高亮、随手画的几何示意图,旧版 Vision-Exp 高亮还原不全、图画歪,V4.1 Flash 一轮基本还原,连示意图的透视关系都翻成了 TikZ 坐标;当然也翻车,有人测出多画了一条射线的情况。知乎"鹈鹕骑自行车"这个社区老梗图照例成了标配考题,通过率成了大家晒图的主要谈资。

内测接口 9 月 10 日就下线:DeepSeek V4.1 Flash 这 48 小时,先跑完四件事,再看穿一个试探

反面样本同样存在:有学生党用余额跑完的真实评价是"感觉一般,但是快"。小红书有人把模型名换成 v4.1 问它是谁,结果它回答自己是 Claude。知乎 这种中间版本的自认知混乱,本身也是"没当正式版本看"的证据之一。

三、真正的信息量在问卷里:Flash 在试探吃掉 Pro

比模型本身更值得看的,是内测同时发出的那份反馈问卷。腾讯科技查证到,那份问卷直接询问测试用户,V4.1 Flash 这个中间版本能否全面替换线上的 DeepSeek V4 Pro。36氪

内测接口 9 月 10 日就下线:DeepSeek V4.1 Flash 这 48 小时,先跑完四件事,再看穿一个试探

配合两个细节一起读:第一,限流每账号 20 并发——正式版是 2500 并发,这个数字摆明了不让你拿它压产线,就是让你验功能、填问卷。知乎 第二,截至发稿,36氪查证官网、API 文档、Changelog 里都查不到这条发布记录。三者拼起来,这轮内测的设计意图很清楚:DeepSeek 在测试用便宜的 Flash 档位吃掉 Pro 的份额。36氪在能力榜单上,V4 系列的排名最近确实尴尬(9 月 8 日的 AA 对比里,综合头名是 Fable 5.1、编码强项是 GPT-6 Astra),正面上不去,就用"成本更低的完全体工作模型"换赛道——过去 Flash 是"便宜的文本模型",现在它想当"文本+图像+Agent 的中间层主力"。

四、同一天还藏了一轮降价:注意 9 月 10 日 12:00 这个时点

降价公告和内测是同一天发的,容易被刷屏消息盖过去。据小红书和知乎多方交叉核对:新价格从 9 月 10 日 12:00 起执行,Flash 系列闲时每百万 Token:

项目

原价

新价

降幅

输入(缓存未命中)

1.5 元

1 元

约 33%

输出

4.5 元

4 元

约 11%

输入(缓存命中)

0.05 元

0.02 元

60%

高峰时段(工作日 9:00-12:00、14:00-18:00)按闲时两倍计费,即输入 2 元、输出 8 元、缓存命中 0.04 元。小红书覆盖范围应包括 v4-flash、v4-flash-vision-exp 以及内测中的 v4.1-flash。

这里有个很多攻略没提醒的时间差:内测模型名本身 9 月 10 日到期,而新价 9 月 10 日 12:00 才生效——也就是说,这张"限时体验卡"大概率享受不到降价的正式期,真正吃到新价格的是继续在线上的 V4-Flash 和 Vision-Exp。有答主对比后发现,就算降到新价,缓存命中这一项上还是 V4-Flash 更便宜。如果你的成本结构里缓存命中占大头,换模型前先看清这张表。知乎

内测接口 9 月 10 日就下线:DeepSeek V4.1 Flash 这 48 小时,先跑完四件事,再看穿一个试探

五、48 小时行动清单:测什么、别做什么、盯什么

花窗口期测这四件事(都是 20 并发内就能跑完的):

  1. 拿你最脏的真实任务测图:截图报错→修复、手写体→结构化、表格照片→数据。不要只丢鹈鹕梗图,原生多模态的增量恰恰在"图→可用输出"的完整链路。

  2. 跑一遍你线上 Agent 的长链路:多轮工具调用最容易在新架构上退化——能力涨了稳定性掉,是换架构最经典的坑,这是官方 benchmark 不会告诉你的部分。

  3. 测一次"少切一次模型"到底省了多少:把你现在"视觉模型+文本模型"的两段式流程硬塞进单模型跑同一任务,记录端到端延迟和中间上下文丢失的情况,这决定转正后你值不值得重构管线。

  4. 顺手填那份问卷:官方在问"能否替代 Pro",你填的真实场景比任何榜单都影响转正决策。

三件别做的事:别把这个模型名写进生产配置硬编码(名字自带 expires,到期即失效);别拿 20 并发去压测还怪限流(这不是给产线开的口子);别把"400/500 token/s"当 SLA 写进给客户的报价。

转正前盯三个信号:9 月 10 日后官方有没有新模型名或转正公告;降价是否如期在 12:00 落地到 Flash 全系;后续是否放出"新模型结构"的技术细节(以及音频模态的实测)。

谁现在就该动手,谁可以等

已经在用 Flash 档跑图文混合任务、Agent 管线里"看图"和"干活"分属两个模型的——这 48 小时值得全部花进去,测完填问卷,等转正公告第一时间切。只把 DeepSeek 当纯文本问答用的,这轮更新和你无关,等降价生效账单变薄就行。在等 Pro 降价的规模化用户,先看问卷结果——如果 Flash 被官方确认能接住多数场景,Pro 的定价逻辑反而是下一个要变的。

鲸鱼换了骨架游得更快了,但 9 月 10 日之前,它只是一张写着 ADMIT ONE 的体验票。票要刷,别站着看。

内容由AI生成
3
扫一下,分享更方便,购买更轻松
1评论

  • 精彩
  • 最新
  • 模型参数不够

    校验提示文案

    提交
提示信息

取消
确认
评论举报

最新文章 热门文章