8月20日这一天,B站科技区被DeepSeek的灰测视频刷屏了。一句话生成一整座紫禁城、一句话做出GTA6风格的城市、一句话还原朱雀三号火箭回收的全过程——不是播片,不是录好的演示视频,而是模型现场写代码、现场渲染出来的、能拖动能交互的3D世界。评论区一片"核弹爆炸"“瘫坐”,但也有不少人在问:这到底是什么?我能玩到吗?一次要花多少钱?
我把这两天全网能找到的实测样本、评论区信息和时间线都翻了一遍,这篇给你讲清楚三件事:这波灰测到底造出了什么、它和上周刷屏的视频生成有什么本质区别、以及现在值不值得去"抽卡"。
先补时间线:这不是DeepSeek第一次灰测
对没跟上进度的朋友,先把前情提要补齐:
7月中旬,DeepSeek V4开启第一轮灰度测试,当时社区讨论的还是文本和代码能力;
8月13日,DeepSeek V4 Pro正式版上线,主打100万token上下文和三档推理强度,同日开源了Agent框架DeepSeekHarness,两天冲到10万+Star;
紧接着峰谷定价上线,API高峰价格大涨,这波涨价争议前几天已经聊过,不展开了;
8月19日下午,新一轮灰测被曝出。知乎上当天就冒出这样一个问题——如何看待8月19日下午DeepSeek被曝再次开始灰度测试,能力超过上次灰测?知乎
8月20日,灰测模型的"世界生成"能力集中爆发,B站一天之内冒出几十个实测视频。
注意两个关键词:灰测、新一轮。它不是正式发布,是DeepSeek把未发布模型小流量放到网页端和App里,随机路由给部分用户。你能不能遇到,纯看运气。
这波灰测到底能"造"出什么
我把8月20日B站播放量靠前的实测样本归拢了一下,基本能代表目前社区摸到的能力边界:
紫禁城:一句话生成整座紫禁城的可交互3D场景,763播放、18条评论,原作者把工程文件放到了网盘供下载;
微体素城市:包含数十种功能的体素城市,2538播放、41条评论;
朱雀三号火箭回收:电影级可交互HTML三维演示,完整还原起飞点火、级间分离、垂直着陆回收,3338播放、66条评论,是目前互动最高的样本之一。哔哩哔哩
池核(Poolrooms):一轮直出的泳池空间场景,水面、瓷砖、环境光全都在,作者实测总花费20元。哔哩哔哩
GTA6风格城市、全拟真坦克、纪念碑谷风格小游戏(还能一句话加关卡)、网页版杀戮尖塔、鬼泣5、魔方、变形金刚、黑洞、Minecraft……

这些样本有几个共同点,比"能生成什么"更值得注意:
第一,全是单轮或极少轮对话直出。社区叫它one-shot,一句提示词进去,一个完整可运行的交互式场景出来。
第二,零素材、全现场计算。池核作者在视频简介里写得很直白:没有渲染农场、没有美术外包,连显卡都是笔记本版3060,你看到的每块瓷砖、每丝水纹、池底的光斑,全是模型写的代码实时算出来的。哔哩哔哩
第三,可持续迭代。纪念碑谷那个样本,作者生成完游戏后又用一句话加了新关卡——它记得之前的结构。
有条评论总结得最到位——神秘的瞎子画画,聋子作曲,哑巴唱歌。哔哩哔哩因为这轮灰测模型大概率仍是文本模型,没有图像输入能力,却靠代码把三维空间、光影、物理感全"写"了出来。

关键区分:这不是视频生成,路线之争才是重点
上周大家还在讨论MiniMax H3和即梦的视频生成,这周DeepSeek灰测一出,很多人第一反应是"视频生成又进化了?"——其实完全不是一回事,这里必须掰清楚:
视频生成路线,产出的是像素流。你得到一个mp4,画面再真也是"录好的",不能交互、不能改。DeepSeek这波灰测产出的是代码,一个可运行的HTML/程序,你能拖动视角、触发机关、继续下指令修改。一个是给你看片,一个是给你造了个能进去的世界。
也正因为如此,评论区吵起来了,而且吵的点恰好是多模态领域最核心的路线之争:
一方认为:“生图和生视频的AI模型都是偏路,大语言模型性能上去后也一样能做,甚至更稳定。”——意思是不需要专门的多模态生成模型,文本模型强到一定程度,用代码就能"画"出世界,还自带工程文件,方便修改。
另一方马上反驳:"这玩意作为白模基底,然后交给视频生成模型进行重绘强化"才是正解——代码负责结构和交互,生成模型负责质感,两条路线是互补不是对立。
两边的论据都还停留在样本阶段,谁也没法说服谁。但行业层面已经有明确动向:36氪8月19日报道,姚顺雨正在重整腾讯多模态路线,方向是"从生成内容转向理解上下文并在世界中行动"。36氪8月20日另一篇报道里,AI游戏公司Spellcaster也明确说"从生成内容到生成世界,世界模型是下一站"。36氪再叠加正在北京开的世界机器人大会(WRC2026)上满场的具身智能,你会发现"世界模型"这个词这周出现的密度高得反常。
换句话说:这波灰测之所以炸,不只是因为效果炫,而是它踩在了多模态下一程的路线节点上——从"生成内容"到"生成世界"。
想去抽卡?先收下这份社区实测攻略
灰测是随机的,但社区已经把"怎么判断自己抽中"总结得很细了:
识别特征(多人交叉验证):新对话开头没有常规思考过程,直接以"I’ll"起手;思维链是英文的,常见"i am doing"“we need”"let me"句式;回传是分段式的,时不时卡一下。哔哩哔哩有用户补充:第一句输入会先卡一会儿,然后need to起手,标准模式+ProMax下更容易观察到。

抽中概率:今天的经验是同时最多有两个并行灰测通道,两个都结束后再抽中的概率就很低。本轮范围相对较广,有人试了3次就中,也有人抽了一下午啥都没遇到。DeepSeek这次被戏称"是个抽卡游戏"。
成本预期(重点):这轮灰测跑在涨价后的计费上。社区实测:跑一个简单的SVG图形接近5元;池核那种复杂场景一轮约20元;有人跑Minecraft跑了两个小时还没完。另外特别提醒一句:有用户实测子代理(SubAgent)模式下缓存命中率只有75%左右、输出token爆炸,“开一个挂一会回来看几百万输出天塌了”,想试的朋友别乱开高级功能。哔哩哔哩
效果预期:慢,是真的慢。一次构建20分钟起步,复杂场景按小时计。评论区最高赞的吐槽是"唯一问题,太太太慢了"。
两个争议,冷静看待
第一个争议:这真是DeepSeek自己的模型吗?评论区玩梗说"路由到Fable了"(Fable是Anthropic的模型,同一天也有消息称其在灰测Fable 5.1),这属于调侃,不必当真。小红书但有个真实疑问值得保留:多个深度用户明确说"这肯定不是V4 Pro 0813正式版,这个水平不可能是那个成绩"。哔哩哔哩也就是说,灰测模型和刚发布的正式版之间,确实存在明显能力差——这到底是新一代模型的预览,还是特殊调优的展示版,官方没说,先别下结论。

第二个争议:什么时候正式版?有B站评论区流传"员工群说8月上,价格要等华为卡上量才能降",这是未经证实的传言,看看就好。哔哩哔哩能确定的是:7月灰测的模型最终变成了8月13日的V4 Pro正式版,按这个节奏,本轮灰测大概率也是下一次正式发布的预告,但具体时间和形态,等官方。
三类人,三种动作
爱折腾的程序员/极客:值得花点小钱试试。这轮灰测对空间结构和代码一次性成型的能力,是目前正式版给不了的,5到20元的试错成本换第一手体感,不亏。建议关着SubAgent玩。
只用AI干活的普通用户:不用跟风排队。灰测慢、贵、随机,当个热闹看就行。真等它正式发布、进了日常对话入口,再用不迟。
盯着多模态路线的观察者:这波值得持续跟。三个信号帮你判断后续走向:一是灰测是否扩量甚至全量,二是API是否开放调用(8月19日灰测期间API一度不稳定),三是正式发布时有没有技术报告——如果报告里出现world model相关表述,那就不只是一次版本更新,而是国产模型向世界模型正面进发的信号。
最后说句实在话:上周我们还在算视频生成会员的账,这周"一句话造世界"就来了。多模态这条赛道,内容生成的账还没算完,世界生成的牌已经摸上来了。这次没抽中灰测也不要紧——正式版来的那天,才是真正要算账的时候。