昨晚,一位科技博主在微博记录了北京 798 的《罗曼城唤醒计划》——汪苏泷演唱会主题的 XR 线下体验,180 度 3D 视频、大空间行走,再加上 4D 高斯泼溅,一套组合拳打下来,线下体验店第一次让人觉得"这项技术真的落地了"。微博
同样是昨天,B站"知天下AI"发布了旅行咖啡师叨叔用 3DGS 记录市井烟火的纪录片,片子里提到:中国的 3DGS 社区,已经汇聚了数千位活跃爱好者。B站
而今天,知乎上一篇《4D高斯泼溅是什么》的详解长文刷屏,副标题很直白:动态场景不再糊成鬼影。知乎这些信号指向同一件事:高斯泼溅这项技术,正在从"静态照片"走向"会动的影像"。但热闹归热闹,想跟风之前,得先泼几盆冷水。
先辨"水分":那条4.6万播放的爆款,为什么老玩家说它不是高斯泼溅
7月中旬,一条名为《核爆之作——deepseekv4一句话生成3D相机(基于3D高斯泼溅)》的视频在B站爆了:4.6万播放、1200多赞。UP主称用大模型写代码,花三小时把一张照片变成可以转动的3D场景,还直接输出了手机 APK。看起来很燃,但评论区却是另一番景象。一条183赞的高赞评论先给拍摄和代码质量正了名,紧接着更多人直接质疑技术路线:“深度图转gs,不是真的gs采集”、“这个不是3dgs,是单纯点云吧,3dgs是那种半透明椭球”、“弹幕都当成AI建模了,这就是代码计算深度”。B站这些争论背后,是一个大众最容易混淆的常识:如今"手机上能转的3D",大致来自三条完全不同的路线。
第一条是单目深度反投影:模型从一张照片估算深度图,把像素按深度"推"进三维空间。速度快、门槛低,但本质是单视角的"伪3D",转到背面就容易露馅。那条爆款视频走的更接近这条线。第二条是摄影测量:几十上百张照片解算出网格模型,是商单交付的传统主力。第三条才是真正的高斯泼溅:用数百万个半透明高斯椭球表达场景,渲染出照片级的光影,代价是必须绕着物体多视角拍摄。
以后再看类似演示,可以先问一句:拍摄时绕着物体走了几圈?只靠一张照片就"立体"的,大概率是深度估计在干活。这个判断方法,能帮你过滤掉一大半标题党。
真实的进展:从"鬼影"到"会动",从实验室到能跑
那真·4D 高斯泼溅(4DGS)现在走到哪一步了?结论先说:研究侧帧率三年翻了一个数量级,工具侧出现了免费实时渲染插件,落地侧已经进了线下体验店和 VR 头显。
先说速度。3DGS 的高斯椭球只描述"某个瞬间的空间",不记录"下一秒它去哪了",所以拍到的行人和车辆会糊成鬼影。4DGS 的思路,是给同一套高斯接上"时间变形场"——好比给木偶拴上一套提线,木偶只存一套,提线控制它每一刻怎么动。知乎

这条路线的进化速度很可观:华中科技大学的 4D-GS 率先打通,开源仓库攒下3800多个 star,RTX 3090 上 800×800 分辨率跑动态场景能到 70~82 FPS;SIGGRAPH 2024 的 4D-Rotor GS 换用 4D XYZT 高斯表示,CUDA 实现在 RTX 3090 上跑 277 FPS,RTX 4090 离屏渲染能到 583 FPS;到了新加坡国立大学的 4DGS-1K,帧率推过 1000 FPS,还靠剪枝把存储压掉 41 倍。知乎

这些数字意味着,4DGS 已经跨过"实时回放"的门槛,瓶颈正从"能不能动"变成"动得久不久、稳不稳"。
研究侧还有一条值得单独说的线:生成模型进场了。SIGGRAPH 2026 上,英伟达发布的 ArtiFixer 瞄准的是高斯泼溅的老毛病——只会内插、不会外推:没拍到的视角,渲染出来就露馅。知乎它的做法是借自回归扩散模型的视频生成能力,把初始重建的渲染结果、每个像素"已有信息多可靠"的不透明度信号,连同相机光线一起喂给扩散模型,让模型把没拍到的视角"长"出来。三维重建,开始借用生成模型的想象力补盲区。

再看工具。7月下旬,一款免费的 4DGS Unity 实时渲染插件发布,兼容 Unity 6 和 Pico、Quest 等主流安卓 VR 一体机,4DGS 资产导入即播。知乎作者还给出 Pico 4U 真机的帧率底线:2万高斯点 72 FPS 以上,3万点 60 FPS,8万以上掉到 30 FPS 以下——做场景前先按这个表做点数预算。短板也写得很清楚:iOS、visionOS、小游戏暂不支持。

传统软件也在跟进:摄影测量老牌软件 3DF Zephyr 的 V9 版本,直接把高斯泼溅集成进更新,连更便宜的 Lite 版都有份。微博测绘向的 LiDAR360 V10.0,进阶课已经讲到"空地融合高斯重建"。信号很明确:高斯泼溅正在从研究玩具,变成工具链里的标配功能。
落地案例同样在冒头:除了 798 的 XR 体验店,今年 4 月B站那条《4D高斯泼溅制作的虚拟人,分的清真假吗》拿到 2 万多播放,收藏数比点赞还高——大家不急着夸,先默默存下来等技术成熟。B站文化遗产是另一个走得更快、也更稳的场景:8 月初,敦煌悬泉置遗址的文物数字化保护工程公布成果——无人机航拍加高精度三维测绘,把坞院、传舍、马厩、瞭望台等全部建筑遗存完整采集,做出遗址 1:1 数字复原,虚拟游览线上线下同步开放。中新网
要不要跟?分三种人给三张路线表
看到这里,真正该回答的问题是:现在进场,值不值?按三种人拆开看。
纯看党:现在正是好窗口。B站的高斯泼溅标签、VRChat 社区房间、PICO 内容生态,3DGS/4DGS 内容都在肉眼可见地变多。看是零成本的,先把"自由视角回放"到底什么感觉建立起来,比急着下手更重要。
动手党:先想清楚再训练。4DGS 这条线目前还停在 PyTorch + CUDA 的研究栈,没有 Windows 一键版;长序列、大幅运动仍是硬骨头,动态物体分割一旦失效,结果直接崩。但如果你已经跑通静态 3DGS 工作流,跟进成本并不高:华中科技大学的开源仓库就在那,也有 Instant4D 这类从单目视频出发、几分钟重建动态场景的轻量方案。GitHub拿家里猫主子或一段十秒的街头视频先试,别先掏钱买设备。

做项目党:上面那组帧率就是预算表。Pico 这类移动端一体机,点数压在 3 万以内才稳;Windows 端可以放宽。插件目前只支持 Windows DX12/Vulkan 和 Android Vulkan,如果你的内容面向 iOS 或 visionOS,这条线暂时别排期。
值得盯的三个信号
最后给三个我自己会持续跟踪的信号,任何一个兑现,4DGS 才算真正进入"普通玩家可用"阶段:
一是 Windows 甚至移动端的一键式 4D 训练工具出现,把 PyTorch + CUDA 的门槛拆掉;二是 iOS、visionOS 支持解禁,苹果空间视频生态是这项技术最大的放大器;三是消费级设备的实时动态采集——现在做动态重建,要么多机位阵列,要么单目视频靠算法"脑补",都还轮不到普通用户。
至于那条"一句话生成3D相机"的爆款,不必嘲笑也不必兴奋:大模型写代码做3D是真实在推进的方向,但它和高斯泼溅暂时还是两回事。
高斯泼溅越来越像一台"冲印时间"的相机:静态版已经能把街角、手办、老家房子留下来,动态版正在把记忆从"一张照片"变成"一段时光"。技术在往前跑,而值得记录的东西,从来都在手边。