3DGS 进入直播、VR 与 AR:生产架构、落地案例与挑战
梳理 3DGS/4DGS 在体积直播、远程在场、VR、AR 和元宇宙空间资产中的真实进展,区分预录播放、研究原型、商业试点与规模化生产。
3DGS 在 XR 中最有价值的不是“帧率比 NeRF 高”,而是它第一次让真实空间和真人表演有机会成为可在消费级 GPU 上直接投影的三维媒体。用户不再只能看一张固定机位的视频,而可以轻微走动、转头、暂停并重新选择观看角度。
截至 2026 年 8 月,静态实景浏览已经接近成熟工具链;预录 4DGS 体积视频进入商业制作与早期分发;真正从摄像头到远端头显的低延迟 Gaussian 直播,仍主要存在于论文系统、专用 SDK 和受控部署中。
判断一项展示属于哪一层,比判断它“看起来是否实时”更重要。
先区分三种完全不同的“直播”
预录 4DGS 流媒体
表演先由多相机拍摄,之后离线重建、清理、压缩,再像视频点播一样分块发送。播放是实时的,采集和重建不是实时的。
它能提供最高画质和后期控制,适合演唱会、体育片段、影视和时尚内容。宣传中的“实时播放”如果没有说明 capture-to-display 延迟,通常属于这一类。
实时体积重建与传输
多目 RGB 或 RGB-D 在每一帧重建人物/场景,编码 Gaussian 或其增量,再传给客户端。这是真正意义上的体积直播,但采集标定、分割、重建、压缩和网络都必须在帧期限内完成。
可驱动 Avatar 状态直播
客户端预先拥有人物 canonical Gaussian,网络只传骨骼、表情、手势和少量外观 residual。它不是逐帧重建真人,但带宽和多人扩展性最好,适合社交 XR、虚拟主播和游戏。
这三种路线的真实感、自由度、延迟和可扩展性不同,不能用同一组“FPS”比较。
一条真正的端到端链路
采集端
多相机方案需要统一时间、曝光、色彩和几何标定。同步误差会把同一个动作变成多个时间切片,快速挥手、头发和衣服尤其容易撕裂。RGB-D 能直接提供几何,但深度噪声、遮挡边界和多相机融合仍需处理。
单目方法降低硬件门槛,却必须用人体或生成模型推测看不见的区域;视点离输入相机越远,结果越依赖先验而不是观测。
重建与编码端
系统不能每帧发送完整 PLY。常见策略包括:
- 关键帧保存完整状态,中间帧只发送增量;
- 分离稳定 canonical Gaussian 与时间形变;
- 对位置、尺度、旋转、透明度和 SH 分别量化;
- 按空间块、时间窗和重要性组织数据;
- 只发送用户当前视野、距离和注视点需要的 LOD;
- 网络变差时优先降低空间细节或时间更新频率。
V³ 把动态 Gaussian 组织成更接近二维视频的结构,以利用成熟硬件视频 codec,并提供多平台 player;SwinGS 使用滑动窗口组织长时序 Gaussian,论文原型还包含 WebGL Viewer。V³ SwinGS
这些方法证明“Gaussian 可以像媒体一样传输”,但编码器、容器、随机访问、码率控制和硬件解码生态仍没有达到 H.264/AV1 那样的通用程度。
客户端
客户端需要解码、上传 GPU、裁剪、排序和 splatting。VR 还要渲染左右眼,并对头部运动保持低延迟。AR 则要把 Gaussian 与实时相机画面、深度和锚点合成。
当网络短暂抖动时,普通视频可以继续显示旧帧;体积直播还要决定旧 Gaussian 是保持、外推还是淡出。处理不好会出现空间撕裂或人物局部停住。
研究已经走到哪一步
移动体积视频
V³ 和 SwinGS 的重点不是再提高一个离线画质指标,而是将动态 Gaussian 变成能被移动设备解码与播放的流。前者利用视频编码器,后者处理任意长度和滑动窗口,说明压缩和传输已成为独立研究主线。
实时 3D 视频通话
ICCV 2025 的 VoluMe 研究从 live Gaussian prediction 构建真实感 3D 视频通话,目标是绕过每个用户都需要长时间个体重建或大型多相机棚的问题。VoluMe
它代表了“普通视频输入 → 每帧预测三维表示”的路线。代价是可观察视角范围、不可见区域真实性和身份稳定性受模型先验约束,不能等同于完整 360° 实拍重建。
房间级远程在场
GaussianNexus 把静态 Gaussian 房间作为主要场景表示,再用 360° 视频和对象跟踪同步动态变化,避免每次变化都重新训练整个空间。这是一种很现实的混合设计:稳定环境预加载,动态区域走低延迟更新。GaussianNexus
VR:从“能显示”到“能舒适地显示”
VR 对帧率和时间稳定性比桌面浏览器严格得多:
- 左右眼意味着更多投影、排序和像素合成;
- 宽视场会放大投影近似与边缘畸变;
- 用户快速转头会暴露 popping、floaters 和 temporal instability;
- 低帧率和高 motion-to-photon latency 会直接影响舒适性;
- 独立头显的功耗、带宽和热预算远低于桌面 GPU。
VR-Splatting 探索注视点渲染,将不同表示组合到中心视野与周边视野;VRSplat 直接针对 VR 中的 popping、投影失真和性能问题设计更稳健的 rasterization。VR-Splatting VRSplat
一个能说明端侧瓶颈的结果来自 Gaussian Blending Unit:论文报告原始 Gaussian 应用在 Jetson Orin NX 级边缘 GPU 上只有 7–17 FPS,并把像素级 Gaussian blending 识别为主要瓶颈。这个数字属于该论文测试配置,却提醒我们:桌面论文中的实时渲染不会自动迁移到独立头显。Gaussian Blending Unit
生产 VR 一般需要同时采用:
- LOD 与空间分块;
- 注视点或固定中心区域高质量渲染;
- 左右眼共享可见性与排序工作;
- 大 Gaussian/高 overdraw 控制;
- 异步加载和内存预算;
- 快速头动下的时间稳定测试。
AR:难点是让它正确进入现实
AR 不只要显示一个真实感对象,还要让它被现实桌面遮挡、落在正确尺度、随空间锚点稳定,并与真实光照一致。
原始 Gaussian 通常没有可靠表面和深度写入。PlayCanvas 官方渲染文档明确指出,其 Gaussian 组件不写 depth buffer;需要深度效果时可使用 Mesh 近似等 workaround。PlayCanvas Gaussian Renderers
因此 AR 的生产结构通常是:
Gaussian:真实外观
Mesh / Depth / SDF:遮挡、碰撞、测量
ARKit / ARCore / VPS:相机跟踪与世界锚点
Light Estimate / Probe:现实光照近似
Niantic Scaniverse 已把手机端 Gaussian 捕获、空间站点、VPS 地图、Mesh 与 Splat 生成放在同一采集体系中。这是静态空间资产和定位的实际产品化,不代表动态世界已经能持续实时重建。Scaniverse 文档
元宇宙方向最先落地的是“空间资产层”
“元宇宙”并不是一个可验收的技术指标。把需求拆开后,3DGS 当前真正能提供的是:
- 低建模成本的真实地点复制;
- 博物馆、校园、房产和工业空间浏览;
- 真实人物、讲师和表演的体积内容;
- 社交 XR 中比卡通 Avatar 更真实的远程在场;
- 虚拟制作和游戏中的实景背景;
- 可由浏览器和头显访问的空间媒体。
它还不能单独提供持久世界需要的对象逻辑、权限、交易、物理、语义、多人状态和内容治理。Gaussian 更像“真实世界的视觉资产层”,上方仍要叠加传统引擎和网络系统。
标准化开始补齐资产交换
早期生态存在大量互不完全兼容的 PLY、.splat、KSplat、SPZ 和运行时私有格式。2026 年 2 月,Khronos 发布 KHR_gaussian_splatting glTF 扩展 Release Candidate,为位置、旋转、尺度、透明度和球谐颜色建立基础表示。这是进入通用资产管线的重要一步,但 Release Candidate 仍不是最终 ratified 标准,动态时间编码、压缩和交互语义也不在基础扩展里。Khronos 公告
Niantic 的 SPZ 则解决静态 splat 压缩和跨实现编解码,并明确处理坐标系转换。官方仓库称其典型文件约为对应 PLY 的十分之一;实际项目仍应测自己的资产、SH 阶数与质量。SPZ
标准化的意义不只是扩展名统一,还包括:
- 坐标轴、单位和变换继承;
- SH 方向在坐标变换后的正确旋转;
- 压缩版本和解码能力协商;
- LOD、分块、流式索引和随机访问;
- 静态与动态 Gaussian 的关系;
- 许可、来源与内容元数据。
商业落地应该怎样解读
以下信息来自厂商官方页面,说明产品定位与公开能力,不等同于独立性能测评。
TEO:从 4DGS 制作到浏览器分发
TEO 描述了一条多相机捕获、4DGS 准备、云托管和 WebGL 播放链路,并明确称其 SPLATSTREAM 正从 proof of concept 发展为平台服务,正在邀请早期合作伙伴。这说明端到端基础设施已经出现,也说明它仍处于早期市场化阶段。TEO
Gracia:预录 4DGS 面向 Web、VFX 与头显
Gracia 将 4DGS 用于体积视频、VFX、WebXR、Meta Quest、Apple Vision Pro 和 PCVR。其核心更接近高质量多机位采集后的处理与分发,而不是普通用户手机到头显的即时直播。Gracia
Volum/HoloMIT:专用体积直播 SDK
HoloMIT 面向 Unity、Android、Meta Quest 和 OpenXR,官方页面宣称支持 RGB-D 体积人物、Gaussian/点云渲染、多用户会话,并给出约 150–300ms 端到端延迟、每相机 1–10Mbps 的公开规格。这些数字应在真实摄像头数量、画质、网络和设备上独立验收。HoloMIT SDK
生产成熟度矩阵
| 方向 | 当前状态 | 可用于什么 | 主要缺口 |
|---|---|---|---|
| 静态 3DGS Web/桌面浏览 | 已实用 | 展馆、房产、实景展示 | 大场景 LOD、语义和重光照 |
| 静态 3DGS VR | 可部署 | 真实空间漫游、培训 | 独立头显性能、双眼稳定性 |
| 预录 4DGS | 早期商业制作 | 表演、体育片段、影视/VFX | 制作成本、长时序和通用分发 |
| 实时单人体积直播 | 研究系统与专用试点 | 远程讲师、会议、活动 | 采集棚、延迟、遮挡和带宽 |
| 单目 Gaussian 视频通话 | 高速发展的原型 | 消费级远程在场 | 可移动视角范围和不可见区域真实性 |
| AR 实景 Splat | 静态资产可用 | 导览、数字孪生、空间记录 | 深度、碰撞、动态更新和光照融合 |
| 多人动态“元宇宙” | 早期探索 | 小规模社交与展演 | 标准、成本、物理、语义和治理 |
如果现在做一个 MVP
最可控的第一版不是“直播整个动态世界”,而是:
- 静态环境提前扫描、压缩并分块部署;
- 一名人物使用受控 RGB-D 或多机位采集;
- 服务端只编码人物和动态对象;
- 客户端预加载环境,实时接收人物 Gaussian 增量;
- Mesh/Depth proxy 负责 AR 遮挡、碰撞与阴影;
- 先支持 PCVR/Web 桌面,再收缩到独立头显;
- 从第一天记录端到端延迟、码率、丢包恢复和运动稳定性。
建议把预算拆开测量:
采集与同步
+ 前景分割 / 跟踪
+ Gaussian 预测或重建
+ 压缩与排队
+ 网络 RTT / jitter buffer
+ 解码与 GPU 上传
+ 左右眼 rasterization
= 用户实际感受到的延迟
只优化最后的 rasterizer,不会解决前面五段的延迟。
最难的挑战仍然是什么
- 时间一致性:人物边缘、头发和快速运动不能每帧重新长出不同浮点;
- 码率控制:网络变化时,需要像视频 codec 一样平滑退化;
- 随机访问:用户拖动时间线、换视角和进入新空间时不能等待完整下载;
- 端侧预算:排序、blending、双眼和热功耗同时受限;
- 深度与交互:视觉真实不代表碰撞、遮挡和手部接触可靠;
- 重光照:远端人物要融入本地环境,而不是携带原棚灯光;
- 多人规模:人数增加时,采集、带宽、排序和像素 overdraw 都会上升;
- 安全与真实性:真实人物体积直播涉及身份、肖像、录制同意和生成内容标识;
- 标准和许可:格式可打开不代表动态、人体模型和商业权利互通。
结论:落地已经发生,规模化尚未发生
3DGS 已经在静态空间采集、浏览器查看、XR 漫游和虚拟制作中形成实用工具;4DGS 也开始进入体积视频制作、流媒体实验和远程在场 SDK。
但“可播放的三维片段”和“像普通直播一样稳定、低成本、万人并发”之间,仍隔着编码标准、采集成本、端侧性能、深度交互和内容治理。
最现实的产品路线是混合系统:静态 Gaussian 环境预加载,动态人物按增量或 Avatar 状态传输,Mesh/Depth 提供交互结构,传统网络引擎负责多人世界。3DGS 不需要替代整个图形和直播栈,它只需要在最擅长的地方——真实外观——成为新的媒体层。