科技深度

3DGS 进入直播、VR 与 AR:生产架构、落地案例与挑战

梳理 3DGS/4DGS 在体积直播、远程在场、VR、AR 和元宇宙空间资产中的真实进展,区分预录播放、研究原型、商业试点与规模化生产。

#3DGS · #4DGS · #体积视频 · #VR · #AR · #WebXR · #实时直播2026/3DGS-LIVE-XR-PRODUCTION

3DGS 在 XR 中最有价值的不是“帧率比 NeRF 高”,而是它第一次让真实空间和真人表演有机会成为可在消费级 GPU 上直接投影的三维媒体。用户不再只能看一张固定机位的视频,而可以轻微走动、转头、暂停并重新选择观看角度。

截至 2026 年 8 月,静态实景浏览已经接近成熟工具链;预录 4DGS 体积视频进入商业制作与早期分发;真正从摄像头到远端头显的低延迟 Gaussian 直播,仍主要存在于论文系统、专用 SDK 和受控部署中。

判断一项展示属于哪一层,比判断它“看起来是否实时”更重要。

先区分三种完全不同的“直播”

预录 4DGS 流媒体

表演先由多相机拍摄,之后离线重建、清理、压缩,再像视频点播一样分块发送。播放是实时的,采集和重建不是实时的。

它能提供最高画质和后期控制,适合演唱会、体育片段、影视和时尚内容。宣传中的“实时播放”如果没有说明 capture-to-display 延迟,通常属于这一类。

实时体积重建与传输

多目 RGB 或 RGB-D 在每一帧重建人物/场景,编码 Gaussian 或其增量,再传给客户端。这是真正意义上的体积直播,但采集标定、分割、重建、压缩和网络都必须在帧期限内完成。

可驱动 Avatar 状态直播

客户端预先拥有人物 canonical Gaussian,网络只传骨骼、表情、手势和少量外观 residual。它不是逐帧重建真人,但带宽和多人扩展性最好,适合社交 XR、虚拟主播和游戏。

这三种路线的真实感、自由度、延迟和可扩展性不同,不能用同一组“FPS”比较。

一条真正的端到端链路

多相机同步采集经过 Gaussian 重建编码、边缘分发,再到 XR 客户端双眼渲染的实时体积直播架构
渲染只是最后一段。采集同步、增量编码、网络抖动和客户端双眼预算共同决定直播是否可用。

采集端

多相机方案需要统一时间、曝光、色彩和几何标定。同步误差会把同一个动作变成多个时间切片,快速挥手、头发和衣服尤其容易撕裂。RGB-D 能直接提供几何,但深度噪声、遮挡边界和多相机融合仍需处理。

单目方法降低硬件门槛,却必须用人体或生成模型推测看不见的区域;视点离输入相机越远,结果越依赖先验而不是观测。

重建与编码端

系统不能每帧发送完整 PLY。常见策略包括:

  • 关键帧保存完整状态,中间帧只发送增量;
  • 分离稳定 canonical Gaussian 与时间形变;
  • 对位置、尺度、旋转、透明度和 SH 分别量化;
  • 按空间块、时间窗和重要性组织数据;
  • 只发送用户当前视野、距离和注视点需要的 LOD;
  • 网络变差时优先降低空间细节或时间更新频率。

V³ 把动态 Gaussian 组织成更接近二维视频的结构,以利用成熟硬件视频 codec,并提供多平台 player;SwinGS 使用滑动窗口组织长时序 Gaussian,论文原型还包含 WebGL Viewer。 SwinGS

这些方法证明“Gaussian 可以像媒体一样传输”,但编码器、容器、随机访问、码率控制和硬件解码生态仍没有达到 H.264/AV1 那样的通用程度。

客户端

客户端需要解码、上传 GPU、裁剪、排序和 splatting。VR 还要渲染左右眼,并对头部运动保持低延迟。AR 则要把 Gaussian 与实时相机画面、深度和锚点合成。

当网络短暂抖动时,普通视频可以继续显示旧帧;体积直播还要决定旧 Gaussian 是保持、外推还是淡出。处理不好会出现空间撕裂或人物局部停住。

研究已经走到哪一步

移动体积视频

V³ 和 SwinGS 的重点不是再提高一个离线画质指标,而是将动态 Gaussian 变成能被移动设备解码与播放的流。前者利用视频编码器,后者处理任意长度和滑动窗口,说明压缩和传输已成为独立研究主线。

实时 3D 视频通话

ICCV 2025 的 VoluMe 研究从 live Gaussian prediction 构建真实感 3D 视频通话,目标是绕过每个用户都需要长时间个体重建或大型多相机棚的问题。VoluMe

它代表了“普通视频输入 → 每帧预测三维表示”的路线。代价是可观察视角范围、不可见区域真实性和身份稳定性受模型先验约束,不能等同于完整 360° 实拍重建。

房间级远程在场

GaussianNexus 把静态 Gaussian 房间作为主要场景表示,再用 360° 视频和对象跟踪同步动态变化,避免每次变化都重新训练整个空间。这是一种很现实的混合设计:稳定环境预加载,动态区域走低延迟更新。GaussianNexus

VR:从“能显示”到“能舒适地显示”

VR 对帧率和时间稳定性比桌面浏览器严格得多:

  • 左右眼意味着更多投影、排序和像素合成;
  • 宽视场会放大投影近似与边缘畸变;
  • 用户快速转头会暴露 popping、floaters 和 temporal instability;
  • 低帧率和高 motion-to-photon latency 会直接影响舒适性;
  • 独立头显的功耗、带宽和热预算远低于桌面 GPU。

VR-Splatting 探索注视点渲染,将不同表示组合到中心视野与周边视野;VRSplat 直接针对 VR 中的 popping、投影失真和性能问题设计更稳健的 rasterization。VR-Splatting VRSplat

一个能说明端侧瓶颈的结果来自 Gaussian Blending Unit:论文报告原始 Gaussian 应用在 Jetson Orin NX 级边缘 GPU 上只有 7–17 FPS,并把像素级 Gaussian blending 识别为主要瓶颈。这个数字属于该论文测试配置,却提醒我们:桌面论文中的实时渲染不会自动迁移到独立头显。Gaussian Blending Unit

生产 VR 一般需要同时采用:

  • LOD 与空间分块;
  • 注视点或固定中心区域高质量渲染;
  • 左右眼共享可见性与排序工作;
  • 大 Gaussian/高 overdraw 控制;
  • 异步加载和内存预算;
  • 快速头动下的时间稳定测试。

AR:难点是让它正确进入现实

AR 不只要显示一个真实感对象,还要让它被现实桌面遮挡、落在正确尺度、随空间锚点稳定,并与真实光照一致。

原始 Gaussian 通常没有可靠表面和深度写入。PlayCanvas 官方渲染文档明确指出,其 Gaussian 组件不写 depth buffer;需要深度效果时可使用 Mesh 近似等 workaround。PlayCanvas Gaussian Renderers

因此 AR 的生产结构通常是:

Gaussian:真实外观
Mesh / Depth / SDF:遮挡、碰撞、测量
ARKit / ARCore / VPS:相机跟踪与世界锚点
Light Estimate / Probe:现实光照近似

Niantic Scaniverse 已把手机端 Gaussian 捕获、空间站点、VPS 地图、Mesh 与 Splat 生成放在同一采集体系中。这是静态空间资产和定位的实际产品化,不代表动态世界已经能持续实时重建。Scaniverse 文档

元宇宙方向最先落地的是“空间资产层”

“元宇宙”并不是一个可验收的技术指标。把需求拆开后,3DGS 当前真正能提供的是:

  • 低建模成本的真实地点复制;
  • 博物馆、校园、房产和工业空间浏览;
  • 真实人物、讲师和表演的体积内容;
  • 社交 XR 中比卡通 Avatar 更真实的远程在场;
  • 虚拟制作和游戏中的实景背景;
  • 可由浏览器和头显访问的空间媒体。

它还不能单独提供持久世界需要的对象逻辑、权限、交易、物理、语义、多人状态和内容治理。Gaussian 更像“真实世界的视觉资产层”,上方仍要叠加传统引擎和网络系统。

标准化开始补齐资产交换

早期生态存在大量互不完全兼容的 PLY、.splat、KSplat、SPZ 和运行时私有格式。2026 年 2 月,Khronos 发布 KHR_gaussian_splatting glTF 扩展 Release Candidate,为位置、旋转、尺度、透明度和球谐颜色建立基础表示。这是进入通用资产管线的重要一步,但 Release Candidate 仍不是最终 ratified 标准,动态时间编码、压缩和交互语义也不在基础扩展里。Khronos 公告

Niantic 的 SPZ 则解决静态 splat 压缩和跨实现编解码,并明确处理坐标系转换。官方仓库称其典型文件约为对应 PLY 的十分之一;实际项目仍应测自己的资产、SH 阶数与质量。SPZ

标准化的意义不只是扩展名统一,还包括:

  • 坐标轴、单位和变换继承;
  • SH 方向在坐标变换后的正确旋转;
  • 压缩版本和解码能力协商;
  • LOD、分块、流式索引和随机访问;
  • 静态与动态 Gaussian 的关系;
  • 许可、来源与内容元数据。

商业落地应该怎样解读

以下信息来自厂商官方页面,说明产品定位与公开能力,不等同于独立性能测评。

TEO:从 4DGS 制作到浏览器分发

TEO 描述了一条多相机捕获、4DGS 准备、云托管和 WebGL 播放链路,并明确称其 SPLATSTREAM 正从 proof of concept 发展为平台服务,正在邀请早期合作伙伴。这说明端到端基础设施已经出现,也说明它仍处于早期市场化阶段。TEO

Gracia:预录 4DGS 面向 Web、VFX 与头显

Gracia 将 4DGS 用于体积视频、VFX、WebXR、Meta Quest、Apple Vision Pro 和 PCVR。其核心更接近高质量多机位采集后的处理与分发,而不是普通用户手机到头显的即时直播。Gracia

Volum/HoloMIT:专用体积直播 SDK

HoloMIT 面向 Unity、Android、Meta Quest 和 OpenXR,官方页面宣称支持 RGB-D 体积人物、Gaussian/点云渲染、多用户会话,并给出约 150–300ms 端到端延迟、每相机 1–10Mbps 的公开规格。这些数字应在真实摄像头数量、画质、网络和设备上独立验收。HoloMIT SDK

生产成熟度矩阵

方向 当前状态 可用于什么 主要缺口
静态 3DGS Web/桌面浏览 已实用 展馆、房产、实景展示 大场景 LOD、语义和重光照
静态 3DGS VR 可部署 真实空间漫游、培训 独立头显性能、双眼稳定性
预录 4DGS 早期商业制作 表演、体育片段、影视/VFX 制作成本、长时序和通用分发
实时单人体积直播 研究系统与专用试点 远程讲师、会议、活动 采集棚、延迟、遮挡和带宽
单目 Gaussian 视频通话 高速发展的原型 消费级远程在场 可移动视角范围和不可见区域真实性
AR 实景 Splat 静态资产可用 导览、数字孪生、空间记录 深度、碰撞、动态更新和光照融合
多人动态“元宇宙” 早期探索 小规模社交与展演 标准、成本、物理、语义和治理

如果现在做一个 MVP

最可控的第一版不是“直播整个动态世界”,而是:

  1. 静态环境提前扫描、压缩并分块部署;
  2. 一名人物使用受控 RGB-D 或多机位采集;
  3. 服务端只编码人物和动态对象;
  4. 客户端预加载环境,实时接收人物 Gaussian 增量;
  5. Mesh/Depth proxy 负责 AR 遮挡、碰撞与阴影;
  6. 先支持 PCVR/Web 桌面,再收缩到独立头显;
  7. 从第一天记录端到端延迟、码率、丢包恢复和运动稳定性。

建议把预算拆开测量:

采集与同步
+ 前景分割 / 跟踪
+ Gaussian 预测或重建
+ 压缩与排队
+ 网络 RTT / jitter buffer
+ 解码与 GPU 上传
+ 左右眼 rasterization
= 用户实际感受到的延迟

只优化最后的 rasterizer,不会解决前面五段的延迟。

最难的挑战仍然是什么

  • 时间一致性:人物边缘、头发和快速运动不能每帧重新长出不同浮点;
  • 码率控制:网络变化时,需要像视频 codec 一样平滑退化;
  • 随机访问:用户拖动时间线、换视角和进入新空间时不能等待完整下载;
  • 端侧预算:排序、blending、双眼和热功耗同时受限;
  • 深度与交互:视觉真实不代表碰撞、遮挡和手部接触可靠;
  • 重光照:远端人物要融入本地环境,而不是携带原棚灯光;
  • 多人规模:人数增加时,采集、带宽、排序和像素 overdraw 都会上升;
  • 安全与真实性:真实人物体积直播涉及身份、肖像、录制同意和生成内容标识;
  • 标准和许可:格式可打开不代表动态、人体模型和商业权利互通。

结论:落地已经发生,规模化尚未发生

3DGS 已经在静态空间采集、浏览器查看、XR 漫游和虚拟制作中形成实用工具;4DGS 也开始进入体积视频制作、流媒体实验和远程在场 SDK。

但“可播放的三维片段”和“像普通直播一样稳定、低成本、万人并发”之间,仍隔着编码标准、采集成本、端侧性能、深度交互和内容治理。

最现实的产品路线是混合系统:静态 Gaussian 环境预加载,动态人物按增量或 Avatar 状态传输,Mesh/Depth 提供交互结构,传统网络引擎负责多人世界。3DGS 不需要替代整个图形和直播栈,它只需要在最擅长的地方——真实外观——成为新的媒体层。

参考资料