当 3D 不再只是离线建模出来的城市或物体,而是要实时地跟着一个人跑、跟着一个房间转、跟着一次直播传输给成千上万的设备时,问题就从”AI 能不能生成一个 3D 世界”落到了另一个更为朴素的问题:这个 3D 世界,能不能装得下、传得动、跑得起来。论文给它的定位写得很克制:让 3D 人体表示(3D human representations)变得更加紧凑,目标场景是沉浸式直播(immersive live streaming)。浙大这边,是长期深耕 3D 视觉、计算机图形学和几何方向的团队,包括 Hujun Bao、Sida Peng、Xiaowei Zhou 等研究者,他们在 3DGS、可微渲染、点云学习这一串技术栈上有非常深的积累。

