【世界超高清视频产业联盟】2024三维沉浸视频技术白皮书
报告摘要
三维沉浸视频技术白皮书(2024)总结
核心内容
三维沉浸视频是一种通过采集、重建、编码、传输、渲染和显示等技术手段,实现对真实场景的立体、沉浸式再现的视频技术。其目标是为用户提供身临其境的观看体验,使视频内容具备更高的时空分辨率和自由视角选择能力,广泛应用于教育、娱乐、医疗等领域。
主要观点
-
三维沉浸视频的特征:
- 从平面感知到立体感知;
- 从单一视角到自由视角;
- 从有限时空分辨率到任意时空分辨率;
- 复刻现实场景的完整视觉信息。
-
技术演进路线:
- 双目立体技术:利用两个摄像机模拟人眼视觉,但需佩戴设备;
- 多视裸眼3D技术:通过多视点图像生成立体效果,无需额外设备;
- 全景3D技术:结合全景视频和立体影像,提供环绕式观看体验;
- 自由视点技术:允许用户自由选择观看视角;
- 体积视频技术:采集和呈现三维空间中动态场景,具备六自由度(6DoF)体验,但存在技术瓶颈。
-
三维沉浸视频技术体系:
- 包括内容采集、内容重建、内容编码、内容传输、渲染交互、终端显示和质量评价七个核心部分。
-
内容采集方式:
- 双目相机:通过视差计算获取深度信息;
- 阵列相机:提供更广的视野和更多的视点;
- 全景相机:利用拼接技术生成全景视频;
- 深度信息采集:包括RGB-D、结构光、TOF和激光扫描等方式。
-
内容重建技术:
- 包括基于几何的重建(如SFM、MVS)和基于深度学习的重建方法(如MVSNet、R-MVSNet);
- 重建结果可用于后续的虚拟视点合成、网格生成等。
-
内容编码技术:
- 传统平面视频编码:适用于双目立体视频;
- 多视点编码:结合深度图和多视点图像,实现高效压缩;
- 全景立体视频编码:使用非均匀投影方式优化码率;
- 体积视频编码:包括基于几何的点云压缩(G-PCC、V-PCC)和基于视频的动态网格编码(V-DMC)。
-
内容传输要求:
- 多视点视频、FOV视频、体积视频分别有不同的分辨率和码率需求;
- 传输时延要求为95%时延小于150ms,以确保流畅体验;
- 网络带宽需达到视频码率的1.5倍以上以满足流畅播放,5倍以实现“秒开”效果。
-
渲染交互方式:
- 包括基于模型渲染(MBR)和基于图像的渲染(IBR);
- 虚拟视点合成(如DIBR、IDW)是实现自由视角的关键;
- 合成过程中需处理空洞、伪影、边缘模糊等问题。
-
终端显示方式:
- 包括3D眼镜、VR头显、裸眼3D设备等;
- 平面视频显示器具有高分辨率、低功耗等优势;
- 显示技术发展趋势包括更高分辨率、10bit色深、高动态范围和宽色域。
关键信息
- 技术挑战:三维沉浸视频在内容采集、重建、编码、传输、渲染和显示等方面仍面临诸多挑战,包括数据量大、缺乏统一标准、硬件兼容性差、合成效果不理想等。
- 发展趋势:随着AI技术、高分辨率显示设备和高速网络的发展,三维沉浸视频技术正逐步成熟,未来将向6DoF、高分辨率、高帧率、高动态范围等方向演进。
- 标准化建议:联盟提出需要推动三维沉浸视频的标准化工作,以促进技术的统一和产业的快速发展。
- 产业前景:中国沉浸产业市场规模持续增长,预计2024年将突破2400亿元,但三维沉浸视频仍处于探索和应用阶段,需进一步推动技术发展和标准化。
技术体系结构图
| 模块 | 内容 |
|---|---|
| 内容采集 | 双目、阵列、全景、深度信息采集 |
| 内容重建 | SFM、MVS、深度学习方法 |
| 内容编码 | 传统平面、双目、多视点、全景、体积视频编码 |
| 内容传输 | 多视点、FOV、体积视频传输要求 |
| 渲染交互 | DIBR、IDW、MBR、IBR |
| 终端显示 | 3D眼镜、VR头显、裸眼3D、平面显示器 |
| 质量评价 | 视觉质量、交互体验、系统稳定性 |
未来展望
三维沉浸视频技术的发展将依赖于算法优化、硬件提升、标准化推进以及应用场景的拓展。随着AI和云计算的深入应用,三维沉浸视频有望实现更高质量、更低延迟、更广视角的沉浸体验,成为数字内容的重要形式之一。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载