【中国移动研究院】新型视频语义编码技术白皮书2024年_32页_9mb
报告摘要
新型视频语义编码技术白皮书总结
核心内容
本白皮书由中移智库发布,中国移动通信研究院编制,主要围绕新型视频语义编码技术展开,介绍了其技术背景、应用场景、关键技术方案以及标准化进展。该技术旨在突破传统视频编码方法的性能瓶颈,通过结合视频内容和语义特征,提升信号保真度、感知自然性和语义质量,成为推动视频产业高质量发展的新动能。
主要观点
- 视频编码技术正在经历从“看得清”向“看得真”的转变,以满足用户对高分辨率、高帧率、宽色域和高动态范围等高质量视频的需求。
- 随着VR/AR、自由视点视频等新型视频内容的兴起,视频编码技术需要支持多视点、多视角的高效压缩,以适应这些沉浸式内容的传输和存储。
- 视频编码不仅要满足人眼的视觉质量,还要服务于机器视觉任务,如目标检测、识别和分析,以提升视频数据的利用率和压缩效率。
- 人工智能技术,特别是深度学习和生成对抗网络(GAN),正在成为视频语义编码的重要推动力,为实现更高效的视频编码提供新的思路。
- 语义通信作为新兴研究方向,与视频语义编码密切相关,但目前仍处于前沿探索阶段,尚未形成统一的框架。
- 视频语义编码技术具备可扩展性、兼容性和通用性,能够有效应对不同应用场景下的视频数据处理需求。
关键信息
视频编码技术发展
- 视频编码技术已历经数十年发展,形成多种标准如MPEG-1/2/4、H.264/AVC、H.265/HEVC、H.266/VVC等。
- 新一代编码标准如VVC、AVS3、AV1等,虽在编码性能上有所提升,但复杂度也显著增加。
- 人工智能的引入,使得基于神经网络的视频编码技术成为研究热点,主要分为混合神经网络编码和全神经网络编码两种方式。
视频语义编码关键技术
- 视觉感知编码:基于人眼视觉系统(HVS)特性,去除人眼无法感知的冗余,提升编码效率。包括JND编码(恰可察觉失真)和ROI编码(感兴趣区域编码)。
- 生成式编码:利用生成对抗网络(GAN)等技术,在极低码率下实现高质量视频重建,提升感知质量与解码性能。
- 跨模态编码:通过将视频信息转换为文本描述,实现跨模态数据的高效压缩与传输,适用于多种应用场景。
- 面向机器的视频编码:为机器视觉任务设计,如目标检测、实例分割和目标追踪,强调压缩效率与机器分析性能的平衡,提出CDVS、CDVA、VCM、DCM等标准。
- 编码数据传输:结合5G、边缘计算等技术,实现流媒体传输优化,提升视频传输效率与用户体验。涉及媒体封装(如TS、MP4、FLV等)与流媒体传输协议(如MPEG-DASH、HLS、RTP、SRT等)。
标准化进展
- AI视频编码:IEEE 1857.11、MPAI EVC/EEV、MPEG NNVC等标准正在推进,旨在实现基于深度学习的视频压缩。
- VR视频编码:IEEE 1857.9工作组致力于VR、AR等沉浸式内容的高效编码标准化,MPEG VVC/H.266和MIV标准也在逐步完善。
- 多视点视频编码:ISO/IEC MPEG和ITU-T VCEG联合制定了MVC、MV-HEVC、3D-HEVC等标准,支持多视点与3D视频的高效压缩。
- 面向机器的视频编码:CDVS、CDVA、VCM、DCM等标准正在制定,以满足机器视觉任务的高效处理与数据压缩需求。
技术发展趋势
- 视频语义编码技术将向6DoF视频、体积视频、点云序列等新型视频形式扩展。
- 预训练多模态大模型有望成为视频语义编码效率提升的新引擎。
- 异构计算和云-边端协同架构将成为视频语义编码实现的重要支撑。
- 视频语义编码技术将推动视频传输技术的优化,提升视频体验与内容生态的智能化。
- 标准化将是视频语义编码技术实现大规模应用的关键。
总结与展望
视频语义编码技术作为视频产业的底层基础技术,将推动视频传输、存储、处理等环节的革新,成为视频产业高质量发展的核心驱动力。随着人工智能、5G和多模态数据处理技术的不断成熟,视频语义编码技术将在未来实现更广泛的应用和更高效的性能表现。同时,标准化工作的持续推进将为该技术的落地应用提供坚实基础。
缩略语列表
| 缩略语 | 英文全名 | 中文解释 |
|---|---|---|
| 3DoF | Three Degrees of Freedom | 三自由度 |
| 5G | 5th Generation Mobile Networks | 第五代移动通信网络 |
| 5G-A | 5G-Advanced | 5G演进版 |
| 6DoF | Six Degrees of Freedom | 六自由度 |
| AI | Artificial Intelligence | 人工智能 |
| AR | Augmented Reality | 增强现实 |
| AVS | Audio Video Coding Standard | 数字音视频编解码技术标准 |
| BD-rate | Bjontegaard's delta-rate | BD率 |
| CDVA | Compact Descriptor for Video Analysis | 视频分析紧凑描述子 |
| CDVS | Compact Descriptor for Visual Search | 视觉搜索紧凑描述子 |
| DASH | Dynamic Adaptive Streaming over HTTP | 基于HTTP的动态自适应流 |
| DCM | Data Coding for Machines | 面向机器的数据编码 |
| DCT | Discrete Cosine Transform | 离散余弦变换 |
| EEV | End-to-End Video coding | 端到端的视频编码 |
| EVC | Enhanced Video Coding | 增强视频编码 |
| FLV | Flash Video | 闪存视频 |
| FOV | Field of View | 视角 |
| GAN | Generative Adversarial Network | 生成对抗式网络 |
| HDR | High-Dynamic Range | 高动态范围 |
| HEVC | High Efficiency Video Coding | 高效视频编码 |
| HFR | High Frame Rate | 高帧率 |
| HLS | HTTP Live Streaming | HTTP实时流传输 |
| HTTP | Hyper Text Transfer Protocol | 超文本传输协议 |
| HVS | Human Vision System | 人类视觉系统 |
| IEEE | Institute of Electrical and Electronics Engineers | 电气和电子工程师协会 |
| IETF | Internet Engineering Task Force | 互联网工程任务组 |
| ISO/IEC | International Organization for Standardization/International Electrotechnical Commission | 国际标准组织/国际电工委员会 |
| JND | Just Noticeable Distortion | 恰可察觉失真 |
| JPEG | Joint Photographic Experts Group | 联合图像专家组 |
| JRD | Just Recognizable Distortion | 恰可识别失真 |
| JVET | Joint Video Experts Team | 联合视频专家组 |
| MIV | MPEG Immersive Video | MPEG沉浸式视频 |
| MKV | Matroska Video | Matroska视频 |
| MOV | Movie Digital Video Technology | 数字电影视频技术 |
| MPAI | Moving Picture, Audio and Data Coding by Artificial Intelligence | 基于人工智能的运动图像、音频和数据编码 |
| MPEG | Moving Picture Experts Group | 运动图像专家组 |
| MV-HEVC | Multi-View HEVC | 多视图HEVC |
| MVS | Machine Vision System | 机器视觉系统 |
| MXF | Material Exchange Format | 素材交换格式 |
| PES | Packetized Elementary Stream | 打包的基本流 |
| ROI | Region of Interest | 感兴趣区域 |
| RTMP | Real-Time Messaging Protocol | 实时消息传输协议 |
| RTP | Real-time Transport Protocol | 实时传输协议 |
| SDR | Standard Dynamic Range | 标准动态范围 |
| SMR | Satisfied Machine Ratio | 机器满意率 |
| SRT | Secure Reliable Transport | 安全可靠传输 |
| TS | Transport Stream | 传输流 |
| UHD | Ultra-High Definition | 超高清 |
| V3C | Visual Volumetric Video-based Coding | 可视体积视频编码 |
| VA | Visual Attention | 视觉注意力 |
| VAE | Variational Autoencoder | 变分自编码器 |
| vCDN | Virtual Content Delivery Network | 虚拟内容分发网络 |
| VCEG | Video Coding Experts Group | 视频编码专家组 |
| VCM | Video Coding for Machines | 面向机器的视频编码 |
| V-PCC | Video-based Point Cloud Compression | 基于视频的点云编码 |
| VR | Virtual Reality | 虚拟现实 |
| VRF | Virtual Reference Frame | 虚拟参考帧 |
| VVC | Versatile Video Coding | 多功能视频编码 |
| WGR | Wide Color Gamut | 广色域 |
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载