视频编码技术发展态势及标准化进展如何?

视频编码技术发展态势及标准化进展如何?

最佳答案 匿名用户编辑于2025/01/10 15:54

近年来,随着 5G、5G-A 和人工智能技术的发展,多媒体通信呈现巨大革新, 进而催生了大量以视频为主要媒介的应用场景,比如短视频、视频直播、视频通 话、视频会议等。

1.视频编码技术总体发展态势

视频编解码技术作为视频产业的基础底层技术,无疑将成为未 来产业中的重要一环。尽管视频编解码技术每十年可提升约 50%的压缩率,但已 然无法跟上当下视频信息量迅速膨胀的步伐。海量的新型视频数据和创新应用场 景的迸发涌现,促使视频编码技术不断迭代并呈现多元化发展趋势。因此,亟需 发展更为高效智能的视频编码技术,来迎接全新的大视频时代。

随着采集设备和视频技术的升级,视频数据逐渐呈现高分辨率(UHD)、高 帧率(HFR)、宽色域(WCG)、高动态范围(HDR)的特点。超高清视频集上 述特点于一身,在各应用场景中愈发普及,更为海量的数据使得存储传输压力激 增。如何满足高质量、低延迟、少失真、低码率,成为编码技术所需要面临的新 挑战。

人眼开始追求更宽的视角、更大的范围、更沉浸的体验,VR/AR 视频、自由 视点视频相继涌现。基于技术成熟度,目前的 VR 视频泛指 3DoF 或 3DoF+ VR 视频,如水平 360°×垂直 360°全景视频、水平 180°×垂直 180°全景视频等,在 拍摄端由不同方向的多个照相机拍摄多路视频并将其拼接融合而成,主要的关键 技术包含 2D 视频拼接、视频编解码、存储和传输。而自由视点视频是一种新型视频内容,能够让观众自由选择观看位置和角度,从而提供更加沉浸式的观看体 验,该技术已成功应用于现场体育赛事、直播表演、在线教育等领域。目前成熟 的解决方案是几十台相机组成 U 型环绕,并采集多个视角的 2D 视频,然后传输 到云端通过深度计算后生成虚拟视角,填补各相机之间的间隔空缺,而后通过 2D 图像/视频编码传输至用户端解码显示。因此,面向 VR 和自由视点视频编码压缩 主要是针对多相机采集的多路 2D 视频数据,催生出大数据量视频的高效编码、 多视点视频数据间的去冗余编码等升级的编码技术。

理想的编码需要同时满足人类视觉系统和机器视觉系统的需求。然而,压缩 失真会导致机器视觉性能下降,而质量损失的类型、程度与机器视觉系统能力的 变化之间存在不同的关系。随着安防监控、物流仓储管理、智慧交通、智慧工厂 等应用场景的相继涌现,面向多元机器视觉分析的视频编码技术需求日渐迫切。

视频编码作为底层基础技术,应用广泛,从传统广电传媒可扩展覆盖至金融、 互联网、工业、教育、新零售、医疗健康、交通物流、政务等行业。表 1-2 介绍 了常见的应用场景。

综上所述,行业应用逐步扩大,业务场景愈发复杂,视频内容和类型越发丰 富,视频数据量爆发式增长,视频编码技术无疑面临着巨大的挑战。在此背景下, 视频语义编码技术应运而生。视频语义编码,即基于视频内容和语义特征(图 1-1)进行编码,同时追求信号保真度、感知自然性和语义质量,有望突破传统 视频编码方法的性能瓶颈,为视频产业注入新的活力,进一步提升产业势能, 成为助推视频产业高质量发展的新动能。

2.标准化进展

回顾视频语义编码技术框架,视觉感知编码技术涉及对应了传统视频编码、 VR 视频编码、多视点视频编码、AI 视频编码等相关标准;生成式编码技术和跨 模态编码技术目前属于前沿探索阶段,未来有望进入 AI 视频编码标准;针对机 器视觉,国内外标准工作组开展了一系列面向机器的视频编码标准的研究制定。中国移动积极参与了 ISO/IEC、ITU-T、AVS 等相关标准的研制。

AI 视频编码

近年来,深度学习技术在视觉数据处理方面展现巨大的潜力。因此,各标准 工作组开始探索基于深度学习的编码标准化,来自工业界和学术界的专家不断提 出新的工作,以提升基于神经网络的图像和视频压缩效率,并推动 AI 视频编码 标准研制。

目前,AI 视频编码标准研究还局限于静态自然图像,在自然视频中尝试较 为初步。相较于图像,其时域运动复杂性与运动信息高效压缩建模更为复杂。同 时,高质量 AI 编码开源框架的缺失,大大限制了标准化的发展。因此,研制出 高效的端到端视频编码技术,是 AI 视频编码标准迈向大规模应用的关键。

VR 视频编码

IEEE 1857.9 工作组致力于推动用于压缩、解压缩和重建沉浸式视觉内容的 高效编码工具的标准化。该标准针对的应用场景和服务对象包括但不限于 VR, 例如基于无人机的 VR、AR、全景视频和其他视频/音频驱动的服务,以及诸如 沉浸式视频流、广播、存储和通信之类的应用。

MPEG 的 VVC/H.266 标准已经能够支持双目、多目、360 度等沉浸式内容编 码。MPEG Immersive video (MIV) 标准于 2021 年 10 月进入国际标准最终草案 投票阶段,MIV 标准的目标是为沉浸式六自由度立体视觉场景提供高效编码。由 于基于视频的点云编码(Video-based Point Cloud Compression, V-PCC)和 MIV 之 间的许多技术共性,MIV 规范定义了一种称为可视体积视频编码(Visual Volumetric Video-based Coding, V3C)的通用比特流格式。然而,MIV 和 V3C/VPCC 的输入和输出格式、参考编码器和参考渲染器之间仍然存在显著差异。 国内数字音视频编解码技术标准工作组(简称“AVS 工作组”)于 2016 年启 动了 VR 编码标准的制定,即信息技术-虚拟现实内容表达第 2 部分:视频 (20192086-T-46)[18],规定了虚拟现实视频内容的高效编码表示与重建方法,包 括压缩域的语法、语义以及重建过程。

多视点视频编码

国际标准组织 ISO/IEC MPEG 于 2001 年成立 3D 视频研究工作组,着手进行 多视点视频(Multi-View Video, MVV)、多视点加深度(Multi-View Video plus Depth, MVD)和自由视点视频(Free-viewpoint Video, FVV)的技术研究和标准 化制定。2012 年,ISO/IEC 与 ITU-T 成立 3D 视频编码联合专家组(JCT-3V), 制定 HEVC 和其他视频编码标准的多视图和 3D 视频编码扩展。 在 AVS 第 89 次会议上,中国移动牵头提出《AVS3 的多视角视频及 3D 立体 视频档次需求建议》并通过。同时,在大会上成立 3D 编码专题讨论组,负责多 视角和立体视频的标准制定工作。该需求建议旨在对 AVS3 编解码器进行升级, 以支持多视点和 3D 立体视频的编码。AVS3 作为国产编解码器,在传统 2D 广播 视频领域已经取得了显著的成功。此次需求通过,将显著增强国产编解码器在新 兴 3D 视频市场的竞争力,进一步推动 AVS3 成为国际标准体系中下一代视频编 解码标准。

面向机器的视频编码

视频既要用于机器分析也要被人眼观看,因此理想的编码需要同时满足人类 视觉系统(HVS)和机器视觉系统(Machine Vision System, MVS)的需求。然而, 压缩后的视频质量下滑会导致机器视觉性能下降,且质量损失的类型、程度与机器视觉系统能力的变化之间存在不同的关系。 在机器视觉任务中,为高效压缩图像与视频,国内外相关标准组织做出了一 些探索和尝试,并形成了一系列标准,主要包括视觉搜索紧凑描述子标准 (Compact Descriptor for Visual Search, CDVS)、视频分析紧凑描述子标准 (Compact Descriptor for Video Analysis, CDVA),正在探索的面向机器的视频编 码标准(Video Coding for Machines, VCM)和面向机器智能的数据编码标准(Data Coding for Machines, DCM)。

参考报告REPORT

新型视频语义编码技术白皮书(2024年).pdf

该文档为《新型视频语义编码技术白皮书(2024年)》,主要聚焦于视频编码技术的创新与发展。白皮书深入探讨了从传统像素级编码向语义级编码转型的技术路径,分析了语义编码在降低带宽需求、提升传输效率及增强内容理解方面的核心价值。内容涵盖语义编码的关键技术架构、算法优化、标准化进展以及在流媒体、元宇宙、远程医疗等场景的应用前景。旨在为行业提供技术趋势洞察,推动视频通信与处理技术的智能化升级,促进数字内容产业的高效分发与交互体验提升。

我来回答
分享至