5、AVS2标准概述:高效视频编码的革新之路

本文还有配套的精品资源,点击获取 menu-r.4af5f7ec.gif

AVS2标准概述:高效视频编码的革新之路

1. AVS2标准简介

AVS2是由相关工作组开发的第二代AVS视频编码标准,旨在相较于之前的AVC/H.264和AVS1标准,实现显著的编码效率提升。其目标应用包括高质量广播、低延迟视频通信等。与AVS1相比,AVS2在编码效率上有显著提升,尤其适用于场景视频,如视频监控、视频会议等,这些视频通常长时间从同一场景捕获,背景变化较少。

AVS2采用了基于背景图片模型的编码方法,通过使用从原始图片或解码图片构建的背景图片作为参考图片,提高预测效率。测试结果表明,这种基于背景图片的预测编码可将比特率降低50%。此外,背景图片还可用于智能监控中的目标检测和跟踪。

AVS2采用了传统的预测/变换混合编码框架,但开发了更高效的编码工具,以满足新兴应用的新需求。具体特点如下:
- 更灵活的预测块划分 :采用方形和非方形划分,更适应图像内容,尤其是边缘区域。
- 灵活的变换块大小 :变换块大小可达64×64像素。
- 基于CU、PU和TU的编码结构 :图片首先被分割成最大编码单元(LCU),LCU可由单个CU或通过四叉树结构分割成四个较小的CU。CU可递归分割,直到达到最小CU大小限制。叶节点CU可进一步分割成PU,PU是帧内和帧间预测的基本单元,支持多种不同形状。TU是变换编码和量化的基本单元,其大小不超过CU,但独立于PU大小。
- 上下文自适应算术编码 :用于变换系数的熵编码,采用两级系数扫描和编码方法,可更高效地编码大块系数。

2. 编码工具

AVS2的编码工具可分为四类:预测编码(包括帧内预测和帧间预测)、变换、熵编码和环路滤波,以及场景视频编码工具。

2.1 帧内预测

帧内预测用于减少图片空间域的冗余。AVS2采用基于块划分的方向预测,除了方形PU划分,还采用了非方形划分,即短距离帧内预测(SDIP),用于更高效的帧内亮度预测。SDIP将2N×2N的PU水平/垂直划分为4个预测块,更适应图像内容,尤其是边缘区域。但为了降低复杂度,SDIP不适用于64×64的CU。

对于每个预测块,亮度支持34种预测模式,包括31种角度模式、平面模式、双线性模式和DC模式。预测方向分布在[-135°, 45°]范围内。为了提高帧内预测精度,如果投影参考样本位于非整数位置,则需要对亚像素精度参考样本进行插值。非整数位置限制为1/32样本精度,采用4抽头线性插值滤波器获取亚像素。

对于色度分量,PU大小始终为N×N,支持5种预测模式,包括垂直预测、水平预测、双线性预测、DC预测和从相应亮度预测模式派生的预测模式。

2.2 帧间预测

帧间预测旨在利用连续图片之间的时间相关性,减少时间冗余。自AVC/H.264标准以来,多参考预测得到应用,包括短期和长期参考图片。在AVS2中,长期参考图片的使用进一步扩展,例如用于监控编码的背景图片。

除了传统的P帧和B帧,AVS2还定义了F帧作为特殊的P帧。P帧是使用单个参考图片的前向预测帧,B帧是使用两个参考帧的双向预测帧,包括前向、后向、双向和对称预测模式。在B帧中,对称预测是一种特殊的双向预测模式,只编码一个前向运动矢量,后向运动矢量从前向运动矢量派生。

对于F帧,除了传统的单假设预测模式,还添加了多假设技术,包括高级跳过/直接模式、时间多假设预测模式和空间方向多假设(DMH)预测模式。

高级跳过/直接模式使用竞争运动推导机制,包括时间和空间两种推导方法。时间多假设模式将两个预测器沿预定义的时间方向组合,空间多假设模式将两个预测器沿预定义的空间方向组合。

预测模式 说明
高级跳过/直接模式 使用竞争运动推导机制,有时间和空间两种推导方法
时间多假设预测模式 将两个预测器沿预定义的时间方向组合
空间方向多假设(DMH)预测模式 将两个预测器沿预定义的空间方向组合

以下是时间多假设预测模式和空间多假设预测模式的示意图:

graph LR
    classDef process fill:#E5F6FF,stroke:#73A6FF,stroke-width:2px;
    A(运动估计):::process --> B(最佳运动矢量MV和参考帧ref1):::process
    B --> C(生成预测器ref_blk1):::process
    B --> D(线性缩放运动矢量到第二个参考):::process
    D --> E(生成预测器ref_blk2):::process
    F(初始预测器):::process --> G(确定种子预测器位置):::process
    G --> H(选择种子预测器进行组合预测):::process
2.3 运动矢量预测和编码

运动矢量预测(MVP)在帧间预测中起着重要作用,可减少相邻块运动矢量之间的冗余,节省大量编码比特。AVS2采用了四种不同的预测方法:
|方法|详情|
| ---- | ---- |
|中位数|使用相邻块的中位数MV值|
|空间|使用空间相邻块的MV|
|时间|使用时间同位块的运动矢量|
|空间 - 时间组合|使用同位块的时间MVP加上空间相邻块的MVD偏移|

在AVS2中,亮度分量的运动矢量精度为四分之一像素,使用8抽头DCT插值滤波器进行亚像素插值;色度分量的运动矢量从亮度分量派生,精度为1/8像素,使用4抽头DCT插值滤波器进行亚像素插值。运动矢量预测后,运动矢量差(MVD)被编码到比特流中。为了进一步节省运动矢量的编码比特,AVS2采用了渐进式运动矢量分辨率自适应方法。具体步骤如下:
1. 将MVP四舍五入到最近的整数样本位置。
2. 如果MV与MVP的距离大于阈值,则将MV四舍五入到半像素精度。
3. 如果MVD大于阈值,则将MVD的分辨率降低到半像素精度。

2.4 变换

AVS2采用两级变换编码来进一步压缩预测残差。对于具有对称预测单元划分的CU,TU大小可以是2N×2N或N×N,由变换分割标志信号指示。最大变换大小为64×64,最小为4×4。

对于4×4到32×32的TU大小,使用近似离散余弦变换(DCT)性能的整数变换(IT);对于64×64的变换,应用逻辑变换(LOT)。对于具有不对称PU划分的CU,第一级使用2N×2N IT,第二级使用非方形变换。

2.5 熵编码

变换和量化后,对变换系数块应用两级编码方案。系数块被划分为4×4系数组(CG),然后进行Z字形扫描和上下文自适应二进制算术编码(CABAC),分别在CG和系数级别进行。

在CG级别,CG按Z字形顺序扫描,首先编码最后一个非零CG的位置,然后编码表示CG是否包含非零系数的有效CG标志位串。在系数级别,每个非零CG的系数进一步以Z字形顺序扫描成(run, level)对。对于最后一个CG,首先编码最后一个非零系数的位置;对于非最后一个CG,编码最后一个非零系数之后的零系数数量,然后按反向Z字形顺序编码(level, run)对。

AVS2采用了基于模式的上下文选择设计,将34种帧内预测模式分为垂直、水平和对角线三个预测模式集。根据预测模式集,每个CG被划分为两个区域,应用于语法元素的上下文编码,包括最后一个CG位置、最后一个系数位置和游程值。

2.6 环路滤波

压缩视频中常见的伪像包括块效应、振铃效应、颜色偏差和模糊效应,尤其是在中低比特率下。为了抑制这些伪像,AVS2依次对重建图片应用去块滤波、样本自适应偏移(SAO)滤波和自适应环路滤波(ALF)。

  • 去块滤波 :旨在消除块变换和量化引起的块效应,基本单元为8×8块,仅当边界属于CU边界、PU边界或TU边界时才应用。
  • SAO滤波 :用于减少区域的平均样本失真,通过向重建样本添加偏移来减少振铃效应和轮廓效应。有两种偏移模式:边缘偏移(EO)和带偏移(BO)。
  • ALF :是环路滤波的最后阶段,包括两个阶段。第一阶段是滤波器系数推导,编码器将亮度分量的重建像素分为16类,为每类使用Wiener - Hopf方程训练一组滤波器系数,以最小化原始帧和重建帧之间的均方误差。为了减少这些滤波器系数之间的冗余,编码器将根据率失真性能自适应合并它们。第二阶段是滤波器决策,包括帧级和LCU级。编码器首先决定是否进行帧级自适应环路滤波,如果开启,则进一步决定是否对LCU级应用ALF。
3. 场景视频编码

越来越多的视频在特定场景下捕获,具有时间上稳定的背景。AVS2开发了基于背景图片模型的编码方法,定义了G图片和S图片,以进一步利用时间冗余,促进视频事件生成,如目标分割和运动检测。

  • G图片 :是一种特殊的I图片,存储在单独的背景存储器中。通过背景初始化和背景建模方法(如中值滤波、高斯混合模型的快速实现)进行初始化和更新,可很好地表示场景的背景,减少遮挡前景物体和噪声的影响。
  • S图片 :是一种特殊的P图片,只能从重建的G图片或虚拟G图片(从输入图片建模并编码到流中作为参考图片)进行预测。除了使用G图片作为参考外,S图片具有与传统I图片类似的功能,如容错和随机访问。通常应编码为传统I图片的图片可以作为候选S图片,如GOP的第一张图片或场景变化时的图片。

使用背景图片不仅为通常占主导地位的背景块提供了更多的预测机会,还引入了一种新的预测模式——背景差分。

graph LR
    classDef process fill:#E5F6FF,stroke:#73A6FF,stroke-width:2px;
    A(输入视频):::process --> B(背景初始化):::process
    B --> C(生成G图片):::process
    C --> D(编码G图片):::process
    D --> E(存储到背景存储器):::process
    A --> F(S图片决策):::process
    F --> G(使用G图片作为参考编码S图片):::process

综上所述,AVS2标准通过采用一系列先进的编码工具和技术,在编码效率、视频质量和场景适应性等方面取得了显著的提升,为高质量视频的编码和传输提供了强大的支持。无论是在传统的视频应用领域,还是在新兴的智能监控、视频通信等领域,AVS2都具有广阔的应用前景。

AVS2标准概述:高效视频编码的革新之路

4. AVS2编码工具总结与优势分析

AVS2的各类编码工具相互配合,形成了一个高效的视频编码体系。下面我们对这些工具进行总结,并分析其带来的优势。

编码工具类别 具体工具 优势
预测编码 帧内预测(含SDIP) 减少空间冗余,适应图像边缘区域,提高预测精度
帧间预测(含F帧多假设技术) 利用时间相关性,减少时间冗余,增加预测模式灵活性
变换 两级变换编码 有效压缩预测残差,根据不同情况选择合适变换方式
熵编码 两级编码方案(CABAC) 高效编码变换系数,节省编码比特
环路滤波 去块滤波、SAO滤波、ALF 抑制视频伪像,提高视频质量
场景视频编码 基于背景图片模型(G图片和S图片) 减少背景冗余,引入新预测模式,促进视频事件生成

从整体来看,AVS2的优势主要体现在以下几个方面:
- 编码效率提升 :通过灵活的块划分、多种预测模式以及高效的变换和熵编码方法,显著降低了比特率,如基于背景图片的预测编码可降低50%的比特率。
- 视频质量改善 :环路滤波技术有效抑制了各种伪像,使得在中低比特率下也能获得较好的视频质量。
- 场景适应性强 :针对场景视频开发的编码方法,能够更好地处理具有稳定背景的视频,如监控视频、会议视频等。

5. AVS2在实际应用中的流程

在实际应用中,AVS2的编码和解码过程遵循一定的流程。下面我们以编码过程为例,详细介绍其步骤。

graph LR
    classDef process fill:#E5F6FF,stroke:#73A6FF,stroke-width:2px;
    A(输入视频):::process --> B(图片分割为LCU):::process
    B --> C(CU划分):::process
    C --> D(PU划分):::process
    D --> E(帧内/帧间预测):::process
    E --> F(预测残差计算):::process
    F --> G(两级变换编码):::process
    G --> H(量化):::process
    H --> I(两级熵编码):::process
    I --> J(输出编码比特流):::process
    E --> K(环路滤波):::process
    K --> L(重建图片):::process
    L --> M(作为参考图片用于后续预测):::process

具体步骤如下:
1. 图片分割 :将输入视频的图片分割成最大编码单元(LCU)。
2. CU划分 :LCU可通过四叉树结构分割成更小的CU,直到达到最小CU大小限制。
3. PU划分 :叶节点CU进一步分割成PU,作为预测的基本单元。
4. 预测 :根据不同的帧类型(I、P、B、F),进行帧内或帧间预测。
5. 残差计算 :计算预测值与原始值之间的残差。
6. 变换编码 :对预测残差进行两级变换编码,根据CU和PU的划分情况选择合适的变换方式。
7. 量化 :对变换后的系数进行量化,减少数据量。
8. 熵编码 :采用两级熵编码方案对量化后的系数进行编码,生成编码比特流。
9. 环路滤波 :对重建图片进行去块滤波、SAO滤波和ALF,提高视频质量。
10. 重建与参考 :重建图片并作为参考图片用于后续的预测。

6. 未来发展展望

随着视频技术的不断发展,对视频编码的要求也越来越高。AVS2作为一种先进的视频编码标准,在未来有望在更多领域得到应用和发展。

  • 高清与超高清视频 :随着高清和超高清视频的普及,AVS2的高效编码能力将能够满足其对带宽和存储的要求,为用户提供更清晰、更流畅的视频体验。
  • 智能监控 :在智能监控领域,AVS2针对场景视频的编码方法将能够更好地处理长时间稳定背景的视频,同时背景图片还可用于目标检测和跟踪,提高监控系统的智能化水平。
  • 视频通信 :在视频通信方面,AVS2的低延迟和高效编码特性将有助于实现更实时、更清晰的视频通话,提升用户的沟通体验。

总之,AVS2标准凭借其先进的编码技术和良好的性能,在未来的视频领域将具有广阔的发展前景。我们期待它能够为视频行业带来更多的创新和变革。

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符  | 博主筛选后可见
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值