一、论文概览与背景1.1 论文信息论文标题: Partition Map-Based Fast Block Partitioning for VVC Inter Coding作者: Xinmin Feng, Zhuoyuan Li, Li Li, Dong Liu, Feng Wu机构: 中国科学技术大学 脑启发智能感知与认知教育部重点实验室投稿期刊: IEEE Transactions on Multimedia (提交状态)arXiv编号: arXiv:2504.18398v1 [eess.IV], 2025年4月25日开源代码: https://github.com/ustc-ivclab/IPM1.2 研究背景与动机VVC (Versatile Video Coding, H.266) 是由 JVET (Joint Video Experts Team) 制定的最新视频编码标准。相较于前代 HEVC (H.265) 标准VVC 引入了多项新技术其中最重要的是四叉树嵌套多类型树 (QTMTT, Quadtree plus Multi-Type Tree) 块分区结构。这一结构通过提供更灵活的块分区模式带来了显著的编码增益。然而灵活的分区模式也带来了巨大的编码复杂度问题。VVC 编码器需要通过暴力搜索的方式进行率失真优化 (RDO, Rate-Distortion Optimization)逐一尝试所有可能的分区组合来找到最优的编码单元 (CU) 分区方案。在随机访问 (RA) 配置下VVC 参考软件 VTM 相比 HEVC 参考软件 HM 的编码时间增加了617%这使得 VVC 在实际部署中面临严峻挑战。核心问题: 如何在保持编码效率的前提下大幅降低 VVC 帧间编码的复杂度1.3 核心思路本文提出了一种基于分区图 (Partition Map) 的快速块分区算法用于加速 VVC 帧间编码。该方法建立在作者之前在 VVC 帧内编码工作 [23] 的基础上通过三个关键组件将方法扩展到帧间编码分区表示、神经网络架构和后处理算法。整体思路可以概括为用神经网络预测当前帧的块分区结构然后将预测结果转换为标准兼容的分区决策从而跳过大量不必要的 RDO 搜索。关键在于如何设计有效的分区表示、如何构建能够建模帧间编码复杂特性的神经网络以及如何在网络预测和 RDO 搜索之间取得灵活的平衡。1.4 主要贡献通过引入 MTT 掩码 (MTT Mask)增强了分区图表示使其能高效表示 VVC 帧间编码的 QTMTT 分区结构并支持 MTT 分区的提前终止。受帧间编码分区搜索过程启发设计了一种由粗到细的神经网络集成了沙漏块 (Hourglass Block)、QP 调制层 (QP Modulation Layer)、分区自适应变形 (P-Warping) 等多个创新模块。提出了双阈值决策方案 (Dual-Threshold Decision Scheme)实现了编码复杂度与 RD 性能之间的细粒度可控平衡。实验表明该方法在 RA 配置下平均节省 51.30% 的编码时间BDBR 仅增加 2.12%优于现有方法。1.5 关键指标速览表1. 核心性能指标摘要指标数值说明编码时间节省 (ETS)51.30%L1(0.2, 1) 加速级别BDBR 增加2.12%RD 性能损失编码时间加速 (ETA)2.05xT_anchor / T_test最大 ETS63.21%L1(0.2, 0.9) 级别QT Net 参数量1.11M不含光流网络QTMTT Mask 计算量7.37 GFLOPs单帧 1080p训练数据2,672 序列4K, 多分辨率训练 GPU8x 1080Ti约两周二、相关工作2.1 HEVC 快速块分区算法在 VVC 之前HEVC 已被广泛采用。针对 HEVC 的四叉树 (QT) 分区搜索加速研究者提出了大量方法可分为两大类启发式方法: 利用当前 CU 的中间特征和与相邻 CU 的空间相关性来提前终止不必要的分区搜索。基于神经网络的方法: 使用 CNN 等深度学习模型预测分区结构。例如Xu 等人 [38] 提出了分层 CNN 来预测分层 CU 分区图Tissier 等人 [37] 为每个 64x64 CU 设计了概率向量来加速块分区Feng 等人 [39] 使用深度图来表示 CTU 的块分区并用 CNN 预测。2.2 VVC 快速块分区算法VVC 的 QTMTT 结构虽然提供了更灵活的分区模式但也显著增加了编码时间。现有方法同样分为启发式和基于学习的方法。在帧内编码方面Feng 等人 [23] 提出了分区图 (Partition Map) 表示并设计了 Down-Up CNN 来预测。在帧间编码方面Pan 等人 [24] 融合了亮度分量、残差和运动场特征但只能处理部分 CUTissier 等人 [25] 使用 MobileNetV2 作为骨干网络预测 CTU 分区向量Peng 等人 [26] 建模为分区同质性图 (PHM)但缺乏可调复杂度机制。本文与现有方法的核心差异: 将分区图方法从帧内扩展到帧间并针对帧间编码的特性设计了全新的网络模块和后处理方案。三、分区结构表示3.1 帧内与帧间编码的分区差异观察为了理解帧间编码的分区特性作者使用 VTM-10.0 在不同量化参数 (QP) 下压缩 JVET 测试序列分析了帧内编码 (I-Slice) 和帧间编码 (B-Slice) 之间 CU 尺寸分布的差异。以 BasketballDrive 1920x1080 序列为例观察到以下关键发现B-Slice 中的 CU 倾向于比 I-Slice 更粗粒度地分区即使用更大的 CU。提前终止的 CTU (即整个 CTU 不再分区) 在 B-Slice 中很常见但在 I-Slice 中很少出现。与帧内编码相比128x128 CTU 在帧间编码中的像素占比显著增加。这些差异表明直接将帧内编码的分区图表示应用于帧间编码并不合适需要针对帧间编码的粗粒度分区特性进行改进。3.2 改进的分区图表示原始的分区图 (Partition Map) 包含四个组件表2. 原始分区图的四个组件组件含义取值QT 深度图四叉树分区深度0-4 (CTU128 时)MTT 深度图 (3层)多类型树分区深度每层 0-3MTT 方向图 (3层)分区方向1水平, -1垂直, 0无MTT 掩码 (新增)是否需要 MTT 分区0终止, 1继续MTT 深度图的构建规则当节点通过二叉树 (BT) 分裂时深度增加 1通过三叉树 (TT) 分裂时中间子节点深度增加 1两端子节点深度增加 2。MTT 方向图中水平分裂值为 1垂直分裂值为 -1无分裂为 0。本文的关键改进是引入了MTT 掩码 (MTT Mask)。这是一个与 QT 深度图关联的标志表示 CTU 是否需要进一步进行 MTT 分区MTT Mask 定义: 当 QT 节点或根节点停止进一步分裂时, MTT Mask false (0) 当 QT 节点或根节点需要继续分裂时, MTT Mask true (1) 改进后的分区图 {QT深度图, MTT深度/方向图, MTT掩码}MTT 掩码带来两个关键优势(1) 有效建模帧间编码中粗粒度分区的分布动态避免网络推理的冗余复杂度(2) 通过 MTT 掩码可以实现更灵活的复杂度与编码效率之间的平衡。四、神经网络架构4.1 整体架构概览网络输入: 当前帧的亮度分量 最近前向参考帧 最近后向参考帧 (如果后向参考帧缺失则复制前向参考帧)。网络输出: 完整的分区图 (QT 深度图 MTT 掩码 MTT 深度/方向图)。整体架构采用由粗到细 (Coarse-to-Fine) 的三级空间金字塔结构高分辨率输入对应更细粒度的块分区预测数据流: 输入: 当前帧 I_c, 前向参考帧 I_r1, 后向参考帧 I_r2 数据组 GL_i {I_c, I_r_i} (大尺寸, 原始分辨率) | - 双三次下采样 - GM_i (中尺寸, 1/2 分辨率) | | | - 双三次下采样 - GS_i (小尺寸, 1/4 分辨率) | GS_i - 特征提取 - QT Net - QT深度图 (粗粒度) GM_i - 特征提取 - MTT Mask Net - MTT掩码 (中粒度) GL_i - 特征提取 (选择性) - MTT Net - MTT深度/方向图 (细粒度)这种设计的关键洞察是粗粒度的分区 (如 QT 深度) 可以从低分辨率输入中预测而细粒度的分区 (如 MTT 深度/方向) 需要高分辨率输入。通过这种分层设计既保证了预测精度又降低了计算开销。4.2 时空特征提取从数据组中提取三类特征分别捕获不同的信息表3. 三类时空特征特征类型输入捕获信息输出维度外观特征 f_app当前帧亮度分量纹理复杂度R^(H/r x W/r x Cf)残差特征 f_res当前帧与参考帧的残差运动强度R^(H/r x W/r x Cf)运动特征 f_motion双向光流 (预训练网络)运动方向与幅度R^(H/r x W/r x Cf)每个特征提取模块包含三个卷积层第一层是非对称核卷积层 (AKCL)步长为 2用于学习方向性特征随后是两个步长分别为 2 和 1 的残差块。下缩放因子 r 设为 4。提取的三类特征沿通道轴拼接形成统一的时空特征公式 (1): 时空特征拼接 f_cat [f_app; f_res; f_motion] in R^(H/r x W/r x C) 其中 [; ] 表示沿通道轴拼接, C 32 (实验设定)4.3 QT 深度图预测网络 (QT Net)QT Net 的核心挑战是确保预测的 QT 深度图遵循四叉树分区规则 (称为局部一致性)。本文受到人体姿态估计 [47] 中堆叠沙漏网络的启发提出了堆叠的自顶向下-自底向上处理方法。QT Net 由三个堆叠的压缩感知子网络组成每个子网络生成一个中间 QT 深度图 {QD1, QD2, QD3}取值范围为 {0, 1, 2, 3, 4}。每个子网络采用 3 级沙漏结构在局部和全局上下文中处理特征。训练时计算每个中间预测图与真值的 L1 损失推理时仅使用最终输出 QD3。4.3.1 沙漏块 (Hourglass Block)3 级沙漏块通过自顶向下和自底向上的处理方式有效整合局部和全局上下文。特征通过卷积和双线性插值进行下采样然后通过元素级加法进行上采样和合并。堆叠这种结构可以提高预测精度并保持 QT 深度图的局部一致性。4.3.2 QP 调制层 (QP Modulation Layer)不同帧的压缩级别不同 (尤其 P/B 帧的 slice QP 不同)QP 调制层使网络能适应不同的压缩级别。具体地对沙漏块输出的多尺度特征 f_h 进行全局平均池化 (GAP)得到通道统计量 z然后与 slice QP 的嵌入 z_q 结合计算通道注意力权重公式 (2): QP 调制的注意力权重计算 s Sigmoid(W2 * ReLU(W1 * [z_q; z])) 其中: z GAP(f_h) in R^C (全局平均池化) z_q embedding(slice_QP) in R^C (QP 嵌入) W1 in R^(2C x 2C), W2 in R^(2C x C) (可学习权重) 调制特征: f_q f_h (hadamard) sQP 调制层的核心价值: 同一模型可以根据输入的 slice QP 动态调整预测的分区粒度。QP 越大 (压缩越强)预测的分区结构越粗QP 越小 (压缩越弱)预测的分区结构越细。这使得为 4 个基本 QP 训练的模型可以泛化到 QP 20-39 的范围。4.3.3 引导卷积层 (Guided Convolution Layer, GCNN)受到基于学习的环内滤波器 [48] 启发GCNN 使用二值化的网格图 M 来指示 CTU 边界增强特征的空间定位能力公式 (3): CTU 边界网格图 M(x, y) -1, if x or y mod (128/r) 0 (CTU边界) 1, otherwise (非边界) 操作: 将 M 与调制特征 f_q 沿通道轴拼接, 再通过卷积层 输出: f_out Conv2d(concat(M, f_q))GCNN 的作用是将 CTU 边界信息显式注入网络帮助网络理解块分区的空间结构。这对于帧间编码尤为重要因为帧间编码的分区决策高度依赖于 CTU 边界。4.4 分区自适应变形 (Partitioning-Adaptive Warping, P-Warping)P-Warping 是本文最具创新性的设计之一。其核心思想是在 VVC 帧间编码中基于块的运动补偿假设块内像素运动是一致的。P-Warping 利用预测的 QT 深度图来模拟这一过程将像素级光流转换为块级运动向量场。具体地P-Warping 将原始光流 V 转换为分区自适应光流 V_p公式 (4): 分区自适应光流 V_p SUM_{k0}^{2} [ (QD - floor(QD)) * V^(k1) (ceil(QD) - QD) * V^(k) ] * indicator(k QD k1) 其中: QD 预测的 QT 深度图 (可为小数) floor(.), ceil(.) 向下/向上取整 indicator(.) 元素级指示函数 (条件满足为1, 否则为0) V^(k) 特定粒度的光流公式 (5): 分粒度光流计算 V^(k) upsample(avgpool(V, 2^(7-k)), 2^(7-k)) 即: 先用 2^(7-k) 大小的块做平均池化, 再用最近邻上采样恢复尺寸 k0: 块大小 128 (CTU级) k1: 块大小 64 k2: 块大小 32直观理解: 如果预测的 QT 深度值为 1.2则该块的运动向量计算为 0.8 * V^(1) 0.2 * V^(2)其中 V^(1) 和 V^(2) 分别对应 64x64 和 32x32 粒度的运动向量。这模拟了 VVC 编码器中基于块的运动估计过程。得到 V_p 后用其对参考帧进行变形 (warping)计算对齐后的残差。相比使用原始光流 V 的对齐残差基于 V_p 的对齐残差反映了预测的 QT 分区结果能更好地减少时间冗余从而帮助后续网络识别需要进一步分区的区域。P-Warping 伪代码defP_warping(depth_map,flow,refer_frame,current_frame):p_flow0forkin[0,1,2]:down_stride2**(6-k)up_stride2**(5-k)mask(depth_map.round()k)(depth_map.round()(k1))weight_highF.interpolate((k1-depth_map)*mask,scale_factor8,modenearest)weight_lowF.interpolate((depth_map-k)*mask,scale_factor8,modenearest)flow_highF.interpolate(F.avg_pool2d(flow,down_stride,down_stride),scale_factordown_stride,modenearest)flow_lowF.interpolate(F.avg_pool2d(flow,up_stride,up_stride),scale_factorup_stride,modenearest)p_flowflow_high*weight_highflow_low*weight_low aligned_frameflow_warp(refer_frame,p_flow)residualcurrent_frame-aligned_framereturnresidual4.5 MTT 掩码预测MTT 掩码网络的结构与 QT Net 类似但有以下关键差异输入分辨率从原始分辨率降低一半 (中等尺寸数据组 GM_i)传统的帧间残差被 P-Warping 产生的变形残差替代沙漏块数量为 2 个 (而非 3 个)输出为 MTT 掩码的概率 (2分类: 是否需要 MTT 分区)MTT 掩码的预测至关重要它决定了哪些 CTU 需要进行 MTT 分区从而可以选择性地跳过 MTT Net 的推理大幅降低计算开销。4.6 MTT 深度/方向图预测 (MTT Net)MTT Net 的输入来自高分辨率数据组 GL_i。首先将特征分割为对应各个 CTU 的非重叠方形 patch然后根据预测的 MTT 掩码选择信息量最大的 patch (通过 batch_index_select 函数)丢弃不需要 MTT 分区的 CTU 对应的 patch。MTT Net 采用 Down-Up 架构 (类似 Down-Up CNN [23])包含两个相同的分支分别预测 MTT 深度图和方向图。以深度图为例三个分支逐步预测三层 MTT 深度图 (B1 - B2 - B3)B1 分支: 预测第一层 MTT 深度图 MD0 (使用 3 个堆叠子网络)B2 分支: 以 MTT sub-net2 的输出为输入预测第二层 MD1 (MD0 作为注意力图)B3 分支: 以 MTT sub-net1 的输出为输入预测第三层 MD2 (MD1 作为注意力图)Down-Up 架构允许从较浅的特征生成较深的输出以更高粒度捕获更精细的细节。最终通过 batch_index_fill 函数将 CTU 级的预测图重建为帧级图。4.7 损失函数不同网络部分使用不同的损失函数公式 (6): QT 深度图损失 (L1 中间监督) L_QD (1/3) * SUM_{i0}^{2} L1(QD_i - QD_g) QD_i 第 i 个 QT 子网络预测的深度图 QD_g QT 深度图真值 公式 (7): MTT 掩码损失 (交叉熵) L_Mask L_CE(p_M, M_f) p_M 预测的 MTT 掩码概率 M_f MTT 掩码真值 公式 (8): MTT 深度图损失 (交叉熵 层间差异) L_MD (1/3) * SUM_{n1}^{3} L_CE(p_MD^(n), MD_g^n - MD_g^(n-1)) p_MD^(n) 第 n 层 MTT 深度预测概率 MD_g^n 第 n 层深度真值 公式 (9): MTT 方向图损失 (交叉熵) L_MDir (1/3) * SUM_{n1}^{3} L_CE(p_MDir^(n), MDir_g^n) 公式 (10): MTT 掩码真值定义 M_f 0, if Q MD_g^0 (QT深度已足够, 不需MTT) 1, otherwise (需要MTT分区) 公式 (11): 总损失 L L_QD L_Mask L_MD L_MDirMTT 深度图损失设计了一个巧妙之处预测的是层间差异 (MD_g^n - MD_g^(n-1))而非绝对值。这使得每层的预测可以专注于当前层新增的分区信息降低了学习难度。五、后处理算法5.1 基于地图树的后处理算法神经网络预测的分区图需要转换为符合 VVC 标准的分区模式决策。这一过程通过基于地图树 (Map Tree) 的后处理算法实现继承自 [23] 的工作。算法包含两个阶段候选生成阶段: 使用深度优先搜索顺序从根节点开始遍历所有可能的分区结构生成候选分区图集合。每个节点维护一个临时分区图 (map tree)。最优选择阶段: 使用预定义准则从候选中选择误差最小的分区路径。公式 (12): 分区路径选择准则 Error ||MD_t - MD_p[curMTTdepth]||_1 ||MDir_t - MDir_p[curMTTdepth]||_1 MD_t, MDir_t 临时分区层的深度/方向图 MD_p, MDir_p 预测的深度/方向图 curMTTdepth 当前 MTT 深度5.2 双阈值决策方案双阈值决策方案是本文在复杂度控制方面的核心创新。它基于预测的 MTT 掩码概率值 p_M将所有 CTU 分为三类在神经网络预测和递归 RDO 搜索之间取得灵活平衡表4. 双阈值决策的三种CTU处理方式条件处理方式标记说明p_M th1提前终止 MTT 分区MTT ET网络有信心不需要分区, 直接跳过th1 p_M th2默认 RDO 搜索MTT RDO网络不确定, 交给编码器搜索p_M th2使用网络预测决策MTT NN网络有信心需要分区, 使用MTT Net结果经验设定th1 0.2, th2 0.9。预测的 MTT 掩码值分布呈双峰模式大部分 CTU 的 p_M 接近 0 或 1只有少量落在中间区域。这意味着只有少量 CTU 需要进行耗时的 RDO 搜索。5.2.1 双阈值决策流程伪代码Algorithm: Dual-Threshold Decision Input: current_depth D, max_depth D_max, predicted_QT_depth Q_p, current_QT_depth Q_c, predicted_MTT_mask_prob p_M, thresholds th1, th2 1: if D D_max then 2: return END_CU // 达到最大深度, 结束 3: end if 4: if Q_c Q_p then 5: return QT_SPLIT // QT 深度不够, 继续QT分裂 6: end if 7: // 此时 Q_c Q_p, 进入双阈值判断 8: if p_M th1 then 9: return NON_SPLIT // 提前终止 MTT (MTT ET) 10: else if p_M th2 then 11: return MTT_NN // 使用网络预测 (MTT NN) 12: else 13: return RDO_SEARCH // 默认 RDO 搜索 (MTT RDO) 14: end if5.3 加速级别定义本文定义了两种加速级别粗粒度加速级别 Ln: 通过剪枝分区图实现n 从 0 到 3对应分区图的四层。例如 L0 仅使用最低分辨率输入预测 QT 深度图L1 同时使用 QT 深度图和第一层 MTT 深度/方向图。细粒度加速级别: 通过双阈值决策方案实现。例如 L1(th1, th2) 表示 p_M th1 的 CTU 跳过 MTT 分区p_M th2 的 CTU 执行 MTT Net 决策其余执行默认 RDO 搜索。六、实验结果6.1 实验配置训练数据集: 从 BVI-DVC、Tencent Video Dataset (TVD) 和 UVG 数据集中收集 2,672 个序列处理为 32 帧的短序列分辨率包括 3840x2160、1920x1080、960x544 和 480x272。使用 VTM-10.0 在 RA 配置 (GOP32) 下以 4 个基本 QP {22, 27, 32, 37} 压缩提取块分区结果并转换为分区图。训练策略: 分两阶段训练共 1200 个 epoch。第一阶段分别训练 QT 深度图 (500 epoch)、MTT 掩码 (300 epoch) 和 MTT 深度/方向图 (300 epoch)已训练部分梯度冻结。第二阶段联合训练 100 epoch。使用 Adam 优化器第一阶段学习率 1e-3第二阶段 1e-4每 10 个 epoch 衰减 0.98 (第一阶段) 或 0.9 (第二阶段)。训练在 8 块 1080Ti GPU 上进行约需两周。评估配置: 集成到 VTM-10.0使用 JVET 通用测试条件22 个测试序列的前 65 帧4 个基本 QP {22, 27, 32, 37}RA 配置。评估指标: BDBR (Bjontegaard Delta Bit Rate越小越好) 和 ETS (Encoding Time Saving越大越好)。注意该方法仅加速 P/B 帧不加速 I 帧。6.2 与现有方法的对比在低复杂度减少设置下本文方法与 4 种先进方法 [24][25][26][27] 进行对比表5. 低复杂度减少设置下的性能对比方法平均 BDBR (%)平均 ETS (%)特点Pan et al. [24]3.3733.19CNN 融合多特征Tissier et al. [25]2.1144.80MobileNetV2 骨干Peng et al. [26]1.9145.64分类-预测联合框架Lin et al. [27]2.3345.30对比学习Ours L0(0, 1)1.6644.39本文, 最低加速Ours L1(0.2, 1)2.1251.30本文, 推荐加速关键发现: 在相似的 RD 性能损失下本文方法比 Tissier et al. [25] 多节省 6.5% 的编码时间比当前最优方法 Peng et al. [26] 的 BDBR 低 0.31%且支持多级复杂度控制。在高加速设置下 (L1(0.2, 0.9))可节省 63.21% 的编码时间BDBR 仅 5.31%。6.3 与帧内编码快速算法的组合由于本文方法不加速 I 帧作者还测试了与帧内编码快速算法 [23] 的组合效果表6. 帧内帧间组合加速效果方案BDBR (%)ETS (%)仅帧内 (Intra) [23]0.974.53仅帧间 (Inter, 本文)2.1251.30帧内帧间组合2.8455.64简单相加 (理论值)3.0955.83重要发现: 组合后的 BDBR (2.84%) 低于简单相加值 (3.09%)这是因为加速 I 帧不仅影响 I 帧本身还通过帧间依赖影响 B 帧。I 帧质量下降导致 B 帧的参考质量降低产生重叠的 RD 损失。6.4 预测精度表7. 网络输出和后处理后分区图的精度 (%)QPQDMTT MaskMD1MDir1MD2MDir2MD3MDir3平均2263.6484.4963.6456.1045.2563.2246.4173.7161.932771.2584.0368.1161.4656.2876.8156.7087.4870.053276.3684.0869.2364.8962.0981.7162.6491.1673.833780.0786.1971.4470.7368.8882.7969.1784.8376.53平均72.8384.7068.1063.3058.1376.1358.7384.2970.58发现: QT 深度图在预测前后精度稳定证明了沙漏块带来的局部一致性MTT 掩码精度最高 (84.70%)随着分区深度增加深度图精度下降但方向图精度提升 (因为方向图中零值比例更高)。6.5 鲁棒性分析6.5.1 对基本 QP 的鲁棒性作者将 4 个基本 QP 模型扩展到 QP 20-39 的范围评估了在 20 个 QP 上的性能变化表8. 扩展 QP 的性能偏差加速级别delta BDBRdelta ETSL0(0, 1)-8.78%0.36%L0(0.2, 1)0.37%1.08%L1(0.2, 0.9)-13.50%0.24%结果表明在 L1(0.2, 0.9) 级别扩展 QP 甚至获得了 13.50% 的编码增益证明 QP 调制层使模型能有效泛化到不同 QP。6.5.2 对软件版本的鲁棒性在 VTM-10.0 和 VTM-23.0 上评估 (GOP32)结果表明编码时间节省保持稳定。VTM-23.0 相比 VTM-10.0 的 BDBR 增加 0.43%-0.85%归因于训练和测试数据集之间的软件版本不匹配。考虑到可接受的 RD 损失方法对不同软件版本具有鲁棒性。6.6 消融实验消融实验分为三类6.6.1 重复自顶向下-自底向上处理w/o HourglassBlock: 将沙漏块替换为计算复杂度相当的密集块 (Dense Block)。移除后预测精度显著下降特别是小块的分区预测能力变差。w/o InterLoss: 移除中间监督 (公式6)仅基于最终输出训练。最终精度接近但缺乏渐进式改进导致预测不一致 (违反四叉树规则的比例增加)。完整模型: 不仅提高预测精度还改善与四叉树分区规则的结构一致性减少对后处理的依赖。6.6.2 运动相关技术w/o Motion: 移除运动特征 (光流和残差设为常量)。显著影响编码效率与复杂度之间的平衡证明运动特征的重要性。w/o Pwarp: 用标准变形替代分区自适应变形。在 L1(0.2, 0.9) 加速级别产生明显的 RD 损失因为标准变形未考虑浅层分区结果。6.6.3 其他技术w/o QML: QP 调制层输入设为常量。RD 性能受影响证明压缩感知能力的重要性。w/o GCNN: 移除引导卷积层。RD 性能受影响证明 CTU 边界信息的作用。6.7 双阈值选择分析th1 从 0.1 到 0.4 变化时BDBR 逐渐增加ETA 也增加。th1 从 0.1 增加到 0.2 时BDBR 增加 0.3%ETA 从 1.95 增加到 2.09。但 th1 超过 0.2 后ETA 增长放缓。因此选择 0.2 作为最优 th1此时平均 34.72% 的 CTU 被提前终止 MTT 分区。表9. 各类CTU被MTT掩码提前终止的比例 (%)ClassQP22QP27QP32QP37平均A12.2923.7036.1849.3330.38B9.3520.4348.4752.3232.64C1.808.2511.2116.359.40E39.2468.4676.6081.5766.47平均15.6730.2143.1149.8934.726.8 复杂度分析6.8.1 神经网络推理开销光流网络作为即插即用模块可与其他帧间编码快速算法共享。QT 深度图预测5.07 GFLOPs1.11M 参数 (单帧 1080p)。QT MTT 掩码7.37 GFLOPs3.64M 参数。对比Tissier et al. [25] 使用 MobileNetV23.4M 参数本文参数量相当。6.8.2 时间消耗分析表10. 不同加速级别的时间消耗分解 (秒/帧, CPU)加速级别T_ENCT_NETT_POSTrho (%)L0(0, 1)426.071.100.100.46L0(0.2, 1)366.802.790.101.08L1(0.2, 0.9) CPU256.9411.140.765.42L1(0.2, 0.9) GPU256.940.960.760.90在 L1(0.2, 0.9) 加速级别CPU 推理开销为 5.42%使用 GPU 后降至 0.90%。4K 序列的 GPU 推理时间为 2.46 秒/帧凸显了 GPU 并行计算对实现显著编码时间减少的必要性。七、训练策略详解7.1 两阶段训练训练分为两个阶段对应空间金字塔的三个层级表11. 详细训练策略层级模块学习率衰减率BatchSize(4K)EpochsS (小)QT深度图1e-30.98160500M (中)MTT掩码1e-30.9832300L (大)MTT深度/方向1e-30.988300联合全部1e-40.98100第一阶段: 依次训练各层级的模块已训练模块的梯度被冻结。不同层级使用不同 batch size 以充分利用计算资源。分辨率每 5 个 epoch 切换一次。第二阶段: 联合训练整个网络学习率降低到 1e-4衰减率 0.9使用较小的 batch size (8) 进行精细调优。所有参数使用 Xavier 初始化使用 Adam 优化器。分别为 4 个基本 QP {22, 27, 32, 37} 训练独立模型。7.2 训练数据集构建表12. 训练数据集来源来源分辨率序列数帧数/序列GOPsBVI-DVC [54]3840x217620064400TVD [55]3840x21608665172UVG [56]3840x216016300-60096总计-302-668668 个 4K GOP 通过双线性插值下采样到 1920x1080、960x544 和 480x272 三个分辨率。使用 VTM-10.0 在 RA 配置 (GOP32, intraperiod32) 下编码禁用了多个快速算法 (PBIntraFast, FastMrg, AMaxBT 等) 以确保准确的块分区结果。最终提取的分区数据使用 HDF5 格式高效管理。八、后处理算法详解8.1 地图树生成算法地图树 (Map Tree) 生成算法将网络预测结果转换为标准兼容的分区决策。算法采用递归结构为每个 CTU 生成所有可能的分区路径并选择误差最小的路径。Algorithm 1: Generate the Optimal Map Tree DataStructure MapNode: curQD // 当前QT深度 curMD // 当前MTT深度 curMDir // 当前MTT方向 treeDepth // 树深度 children // 子节点列表 cus // 当前CTU的所有CU function GENERATE_MAP_TREE(node): if node.treeDepth maxTreeDepth: return end if modeSet empty set for each cu in node.cus: modeSet_cu GET_CANDIDATE_MODES(cu) // 剪枝: 笛卡尔积 modeSet modeSet x modeSet_cu end for for each mode_cus in modeSet: Create child node based on mode_cus: node_c GENERATE_MAP_TREE(node_c) // 递归 node.children node.children {node_c} end for function GET_CANDIDATE_MODES(cu): modeSet_cu empty set Generate temporary QT depth map: QD_t C QD_t - QD_p // 与预测值的差 if number of negative values in C th_qt: modeSet_cu modeSet_cu {qt} // QT分裂候选 end if for each mode in {no, bth, btv, tth, ttv}: Generate temporary partition layer: MD_t, MDir_t error ||MD_t - MD_p[curMTTdepth]||_1 ||MDir_t - MDir_p[curMTTdepth]||_1 if error th_mtt: modeSet_cu modeSet_cu {mode} end if end for return modeSet_cu 模式说明: no 不分裂 bth 水平二叉树分裂 btv 垂直二叉树分裂 tth 水平三叉树分裂 ttv 垂直三叉树分裂 qt 四叉树分裂8.2 编码时间测量的统计方法为确保编码时间测量的可靠性作者使用了基于 t 分布的统计测试方法公式 (18): 编码时间统计测试 2 * (sigma / sqrt(m)) * t_alpha(m-1) beta * E_enc_bar m 测量次数 sigma 测量值的标准差 beta 最大允许偏差 (设为 0.01, 即1%) alpha 满足beta条件的概率 (设为 0.99, 即99%置信度) t_alpha Student t分布的临界值 E_enc_bar 测量序列的平均编码时间当重复编码次数超过 M8 次时使用 Tukey 围栏法 (Tukey’s Fences) 基于四分位数和四分位距 (IQR) 剔除异常值。这种严谨的测量方法确保了实验结果的统计可靠性。九、总结与批判性分析9.1 论文总结本文从表示、神经网络架构和后处理算法三个角度提出了基于分区图的 VVC 帧间编码快速块分区方法。通过引入 MTT 掩码设计了由粗到细的神经网络 (集成沙漏块、QP 调制层、分区自适应变形等创新模块)并提出了双阈值决策方案实现灵活的复杂度-性能平衡。实验表明该方法在 RA 配置下实现了 51.30% 的编码时间节省BDBR 仅增加 2.12%优于现有方法。9.2 核心创新点评价MTT 掩码: 这是一个简洁但有效的设计。它将帧间编码中粗粒度分区的特性显式建模既简化了网络推理 (可跳过不需要 MTT 分区的 CTU)又为后处理提供了灵活的控制手段。分区自适应变形 (P-Warping): 这是最具创意的贡献。将神经网络预测的 QT 深度图用于调制光流模拟 VVC 编码器中基于块的运动估计使残差特征更好地反映分区需求。这种将编码器内部机制融入神经网络设计的思路值得借鉴。双阈值决策: 将网络预测的不确定性显式建模通过两个阈值将 CTU 分为三类 (确定终止、不确定、确定分裂)在保证 RD 性能的同时最大化加速效果。这种设计比单阈值更灵活也比全信任网络更安全。堆叠沙漏块 中间监督: 受人体姿态估计启发通过反复的自顶向下-自底向上处理使网络逐步学习四叉树分区规则提高局部一致性。这减少了后处理的负担是端到端学习分区结构的有效策略。9.3 局限性分析论文自身指出两个主要局限光流网络计算开销高: 预训练的光流网络 (SpyNet) 在资源受限设备上部署困难。尽管可以作为共享模块但其推理时间仍是整体开销的重要组成部分。环外 (Out-of-loop) 实现: 快速算法无法获取编码上下文信息限制了模型对各种编码环境的自适应能力。这意味着网络预测基于帧级信息而非 CTU 级的精确编码状态。其他值得关注的局限训练成本高: 8 块 1080Ti GPU 训练两周且需为每个基本 QP 训练独立模型 (4个模型)虽然通过 QP 调制层可以泛化到扩展 QP但训练成本仍然显著。仅支持 RA 配置: 论文未评估低延迟 P (LDP) 和低延迟 B (LDB) 配置而这些配置在实时通信场景中更为重要。GPU 依赖: 在高加速级别 (L1(0.2, 0.9)) 下4K 序列的 GPU 推理时间仍达 2.46 秒/帧对于实时编码场景可能不够。预测精度随深度下降: MTT 深度/方向图的预测精度在更深层级显著下降特别是 Class C (小分辨率) 序列的 MTT 掩码提前终止比例很低 (平均 9.40%)可能限制了在低分辨率场景的加速效果。9.4 未来方向降低计算复杂度: 探索更轻量级的光流估计方法或替代方案使方法能在资源受限设备上部署。集成到编码环内: 将快速算法集成到 VTM 编码器内部利用编码上下文信息提升预测精度和适应性。扩展到其他帧间模式: 将方法扩展到 LDP (低延迟 P 帧) 和 LDB (低延迟 B 帧) 配置覆盖更多应用场景。9.5 技术启示本文为视频编码加速领域提供了几个重要启示分层表示 由粗到细预测: 通过空间金字塔结构将不同粒度的分区预测分配给不同分辨率的输入兼顾精度和效率。这一范式可推广到其他分层决策任务。编码先验融入网络设计: P-Warping 将 VVC 的块运动补偿机制融入特征提取QP 调制层将压缩级别信息注入网络。将领域知识嵌入网络架构而非仅依赖数据驱动学习是提升性能的有效途径。不确定性感知的决策: 双阈值方案显式处理网络预测的不确定性在高置信区域信任网络在低置信区域回退到 RDO 搜索。这种策略平衡了效率和安全可推广到其他需要神经网络与传统算法协作的场景。中间监督提升结构一致性: 通过在每个沙漏阶段提供监督信号引导网络逐步学习分区规则而非仅依赖最终输出。这种渐进式学习策略对于需要满足结构约束的预测任务具有参考价值。十、核心参考文献[1] B. Bross et al., “Overview of the Versatile Video Coding (VVC) standard,” IEEE TCSVT, 2021.[5] F. Bossen et al., “VVC complexity and software implementation analysis,” IEEE TCSVT, 31(10): 3765-3778, 2021.[23] A. Feng et al., “Partition map prediction for fast block partitioning in VVC intra-frame coding,” IEEE TIP, 32: 2237-2251, 2023.[25] A. Tissier et al., “Machine learning based efficient QT-MTT partitioning for VVC inter coding,” IEEE ICIP, 2022.[26] Z. Peng and L. Shen, “A classification-prediction joint framework to accelerate QTMT-based CU partition of inter-mode VVC,” Electronics Letters, 59(7): e12770, 2023.[29] A. Ranjan and M. J. Black, “Optical flow estimation using a spatial pyramid network,” CVPR, 2017.[46] C. Tang et al., “Offline and online optical flow enhancement for deep video compression,” AAAI, 38(6): 5118-5126, 2024.[47] A. Newell et al., “Stacked hourglass networks for human pose estimation,” ECCV, 2016.完整参考文献列表请参见原论文。