作者:Kedar Tatwawadi, Parisa Rahimzadeh, Zhanghao Sun, Zhiqi Chen, Ziyun Yang, Sanjay Nair, Divija Hasteer, Oren Rippel
学习型编解码器相对于其硬编码的传统同类产品,一个主要区别在于它们能够直接针对人类视觉系统进行优化。尽管有这种潜力,但一种既符合感知特性又实用的图像编解码器尚未被提出。在这项工作中,我们旨在弥合这一差距。我们对决定实用型学习图像编解码器设计的关键建模选择进行了全面研究,这些选择共同优化了感知质量和运行时性能——包括消融实验中的若干新颖技术。随后,我们对数百万个骨干网络配置执行了性能感知的神经架构搜索,以识别出在达到目标设备端运行时的同时,最大化感知指标所衡量的压缩性能的模型。我们结合各种优化方案,构建了一种新的编解码器,它在速度与感知质量之间实现了显著改善的权衡。基于严格的主观用户研究,与 AV1、AV2、VVC、ECM 和 JPEG-AI 相比,它节省了 2.3–3 倍的码率;与最佳的学习型编解码器替代方案相比,节省了 20–40% 的码率。同时,在 iPhone 17 Pro Max 上,它编码 1200 万像素图像的速度快至 230 毫秒,解码速度为 150 毫秒——比大多数顶尖的基于机器学习的编解码器在 V100 GPU 上运行的速度还要快。
相关阅读与更新。
基于语音的自然头部运动生成
为具身对话智能体合成伴随语音的自然头部运动,对于提供丰富的交互体验是必要的。以往的大多数工作通过使用客观指标将生成的头部运动与单一真实值进行比较来评估其质量。然而,伴随一段语音话语,存在许多合理的头部运动序列。在这项工作中,我们研究了头部运动感知质量的变化……
使用多视角的神经人脸视频压缩
深度生成模型的最新进展催生了神经面部视频压缩编解码器的发展,这类编解码器所使用的带宽比传统工程编解码器低一个数量级。这些神经编解码器通过扭曲源帧,并利用生成模型来补偿扭曲后源帧中的瑕疵,从而重建当前帧。在此过程中,扭曲信息通过少量关键点而非密集光流场进行编码和传输……