神经编码不是“AI 调参数”:看懂下一代视频编码的本质变化
过去三十多年,视频编码技术一直沿着一条非常清晰的路线发展:从 MPEG-2、H.264,到 H.265/HEVC,再到更新一代的视频编码技术,核心目标始终没有改变——用尽可能少的数据,描述尽可能接近原始画面的视觉信息。
今天,AI 开始进入视频编码领域,“神经编码”“学习式编码”“Neural Codec”等概念越来越多。但很多人第一次接触这些技术时,会自然地认为:所谓神经编码,是不是就是让 AI 帮 H.265 调调参数、优化一下码率?
其实并不是。
真正意义上的神经编码,改变的不是某一个编码参数,而是在重新思考一个更底层的问题:视频应该怎样被表示、预测和压缩,这套规则一定要完全由人来设计吗?
传统编码的基本方法,是由视频编码专家设计预测、变换、量化、熵编码等算法,再让编码器在这些既定工具中寻找最优组合;神经编码则尝试把其中越来越多的过程交给神经网络学习,让模型从大量数据中自己寻找更有效的视频表示方式。
这才是两者真正的分水岭。
一、传统视频编码到底在压缩什么?
理解神经编码之前,首先要理解传统视频编码为什么能够把庞大的原始视频压缩几十倍甚至上百倍。
一帧未经压缩的高清视频,本质上是一大片像素数据。如果把 1920×1080、30fps 的原始 YUV 视频直接通过网络传输,带宽消耗会非常巨大。但真实世界的视频有一个非常重要的特点:大量信息其实是重复的。
例如一个固定摄像头拍摄会议室,墙壁几十秒可能都没有变化;人物虽然在运动,但身体的大部分区域只是从一个位置移动到了另一个位置;同一帧中相邻像素往往也非常接近。于是编码器没有必要每一帧都重新告诉解码器“这里是什么颜色”。

传统视频编码实际上一直在做三件事情:预测、计算差异、只编码那些无法预测的信息。
帧内预测利用当前画面内部像素之间的相关性,帧间预测则利用前后视频帧之间的时间相关性。编码器找到一个比较接近当前图像的预测结果,然后只记录预测结果和真实图像之间的差异,也就是残差。残差再经过变换、量化和熵编码,最终形成我们看到的 H.264、H.265 等码流。
所以从工程角度看,H.264、H.265 并不是简单地“把图片压缩小一点”,而是在不断回答一个问题:
哪些信息可以预测,哪些信息必须真正发送?
几十年来,视频编码技术的大部分进步,都来自预测越来越准确、表示残差越来越高效、熵编码越来越接近信息理论极限。
二、神经编码真正改变的是“谁来设计压缩方法”
如果只看最终目的,传统编码和神经编码其实没有区别:都希望在更低码率下获得更好的画质。
真正不同的是实现方法。
传统视频编码更像是一套由专家设计的大型工具箱。编码标准会规定可以怎样划分图像块,可以有哪些预测模式,可以怎样进行运动补偿,可以采用哪些变换方式,如何量化,如何组织码流。编码器所做的事情,是在这些已经定义好的工具里面寻找一个尽可能优秀的组合。

神经编码进一步改变了这个过程。
它开始尝试让神经网络自己学习:一幅图像或者一段视频中,到底哪些信息最重要,哪些信息可以被预测,哪些特征应该保留下来,以及这些信息怎样组织才能用更少的 bit 表达。
典型的端到端学习式图像或视频编码,可以理解成这样一条链路:
原始图像或视频 → 神经编码网络 → 潜在特征表示 → 量化与熵编码 → 码流。
解码端则完成相反过程:
码流 → 特征恢复 → 神经解码网络 → 重建图像或视频。
这里最重要的概念叫做 Latent Representation,也就是潜在特征表示。
传统 Codec 中,我们习惯看到运动矢量、预测模式、变换系数、残差等非常明确的编码元素;而在神经编码中,网络可以通过训练形成自己的一套内部特征表示。工程师不再需要完全人工规定“视频必须按照什么数学方式描述”,模型开始参与决定“什么样的信息表达方式更高效”。
因此,神经编码最本质的变化并不是“编码器用了 AI”,而是:
视频表示方法本身开始从人工设计走向数据驱动学习。
三、传统编码与神经编码,差别究竟在哪里?
如果把两种路线放在一起比较,会更加直观。
| 对比维度 | 传统视频编码 | 神经/学习式编码 |
|---|---|---|
| 核心设计方式 | 专家设计编码工具 | 模型从数据中学习 |
| 视频表示 | 预测、运动矢量、残差、变换系数 | Learned Latent Features |
| 图像变换 | 人工设计数学变换 | 神经网络学习非线性变换 |
| 时间预测 | 运动估计、运动补偿 | 可学习时间特征和上下文 |
| 概率建模 | 人工设计概率模型 | Learned Entropy Model |
| 优化方式 | 搜索已有编码模式 | 训练网络参数 |
| 可解释性 | 较强 | 相对较弱 |
| 硬件生态 | CPU/GPU/DSP/ASIC 非常成熟 | GPU/NPU 等 AI 算力更加重要 |
| 部署成熟度 | 已形成完整产业链 | 仍处于快速工程化阶段 |
这里最关键的区别仍然不是压缩率,而是“设计空间发生了变化”。

传统编码是人类首先设计好道路,编码器负责寻找走哪条路最快;神经编码则开始尝试让模型自己参与修路,甚至决定哪些路根本没有必要存在。
但两者背后的理论并没有完全割裂。不管采用哪一种方式,编码系统最终都必须在两个目标之间权衡:一边是“码率要尽量低”,另一边是“画质损失不能太大”。传统编码一直称之为率失真优化,神经编码同样需要解决这个问题,只是优化对象从传统编码参数进一步扩展到了整个网络模型。
所以神经编码并不是推翻几十年的视频编码理论,而是换了一种寻找最优解的方法。
四、今天所谓的“AI 编码”,其实至少有三条路线
目前市场上很多产品都会提到“AI 编码”,但这些技术之间差别非常大。如果不加区分,很容易把完全不同的东西混为一谈。

第一类是 AI 辅助传统编码。底层码流依然是 H.264、H.265 等传统标准,AI 主要负责场景识别、内容复杂度分析、码率控制、ROI 判断、QP 决策、降噪、超分辨率或者画质增强。它的最大优势是不会破坏现有产业生态,播放器、硬件解码器、CDN 和现有音视频系统基本都可以继续使用,因此也是目前最容易实现大规模商业落地的一条路线。
第二类是 传统 Codec 与 Neural Network 的混合架构。传统编码框架仍然存在,但把某些模块逐渐换成学习式算法,例如使用神经网络进行预测、滤波、概率估计或者部分运动建模。这条路线非常值得关注,因为它能够利用传统 Codec 成熟的工程体系,同时逐渐吸收 AI 算法的优势。
第三类才是真正意义上的 端到端 Learned Codec。从输入图像或视频,到生成压缩表示,再到恢复图像,主要过程都由训练得到的网络完成。近几年学习式图像压缩已经率先走向标准化,而学习式视频编码也在持续向实时化、硬件化和标准化方向演进。
因此未来的视频编码很可能不是“传统 Codec 和 Neural Codec 二选一”,而会形成相当长时间的混合演进过程。
五、为什么神经编码有可能突破传统编码的效率?
传统视频编码已经高度成熟,但它始终面临一个限制:算法必须能够被工程师理解、标准化并最终做成芯片。
很多编码模块因此必须具有相对明确的数学结构。而神经网络可以拟合非常复杂的非线性关系,能够在大量视频数据中自动寻找人类很难显式设计出来的统计规律。

例如,对于传统编码器而言,它看到的是像素、块、运动矢量和残差;而一个训练充分的神经网络,有可能进一步学习到纹理、轮廓、对象结构以及更加复杂的时间相关性。
神经编码的第二个优势来自概率建模。所有压缩算法本质上都在利用“某些信息出现概率高,某些信息出现概率低”这个原则。如果能够更加准确地预测某个符号或者潜在特征出现的概率,就有机会用更少的 bit 表达它。神经网络非常擅长复杂概率分布建模,因此 Learned Entropy Model 已经成为学习式压缩中的核心技术之一。
第三个优势来自时域信息建模。传统视频编码非常依赖运动估计和运动补偿,而学习式视频编码可以把历史帧、隐空间特征和上下文共同纳入模型,让网络自己学习哪些时间信息真正值得保留。
但这并不意味着神经编码已经全面优于传统编码。对于实时音视频系统来说,压缩率从来不是唯一指标。真正能够进入产业,还需要同时考虑编码速度、解码速度、功耗、显存占用、NPU/GPU 性能、端到端延迟以及不同硬件平台的一致性。
Codec 从来不是“谁压得最小谁就赢”,而是压缩率、复杂度、延迟、功耗和生态共同决定最终结果。
六、神经编码真正难的地方,可能并不是算法
如果只看论文,很容易产生一种感觉:只要 BD-Rate 再下降一些,神经 Codec 很快就可以取代 H.265。
实际工程远没有这么简单。

传统视频编码经过几十年发展,已经拥有非常成熟的硬件生态。手机 SoC、摄像机芯片、GPU、DSP、电视芯片中都存在成熟的视频硬件编解码单元。一个 H.265 解码器可以用极低功耗持续解码高清视频,这是纯软件神经网络很难轻易替代的。
神经 Codec 则会引入更多新的工程变量,例如模型大小、模型版本、算子兼容、NPU 精度、量化方式以及不同 AI 芯片上的推理差异。过去 Codec 关注的是“Bitstream 是否符合标准”,未来可能还需要关注“这个设备有没有对应模型”“这个 NPU 能否运行这些算子”“模型版本是否兼容”。
这实际上会把 Codec Compatibility 从传统意义上的:
支持 H.264 / H.265 哪些 Profile。
进一步扩展成:
Codec + Model + Hardware Capability。
另外还有一个非常重要的问题:生成式能力不一定适合所有视频。
对于娱乐视频,只要重建后的草地“看起来像草地”,用户可能就可以接受;但在安防监控、工业检测、执法记录或者机器视觉中,我们关心的是原始画面中到底有没有某个细节。如果神经网络为了主观视觉效果生成了原视频不存在的纹理,那么即使看起来更漂亮,也可能破坏信息真实性。
因此未来视频质量评价很可能越来越明显地分成两个方向:
给人看的画质,关注主观感受;
给机器看的画质,关注特征和任务准确率。
这也是神经编码时代一个非常重要的变化。
七、最值得关注的趋势:视频正在从“给人看”变成“给人和机器一起看”
传统视频产业默认了一条非常经典的数据链路:
摄像头 → 视频编码 → 网络传输 → 视频解码 → 人观看。
但在今天的无人机、机器人、工业视觉、智能摄像机和具身智能系统中,很多视频数据最终首先面对的并不是人,而是 AI。

传统的处理过程通常是:
Camera → H.264/H.265 → 网络 → 解码成 YUV/RGB → AI 再提取特征。
这里存在一个非常值得思考的问题:既然最终消费者本来就是 AI,那么我们是否一定需要先把所有视觉信息恢复成完整视频,再让神经网络重新提取一次特征?
未来完全可能出现另外一种链路:
Camera → Neural Feature → Feature Compression → Network → Cloud AI。
甚至同时存在两条数据:
一条给人观看;
另一条直接给机器理解。
这也是 Video Coding for Machines、Feature Coding for Machines 等方向越来越受关注的原因。
一旦走到这一步,视频编码讨论的就不再只是“H.265 后面是什么 Codec”,而是在重新思考:
我们究竟应该传输像素,还是应该传输视觉信息本身?
对于机器人、无人机、具身智能和工业视觉而言,这个问题的重要性甚至可能超过单纯提升 10% 或 20% 的压缩效率。
八、从 SmartMediaKit 看神经编码:真正的优势是媒体架构足够开放
从大牛直播 SDK(SmartMediaKit)的角度看,面对神经编码,最重要的并不是现在立即宣布支持某一种实验性的 Neural Codec,而是现有音视频架构能不能容纳未来的新 Codec。
SmartMediaKit 长期围绕实时音视频构建的,并不仅仅是一套 H.264/H.265 解码器,而是一条完整的 Media Pipeline:包括采集、编码、解码、网络传输、时间戳处理、音视频同步、软硬件解码、原始视频数据回调、渲染、多实例以及不同协议的适配。

这种架构对于未来 Neural Codec 有一个非常明显的先天优势:
Codec 并不是整个音视频系统本身。
如果未来增加一种新的 Neural Codec,理想情况下变化的应该主要集中在 Codec Layer,而不是重新设计网络 IO、线程模型、时间戳体系、音视频同步、渲染、连接管理和业务层 API。
例如未来完全可能出现下面这样的结构:
Camera / External Video Input
↓
Pixel Format Layer:YUV / NV12 / RGB
↓
Codec Abstraction Layer
↓
Traditional Codec Backend / Neural Codec Backend
↓
Encoded Media
↓
Transport / Recording / Playback / Processing
SmartMediaKit 现有的原始视频输入、解码后 YUV/RGB 数据回调、软硬件解码路径以及外部媒体数据接口,本质上已经具备了一定程度的 Codec-Neutral 思路。未来如果 Neural Codec 真正进入移动端和嵌入式平台,更合理的方式也是将其作为新的 Codec Backend 接入,而不是推翻现有媒体架构。
当然,这里必须明确区分两个概念:
“架构能够较好地兼容 Neural Codec”并不等于“SmartMediaKit 当前已经支持某个 Neural Codec”。
对于一个基础音视频 SDK 来说,保持这样的技术边界,反而比追逐短期概念更加重要。
九、神经编码真正带来的变化,是从“编码像素”走向“编码信息”
如果只从 Codec 产品命名来看,很容易把视频编码历史理解成:
H.264 → H.265 → 下一代 Codec。
但如果把时间尺度拉长,会看到另一条更加重要的技术主线。
过去的视频编码一直在解决:
怎样用更少的数据恢复像素。
未来的视频编码可能越来越多地需要回答:
这些数据到底是给谁使用的?
如果是给人观看,就优化视觉质量;如果是给 AI 使用,就可能更加关注目标、轮廓、深度、运动和高层语义特征;如果既给人又给机器,就需要建立能够同时服务两种消费者的媒体表示方式。
因此神经编码最大的意义,可能最终并不是把 H.265 的 2Mbps 再压到 1.5Mbps。

它真正打开的是一个更大的技术空间:
传统视频编码关注 Pixel;
神经编码开始关注 Feature;
机器视觉编码进一步关注 Task;
未来媒体基础设施则可能同时处理 Pixel + Feature + Metadata + AI Result。
这对于 SmartMediaKit 这样的底层音视频框架尤其重要。未来真正具有生命力的媒体 SDK,不应该只押注某一种 Codec,而应该把采集、Pixel Format、Codec、Transport、Processing、AI 和 Rendering 之间的边界设计清楚。
今天可以连接成熟的传统硬件 Codec,未来可以加入 AI 辅助编码、Hybrid Neural Codec,甚至进一步处理机器视觉 Feature。
技术变化越快,基础设施越需要保持稳定。
这也是我们看待神经编码最值得坚持的一个工程观点:
未来发生变化的可能是 Codec,甚至可能是整个视觉表示方式;但优秀的媒体基础设施,应该能够容纳这种变化,而不是被某一种编码技术绑死。
从这个角度看,神经编码真正推动的并不只是一次新的压缩率竞赛。
它正在推动视频行业从:
“怎样编码像素”
逐渐走向:
“怎样编码真正有价值的视觉信息”。
而这,很可能才是下一代视频技术真正值得关注的方向。
📎 CSDN官方博客:音视频牛哥-CSDN博客
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)