这几年,一个在音视频行业做得稍微久一点的人,大概都会产生一种复杂的感受:一方面,传统音视频技术看起来越来越成熟,播放器、推流、转码、视频会议、直播这些曾经非常有技术门槛的事情,正在快速标准化、云服务化和开源化;另一方面,视频的数量却没有减少,反而正在以更快的速度进入机器人、无人机、工业视觉、智慧电力、智能汽车、智能穿戴和各类 AI 系统。

于是,一个看似矛盾的问题出现了:音视频技术本身越来越“基础设施化”,但音视频数据却越来越重要。

这也是为什么今天再讨论“音视频行业还有没有未来”,已经不能只看直播行业增长多少、视频会议市场有多大,也不能简单地看 RTMP、WebRTC 或某个编码格式是不是还热门。更值得关注的是,音视频在整个数字技术体系中的位置正在变化。过去它主要解决的是“人与内容之间的连接”,未来它越来越多地承担“物理世界与数字智能之间的连接”。

从这个角度看,音视频行业不是在消失,而是在换位置。真正可能消失的,是一部分曾经依靠信息差、API 熟练度和单点功能形成的技术优势;真正值得重新建立的,是对实时媒体系统、复杂网络、设备端、边缘计算和机器视觉之间关系的理解。


一、传统音视频的“黄金时代”结束了,但这并不意味着行业衰退

回头看过去二十年的音视频行业,很多今天习以为常的事情,当年都具有很高的技术门槛。一个稳定的 H.264 播放器、一套 RTMP 推流 SDK、一套跨平台硬件解码方案,甚至仅仅是把 Android、iOS、Windows 上的音视频同步做好,都需要长期积累。播放器黑屏、花屏、音画不同步、Surface 生命周期异常、硬解兼容、时间戳跳变、网络重连,这些问题足以支撑一家专业公司的技术壁垒。

今天情况已经不同。操作系统不断上收底层能力,硬件厂商提供成熟的视频编解码器,开源基础设施极大降低了实现门槛,AI 又进一步降低了编写协议解析、媒体处理和业务代码的成本。过去一个工程师可能需要几天才能完成的模块,今天借助成熟框架和 AI,几个小时就可以搭起原型。

因此,如果所谓“音视频技术”仍然只是会调用 FFmpeg、会解 H.264、会拉一个 RTSP、会写一个 RTMP 推流,那么它的稀缺性确实会越来越低。这是一个必须面对的现实。

但技术门槛下降和行业价值下降并不是一回事。数据库越来越成熟,并没有让数据库消失;网络协议越来越标准化,也没有让网络基础设施变得不重要。恰恰相反,当一项技术从少数人的专业能力变成整个社会的基础设施后,它的使用范围往往会进一步扩大,只是价值会从“会不会做”转向“能不能把它做好、做稳、做成系统”。

音视频正在经历的正是这个过程。

过去,音视频能力本身就是产品;未来,音视频更多会成为机器人、工业系统、AI 平台、远程控制系统和智能设备的一部分。这个变化对于从业者其实更加残酷,因为单一技能的溢价会降低;但对于真正理解底层媒体系统的人来说,机会反而可能更多,因为音视频正在进入比直播和视频会议更广的行业。


二、音视频行业真正的变化,是价值从“播放”向“数据流动”迁移

传统视频产品的最终目标非常明确:把视频播放出来,让用户看到。这也是为什么过去播放器、直播客户端、会议客户端一直是音视频行业最重要的产品形态。

但今天越来越多的视频已经不再只有一个消费者。

一台工业摄像机采集的视频,可能同时需要给操作人员实时观看、给录像系统归档、给视觉算法做缺陷检测、给业务平台生成事件告警;一台四足机器人的视频,既要提供远程图传,又可能进入目标识别、仪表读取、环境理解甚至后续控制链路。对于这些系统来说,“把画面显示出来”只是整个流程中的一个出口。

这意味着行业正在发生一个很深的变化:视频正在从内容,变成一种实时数据。

当视频是内容时,行业最关注的是清晰度、播放体验、卡顿率和分发成本;当视频成为数据时,问题就变成了另外一套:时间戳是否准确,帧是否连续,数据能不能被多个消费者共享,网络抖动以后系统是否能够恢复,AI 获取到的是不是最新的视频帧,录像、分析和实时预览之间是否使用同一条时间线。

这类问题不像“支持一个新协议”那么容易展示,但却越来越决定系统质量。

从 SmartMediaKit 这些年的演进也可以看到这种变化。早期更多关注播放、推流和终端体验,随后录像、协议转换、GB28181、轻量级服务、服务端能力逐渐进入体系。表面上看是功能越来越多,本质上却是在解决一个共同问题:怎样让实时媒体数据在不同终端、不同协议和不同业务之间稳定流动。

这也是未来专业音视频公司的价值所在。不是简单提供一个 Player API,而是逐渐形成一个能够处理采集、传输、路由、消费、录像、分析和异常恢复的实时媒体基础层。


三、协议会不断变化,但真正决定产品寿命的是底层媒体架构

音视频行业尤其容易追热点。前几年所有人讨论 WebRTC,后来讨论 WHIP/WHEP,再往后会有人讨论 QUIC、MoQ,编码侧也会不断出现 H.266、AV1、AV2 等新的技术方向。每一种新技术出现时,行业里都会出现一种类似的声音:旧协议是不是要被淘汰了?

实际工程经验往往没有这么戏剧化。

RTSP 到今天仍然大量存在于摄像机、工业设备和安防体系中;RTMP 已经不是最现代的协议,却依然在大量推流和既有业务里发挥作用;GB28181 因为行业设备基础和标准体系,也不可能突然退出。WebRTC、WHIP/WHEP 等新的技术则会进入新的应用层面,与传统协议长期共存。

这意味着一个现实:未来并不会出现某一个协议统一音视频世界。

真正能够长期生存的系统,必须接受协议长期多元化这一事实。

因此,未来媒体架构最重要的能力不是“预测哪个协议会赢”,而是让内部媒体核心尽量不被某个协议绑定。RTSP、RTMP、GB28181、WHIP 只是数据进入系统的方式,WHEP、播放器、录像、AI、转发只是数据离开系统的方式,中间真正应该稳定存在的是统一的媒体状态、Track、时间线、缓存、Session 和生命周期管理。

如果一个系统每增加一个协议,就重新实现一套缓存、一套重连、一套 GOP 管理、一套时间戳处理,那么产品规模越大,维护成本越高。很多音视频项目后期越来越难改,根源不是开发能力不够,而是早期把“协议连接”当成了系统中心。

真正成熟的媒体系统应该反过来:协议在外围,媒体在中心。

这也是为什么对 SmartMediaKit 来说,未来最值得投入的并不是简单地继续累加协议,而是持续强化 Media Core。因为协议的生命周期可能只有几年或十几年,但一套正确的媒体模型、时间线模型和生命周期管理方式,可以跨越多代协议。


四、低延迟已经不是炫技指标,而是系统稳定性的另一种表达

过去音视频行业谈低延迟,经常围绕一个数字展开:100ms、200ms、500ms。数字越低,看起来技术越先进。这个阶段的竞争当然有意义,因为编码缓存、网络缓存、解码队列和渲染策略都会直接影响端到端延迟。

但随着行业进入更复杂的实时应用,单纯讨论最低延迟已经越来越不够。

真正困难的是:系统能不能长时间维持这个延迟。

现实网络从来不是实验室环境。Wi-Fi 会抖动,4G/5G 会切换,移动设备会出现瞬时 CPU 峰值,服务器会短暂阻塞,摄像头会重启,编码器可能重新发送 SPS/PPS,甚至时间戳都可能发生跳变。如果系统只是尽可能保存所有数据,那么短暂的异常最终就会转化成长时间的延迟堆积。

这种问题在传统视频播放中可能只是“晚几秒”,但放到机器人、无人机或工业远程操控里,本质完全不同。操作者看到的如果是两秒以前的画面,所谓高清、不卡顿都没有太大意义。

所以低延迟系统真正应该解决的,不是“是否丢帧”,而是“在什么情况下应该主动丢弃已经失去实时价值的数据”;不是“能否重连”,而是“重连以后多久能重新回到 live edge”;不是“缓存越多越稳”,而是“怎样在稳定性和实时性之间建立明确边界”。

这背后实际上是一整套系统工程能力,包括队列上限、背压控制、关键帧恢复、时间戳校正、播放时钟重建、异常缓存清理以及多消费者隔离。低延迟只是最终表现,真正考验的是系统设计。

所以未来一个成熟的低延迟产品,评价标准应该从“第一次启动是多少毫秒”,升级为“弱网、断流和长时间运行以后,延迟能不能重新收敛”。

这个变化非常重要。因为前者容易做 Demo,后者才能形成真正的行业壁垒。


五、AI 给音视频带来的最大机会,不是“加一个算法”,而是重新定义视频的消费者

这几年几乎所有行业都在讨论 AI,音视频也不例外。但如果只是理解成“播放器里增加一个目标检测框”,其实低估了 AI 对媒体系统的影响。

真正重要的变化在于:过去视频主要给人消费,未来视频会越来越多地同时给人和机器消费。

人在看视频时,可以容忍一定程度的丢帧、色彩变化甚至时间戳误差,只要主观体验能够接受;机器不一样。AI 往往需要明确的像素格式、稳定的时间序列、可靠的帧时间戳,有时候还需要直接访问 GPU Surface 或 NV12 数据,避免额外的格式转换和内存复制。

这会反过来改变媒体引擎的设计。

过去播放器的最终出口可能只是渲染窗口,未来媒体核心需要同时面对显示、录像、AI、控制和数据分析。尤其当设备上同时运行硬件解码和 AI 推理时,如果每一帧都经历 GPU 到 CPU,再从 CPU 拷贝回 GPU,性能和功耗很快就会成为瓶颈。零拷贝、共享 Surface、GPU Texture、视频帧生命周期管理,这些过去更多属于高性能播放器优化的问题,会逐渐成为 AI 视频系统的基础能力。

这也是为什么传统音视频技术并没有因为 AI 而过时,反而出现了新的组合价值。

AI 擅长回答“画面里有什么”,但在此之前必须有人解决:画面怎样稳定到达,怎样保证它是最新的,怎样知道它发生在什么时候,怎样以最低成本进入模型,怎样在网络恢复以后迅速重新同步。

这部分正是实时媒体系统的价值。

未来大量 AI 产品最终都会发现,算法准确率只是产品的一部分。真正部署到工业现场以后,视频流中断、时间戳异常、摄像头重启、硬件解码失败、网络延迟积累和边缘设备资源不足,往往比模型本身更先暴露出来。

因此 AI 时代不是音视频技术的终结,而是让底层媒体能力进入了更多过去不属于传统音视频行业的系统。


六、边缘计算会成为下一轮音视频基础设施的重要落点

云计算过去十几年极大改变了音视频行业,直播 CDN、云转码、云录制、RTC 平台都因此获得了规模化发展。但视频和普通业务数据存在一个天然区别:它的数据量巨大,而且很多价值具有强烈的实时性和现场性。

一个工厂里几十路摄像头,如果全部持续送往公网,再由中心云完成 AI、录像和分发,在技术上当然可以实现,但并不一定是合理架构。带宽费用、云存储成本、时延、网络可靠性、数据安全都会成为长期负担。

因此,越来越多系统会形成一种比较清晰的分层:设备负责产生视频,边缘节点负责实时处理,云负责统一管理和跨区域能力。

在这种架构里,边缘服务器承担的角色会越来越重要。它不需要拥有传统云平台那样庞大的功能,但必须足够稳定、足够轻、足够容易部署,同时能完成协议接入、实时播放、录像、转发、快照、AI 数据输出和基础管理。

这类需求其实很适合专业音视频公司的能力结构。

因为大型云服务商的优势是规模,而专业媒体引擎厂商的优势是贴近设备、贴近协议、贴近弱网、贴近终端以及对媒体细节的控制能力。未来两者并不一定是替代关系,而更可能形成分层协作。

从 SmartMediaKit 的角度看,从 SDK 向轻量媒体服务器演进并不是简单增加一个产品,而是把过去积累在终端上的媒体能力向 Edge 延伸。当设备 SDK、边缘媒体服务和业务平台之间形成统一的数据路径以后,产品能力才真正从单点工具变成基础设施。

未来很多真正有价值的音视频项目,可能并不发生在超大规模互联网直播,而发生在工厂、机器人、无人系统、园区、应急现场和各种私有化网络里。这些市场不一定拥有最大的流量,却往往更愿意为稳定、可控、低延迟和长期维护买单。


七、AI 会淘汰一批音视频开发方式,但不会淘汰真正的音视频工程师

这是很多从业者真正关心的问题。

AI 确实正在显著降低软件开发门槛。现在让 AI 写一个 RTP Parser、一个 H.264 NALU 解析器、一段 FFmpeg 调用代码,甚至搭一个基础 WebRTC 信令流程,都已经不是什么困难的事情。因此,以“我知道哪个 API 怎么调”为核心的经验,价值一定会不断下降。

但音视频工程最难的部分,从来不是把代码写出来。

真实项目中的问题通常具有很强的系统性。比如播放器为什么运行半小时以后越来越慢,为什么同一个 H.264 码流在软件解码正常、某些硬件解码器却失败,为什么 Publisher 重连以后旧连接会影响新连接,为什么 B 帧场景下时间戳会出现异常,为什么一个网络很差的 Reader 会拖慢其他用户,为什么网络恢复以后视频恢复了但音频没有回来。

这些问题很少有一个标准答案。它们要求工程师同时理解编码结构、网络行为、时间线、线程调度、对象生命周期和操作系统行为,并能够从日志和现象中建立因果关系。

AI 可以帮助阅读代码、生成测试、缩小问题范围,但它无法替代系统本身的正确抽象。

所以未来的音视频工程师,最需要避免的是把自己的职业能力绑定在某一个库、某一个 API 或某一种协议上。真正值得长期积累的是 Codec、Network、Timeline、Concurrency、GPU、Memory 和 AI Pipeline 这些相对底层而通用的知识。

尤其是 Timeline。很多音视频系统最后最棘手的问题,归根到底都和时间有关:PTS、DTS、RTP Timestamp、NTP、采集时钟、播放时钟、系统时钟之间如何映射,重连以后时间线如何继续,跨设备以后又怎样保证一致。理解这些问题的人,往往比单纯会写协议代码的人更难替代。

未来“音视频工程师”这个岗位名称本身也可能逐渐淡化,更接近 实时媒体系统工程师。他需要理解音视频,但也必须理解网络、系统、GPU 和 AI;不一定每一层都是专家,却必须知道它们之间如何互相影响。

这是一个更难的职业方向,但也是一个更不容易被工具替代的方向。


八、音视频的未来,不在“视频行业”本身,而在更大的智能世界

如果站得更远一点看,未来真正值得期待的可能并不是一个更大的直播市场,而是视频成为机器理解现实世界的重要输入。

过去摄像头最主要的作用是记录:监控录像、电视节目、电影、视频会议、短视频,本质上都是把现实世界转化成可观看的内容。未来摄像头会越来越多地承担感知职责,机器人通过摄像头理解空间,无人机通过视频判断环境,工业系统通过图像发现缺陷,智能汽车通过视觉理解道路,智能眼镜则持续感知用户所处的现实环境。

当这个变化发生以后,音视频技术所处的位置也会改变。

它不再只是“显示画面的技术”,而是连接 Camera、Network、AI 和 Control System 的中间层。AI 决定看懂了什么,业务系统决定如何响应,而实时媒体系统需要保证真实世界的信息能够以低延迟、正确格式和可靠时间关系持续进入数字系统。

这也是为什么从长期看,SmartMediaKit 更值得建设的并不是“更多播放器”,而是一套跨平台的实时媒体能力层。播放器仍然重要,推流仍然重要,GB28181、RTSP、RTMP、WHIP/WHEP 等协议也仍然重要,但这些最终都应该服务于更大的能力:让实时媒体能够稳定地进入不同设备、不同平台、不同业务和不同智能系统。

从企业角度,这意味着不要把未来押在某一个协议上,也不要把竞争力建立在简单的功能列表上。真正能够穿越技术周期的,是 Media Core、跨平台、低延迟、异常恢复、边缘部署和 AI 数据通路这样的基础能力。

从个人角度也是一样。未来真正有竞争力的音视频从业者,不是掌握最多 API 的人,而是能够回答这些问题的人:为什么系统会产生延迟?为什么这个码流在这台设备失败?网络异常以后如何恢复?视频怎样高效进入 GPU 和 AI?一个媒体系统如何稳定运行几个月甚至几年?

AI 会让写 Demo 越来越容易,开源会让功能越来越容易获得,硬件会让编解码越来越廉价。但要让一个真实世界中的系统在复杂网络、复杂设备和复杂业务条件下长期稳定运行,仍然是一件非常困难的事情。

而行业真正长期存在的价值,通常就隐藏在这些“越来越少被展示,却越来越无法绕开”的问题里。

过去二十年,音视频行业最重要的任务,是让人通过屏幕看到远方;未来二十年,它可能承担另一个更大的任务:让数字系统持续、实时地理解真实世界。

如果这个判断成立,那么音视频行业并没有进入尾声。它只是结束了一个以播放器、直播和视频会议为中心的阶段,正在进入一个以实时媒体、边缘智能和机器感知为中心的新阶段。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐