什么是 MLVC(机器学习视频编解码器)?

Definition

MLVC 是 Machine Learning Video Codec 的缩写。微软于 2026 年 7 月以 MIT 许可证将其开源。它是微软研究院自 2021 年起持续发表的研究系列 DCVC(Deep Contextual Video Compression)的产品化版本。



对比在 360p 下获得同等画质所需的码率:H.264 为 1000 kbps,H.265 约为 500 kbps,微软的神经网络编解码器 MLVC 为 122 kbps。

H.264 或 H.265 这类传统编解码器由人工设计的部件拼装而成:运动估计、变换、熵模型,以及一大堆编码启发式规则。MLVC 用一个针对率失真目标端到端训练出来的神经网络,取代了上述全部环节。



这带来一个不寻常的后果:不存在需要实现的码流规范,因为训练好的权重本身就是格式。编码器和解码器必须运行同一个模型,并且在其算术运算上几乎逐比特保持一致,而这正是 MLVC 论文用了大部分篇幅去解决的问题。



运行环境。MLVC 面向的是笔记本电脑和手机中本已存在的 NPU,也就是 Apple Neural Engine 以及 Intel 和高通的 NPU,而不是编解码器专用芯片。完整模型有 1830 万个参数,轻量版 MLVC-S 为 540 万个。微软称在三家厂商的硬件上均实现了实时 540p 30 fps,且 NPU 占用不超过一半。



能省多少。在微软的视频会议测试集上,依据 ITU-T P.910 由真人观看者评分,MLVC 在 360p 下所需码率比 H.264 低 87.8%,比硬件 H.265 低 75.5%。在 540p 下分别为 82.7% 和 65.4%。换成实际说法:一段 360p 视频用 H.264 需要 1 Mbps,用 MLVC 在同等画质下约需 122 kbps。



需要注意的地方。这些结果来自低分辨率的人头讲话画面,比较对象是硬件编码器,而且播放需要一台能运行该模型的设备。目前没有任何电视、机顶盒或浏览器能解码 MLVC。微软正在 Microsoft Teams 的点对点通话中部署它,而这恰恰是它能同时掌控链路两端的场景。就流媒体分发而言,它是一个值得关注的信号,而不是可以投入使用的方案。



我们在这里详细梳理了论文、测试数据和代码仓库:微软开源了神经网络视频编解码器,这对流媒体究竟意味着什么

Need Help With Your Streaming Project?

Our network of streaming professionals can help you implement and optimize your video infrastructure.

Hire a Professional →