远洋船员在卫星带宽仅240kbps环境下,也能流畅观看世界杯直播——这不再是设想。中国电信TeleAI团队提出的生成式视频压缩(GVC)技术,在权威测试中实现0.005 bpp极端压缩率,带宽占用仅为HEVC的1/6,同时保持人眼可辨的视觉质量与机器可解析的语义完整性。
智能速览
GVC在MCL-JCV数据集上达成0.005 bpp压缩率(相当于0.02%原始体积),远超传统HEVC/VVC极限
传输不传像素,只传‘构图+色彩+运动’等语义特征,由接收端多模态模型实时重建视频
支持感知导向(人眼舒适)与任务导向(如目标跟踪、分割)双模式适配,非单纯保真
模型经小型化、量化与知识蒸馏优化,消费级GPU即可低延迟推理,具备边缘部署能力
已在海事窄带卫星、应急救援回传、车载及可穿戴设备等资源受限场景验证可行性
背后依托智传网‘信容律’理论,将大模型智能能力定义为知识密度,压缩即度量智能
精华内容
当视频传输不再执着于‘复刻每一帧像素’,而转向‘传递足以重建体验的核心语义’,压缩的本质就被重新书写。
突破极限
传统HEVC编码在0.1 bpp以下即出现严重块效应与运动失真,而GVC在0.005 bpp(即原始数据量的0.02%)下仍能维持PSNR 28.3dB、LPIPS 0.19的综合指标。在MCL-JCV测试中,其带宽效率是HEVC的6.2倍——相同主观画质下,HEVC需1.5Mbps,GVC仅需241kbps,恰好匹配3G/4G弱网及海事卫星链路典型速率。
语义重构
GVC摒弃逐帧编码范式,先将视频解耦为静态场景表征(语义布局、纹理风格)与动态运动流(光流引导的时序建模),二者合计仅占原始视频0.3%的数据量。接收端调用轻量化多模态生成模型,依据这些抽象指令实时合成视频帧。实测显示,足球比赛关键动作(如射门轨迹、球员跑位)的运动连贯性误差低于7%,显著优于同等码率下的传统方案。
双模适配
同一压缩流程可按需切换输出模式:面向人类观看时,优先保留色彩对比度与边缘锐度,主观MOS评分达4.1(5分制);面向机器视觉任务时,则强化语义分割掩码与目标检测框的置信度,使YOLOv8在解压视频流上的mAP@0.5提升12.6%,且推理延迟稳定在42ms以内。这种‘一码两用’能力,使单套系统可同时服务监控中心与AI分析平台。
边缘就绪
通过结构剪枝与INT4量化,GVC主干模型参数量压缩至187MB,可在RTX 3060级别GPU上实现18fps端到端处理(含编码+传输+解码+生成)。在某远洋货轮实测中,搭载该方案的船载终端在Inmarsat-FH窄带卫星链路(平均有效带宽238kbps)下,成功实现世界杯半决赛全场比赛无卡顿直播,端到端延迟控制在1.8秒内。
生成式视频压缩不是对旧范式的微调,而是通信逻辑的根本转向:从‘传输数据’迈向‘共享认知’。它让带宽瓶颈从不可逾越的高墙,变为可通过计算智能灵活置换的变量。当0.02%的比特承载起整场世界杯的激情,人们开始思考——未来远程手术、无人巡检甚至太空通信,是否也只需传递‘该知道什么’,而非‘所有看到什么’?