生成式视频压缩:让远洋出海也能看一场完整的世界杯!

源自公众号:中国电信人工智能研究院

02-11 14:45

远洋船员在卫星带宽仅240kbps环境下,也能流畅观看世界杯直播——这不再是设想。中国电信TeleAI团队提出的生成式视频压缩(GVC)技术,在权威测试中实现0.005 bpp极端压缩率,带宽占用仅为HEVC的1/6,同时保持人眼可辨的视觉质量与机器可解析的语义完整性。

生成式视频压缩:让远洋出海也能看一场完整的世界杯!智能速览

  • GVC在MCL-JCV数据集上达成0.005 bpp压缩率(相当于0.02%原始体积),远超传统HEVC/VVC极限

  • 传输不传像素,只传‘构图+色彩+运动’等语义特征,由接收端多模态模型实时重建视频

  • 支持感知导向(人眼舒适)与任务导向(如目标跟踪、分割)双模式适配,非单纯保真

  • 模型经小型化、量化与知识蒸馏优化,消费级GPU即可低延迟推理,具备边缘部署能力

  • 已在海事窄带卫星、应急救援回传、车载及可穿戴设备等资源受限场景验证可行性

  • 背后依托智传网‘信容律’理论,将大模型智能能力定义为知识密度,压缩即度量智能

生成式视频压缩:让远洋出海也能看一场完整的世界杯!精华内容

当视频传输不再执着于‘复刻每一帧像素’,而转向‘传递足以重建体验的核心语义’,压缩的本质就被重新书写。

突破极限

传统HEVC编码在0.1 bpp以下即出现严重块效应与运动失真,而GVC在0.005 bpp(即原始数据量的0.02%)下仍能维持PSNR 28.3dB、LPIPS 0.19的综合指标。在MCL-JCV测试中,其带宽效率是HEVC的6.2倍——相同主观画质下,HEVC需1.5Mbps,GVC仅需241kbps,恰好匹配3G/4G弱网及海事卫星链路典型速率。

语义重构

GVC摒弃逐帧编码范式,先将视频解耦为静态场景表征(语义布局、纹理风格)与动态运动流(光流引导的时序建模),二者合计仅占原始视频0.3%的数据量。接收端调用轻量化多模态生成模型,依据这些抽象指令实时合成视频帧。实测显示,足球比赛关键动作(如射门轨迹、球员跑位)的运动连贯性误差低于7%,显著优于同等码率下的传统方案。

双模适配

同一压缩流程可按需切换输出模式:面向人类观看时,优先保留色彩对比度与边缘锐度,主观MOS评分达4.1(5分制);面向机器视觉任务时,则强化语义分割掩码与目标检测框的置信度,使YOLOv8在解压视频流上的mAP@0.5提升12.6%,且推理延迟稳定在42ms以内。这种‘一码两用’能力,使单套系统可同时服务监控中心与AI分析平台。

边缘就绪

通过结构剪枝与INT4量化,GVC主干模型参数量压缩至187MB,可在RTX 3060级别GPU上实现18fps端到端处理(含编码+传输+解码+生成)。在某远洋货轮实测中,搭载该方案的船载终端在Inmarsat-FH窄带卫星链路(平均有效带宽238kbps)下,成功实现世界杯半决赛全场比赛无卡顿直播,端到端延迟控制在1.8秒内。

生成式视频压缩不是对旧范式的微调,而是通信逻辑的根本转向:从‘传输数据’迈向‘共享认知’。它让带宽瓶颈从不可逾越的高墙,变为可通过计算智能灵活置换的变量。当0.02%的比特承载起整场世界杯的激情,人们开始思考——未来远程手术、无人巡检甚至太空通信,是否也只需传递‘该知道什么’,而非‘所有看到什么’?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章