百度12篇成果入选CVPR 2026,覆盖视觉与多模态多个前沿方向。这些研究不仅展示了深厚的技术积累,更揭示了一种趋势:通过精细化设计和以数据为中心的策略,小模型也能在特定任务上超越大模型,为AI技术发展提供了新的价值路径。
智能速览
百度12篇论文入选CVPR 2026,展示视觉与多模态技术实力。
5M参数的PP-OCRv5模型媲美千亿大模型,挑战“模型越大越好”的传统观念。
PaddleOCR-VL采用“由粗到精”架构,高效实现高精度文档解析。
FaithFusion与RnG方案解决3D场景重建与生成的几何保真问题。
GenHOI技术实现视频中物体的高一致性替换,赋能电商场景。
TAR-FAS框架通过工具调用推理,显著提升人脸活体检测的泛化性。
精华内容
在AI普遍追求模型规模的时代,百度入选CVPR 2026的成果提供了一种新思路:通过精细化设计,小模型也能在特定任务上实现突破,重塑技术发展的价值路径。
小模型的大能量
PP-OCRv5的研发打破了“模型越大越好”的传统限制。该系统仅用5M参数,通过首创的OCR数据量化分析框架,从难度、准确性、多样性三个维度系统化优化数据策略。其关键发现包括:模型训练存在“难度甜点区”,对少量标签噪声具有鲁棒性,且特征多样性是提升泛化能力的决定性因素。最终,PP-OCRv5在手写、多语言及自然场景下的准确率(1-EditDist约为0.93)与GPT-4o等千亿参数模型相当,证明了在特定场景下,通过精细化的“数据工程”能构建出极致性价比的专家模型。
文档解析任务中,PaddleOCR-VL针对高分辨率输入导致视觉Token激增、计算成本高昂的问题,提出了“由粗到精”的创新架构。其核心是轻量级的有效区域聚焦模块(VRFM),它能识别并聚焦于语义相关的关键区域,抑制空白背景等冗余信息。在此引导下,一个紧凑的0.9B视觉语言模型进行细粒度识别。实验表明,该方法在页面级解析和元素级识别上达到SOTA水平,仅需竞品1/3到1/2的视觉Token和更小的模型参数,就能实现更高的精度。
3D生成与交互革新
在3D场景生成与重建领域,几何保真度与视觉合理性是一大挑战。FaithFusion框架通过引入像素级期望信息增益(EIG)作为统一策略,有效融合了基于几何的3D高斯溅射(3DGS)与外观驱动的扩散模型。EIG引导扩散模型优化高不确定性区域,并将编辑内容蒸馏回3DGS中,解决了过度修复和几何漂移问题。
RnG(Reconstruction and Generation)则通过单一Transformer架构统一了3D重建与新视角生成,解决了传统视频生成模型因缺乏3D约束导致的物体形变问题。其重建引导的因果注意力机制,确保所有视角遵循同一套3D表征,推理速度比扩散模型快100倍以上。该技术能让用户仅用几张照片即可生成完整的3D模型,为电商提供360°展示或AR试戴等应用。
视频编辑方面,GenHOI技术解决了手物交互(HOI)中物体形变与身份丢失的痛点。通过引入Head-Sliding RoPE和空间注意力闸门,该轻量化模块(新增参数仅0.95%)能确保物体在长视频中影响力均衡分布,并将注意力精准锁定在交互区域。这在电商场景下,实现了无需重拍即可替换视频中的商品,且手部动作自然,大幅降低拍摄成本。
赋能AI感知与推理
为提升多模态大模型的终身学习能力,ViLoMem框架提出了一种双流记忆结构。它分别对视觉干扰模式和逻辑推理错误进行编码,让模型能从成功和失败的经验中学习。遵循增长与优化原则,该系统逐步积累知识,避免灾难性遗忘,在多个基准测试中持续提升准确率并减少错误。
人脸活体检测(FAS)领域,TAR-FAS框架将任务从二分类重构为“带视觉工具的思维链”模式。模型可主动调用FFT、LBP等外部工具,对图像频域、材质等细节进行深度取证。通过构建包含多轮推理轨迹的数据集,该框架在跨域测试中达到了SOTA性能,显著提升了检测的泛化性与可解释性。
针对现有多模态模型对显著区域感知不足的问题,Blink框架模仿人类视觉“扫视与聚焦”机制,动态识别并强化重要的视觉Token,实现了广度探索与细粒度聚焦的自适应平衡。另一项研究则提出了基于模型内生认知能力的自监督强化学习框架,让模型在生成图像后利用自身理解能力进行评估和修正,从而缩小理解与生成之间的能力鸿沟。
自动驾驶建图新范式
在高精地图构建中,OptiMVMap将多车协同建图建模为“先优选、再融合”的新范式,解决了单车视角受限导致的遮挡与拓扑缺失问题。其核心是设计不确定性感知的最优车辆选择(OVS)模块,从候选车辆中筛选最能补充自车盲区的少量视角,避免冗余计算。随后,通过跨车注意力(CVA)与语义感知噪声过滤(SNF)模块,实现对位姿误差与遮挡伪影的鲁棒对齐与抑制。相比简单堆叠数据,该方法以更少视角获得了更完整、拓扑更准确的矢量化地图,在nuScenes与Argoverse2数据集上显著提升了mAP指标。
百度入选CVPR 2026的系列成果,系统性地展示了从模型优化、架构创新到系统应用的全链路思考。这些研究共同指向一个未来:AI技术的发展正从单纯的参数竞赛,转向更注重效率、精度与场景化价值的深度融合。这些技术突破将如何重塑自动驾驶、内容创作与人机交互的边界?