中科大联合华为发布 RiO-DETR:2.7 ms 达到 78.4 AP50

2026-08-16 23:20:19 0点赞 0收藏 0评论

在遥感影像、交通感知、场景文字识别等任务中,待检测目标很少横平竖直规整排布。采用水平边界框做检测,虽然能够包住目标,但常会纳入大量无关背景;改用旋转框虽能更贴合物体轮廓,可新增的角度维度会显著提升检测器的训练与调参难度,想要在终端设备上实现实时推理更是一大挑战。

以往旋转目标检测追求速度的方案,基本都以 CNN 架构为主。DETR 框架优势突出,端到端的形式还省去了 NMS 后处理;但一旦从水平框拓展至旋转检测,繁重的注意力运算、角度周期性歧义问题,再加上更为复杂的匹配搜索空间,很容易直接丢掉实时推理能力。

最近,中科大联合华为、清华等机构提出了 RiO-DETR,终于把端到端旋转检测推到了真正的实时区间。在 DOTA-1.0 单尺度设置下,最轻量的 RiO-DETR-n 仅有 4.0M 参数,端到端延迟低至 2.7ms,AP50 却能达到 78.4;而最强的 RiO-DETR-x 在 29.9ms 下跑出 81.8 AP50。该工作已被 ECCV 2026 接收为 Oral(Spotlight)。

该论文的第一作者为胡张驰,中国科学技术大学博士研究生,研究方向为通用视觉、视频生成与世界模型。迄今已在 ICCV、ECCV、AAAI、ACM MM 等顶级会议发表多篇论文,是当前目标检测领先模型 D-FINE 的重要贡献者。本文由孙晓艳教授、李和倍博士和彭岩松博士共同指导,作者团队还包括来自华为技术有限公司、清华大学的研究人员。

中科大联合华为发布 RiO-DETR:2.7 ms 达到 78.4 AP50
展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松