arXiv:2512.23273v1 [cs.CV] 29 Dec 2025

YOLO-Master

MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection

Xu Lin*, Jinlong Peng*, Zhenye Gan, Jiawen Zhu, Jun Liu

Tencent Youtu Lab & Singapore Management University

实时目标检测 混合专家模型 条件计算 动态路由

摘要

现有实时目标检测(RTOD)方法普遍采用 YOLO 类架构,但其依赖静态稠密计算,对所有输入施加统一处理,导致简单场景资源过度分配而复杂场景资源不足。

本文提出 YOLO-Master,通过高效稀疏混合专家(ES-MoE)模块实现实例条件自适应计算,根据场景复杂度动态分配计算资源。核心包括轻量级动态路由网络、Soft/Hard Top-K 分阶段路由策略及负载均衡监督机制。

在 MS COCO、PASCAL VOC、VisDrone、KITTI 和 SKU-110K 五个基准上达到 SOTA,COCO 上取得 42.4% AP / 1.62 ms,精度与速度均优于现有方法。

研究背景与核心问题

YOLO 系列现状

  • 单阶段检测框架,平衡精度与速度
  • 广泛应用于自动驾驶、视频监控、机器人系统
  • 历代改进聚焦骨干网络与特征融合策略

根本性瓶颈

  • 所有架构采用静态稠密计算
  • 无论输入复杂度,均通过相同网络路径处理
  • 计算预算在设计时固定,缺乏自适应机制
问题本质:简单场景与复杂场景消耗相同计算预算,导致计算冗余与检测性能次优
? 能否根据输入复杂度动态分配计算资源,打破静态精度-效率权衡?

本文核心贡献

1

首个面向 RTOD 的 MoE 条件计算框架

将混合专家(MoE)引入实时目标检测,通过动态专家激活适配输入复杂度,打破静态容量-成本权衡

2

ES-MoE 模块与分阶段路由策略

训练时 Soft Top-K 保证梯度流动与专家专业化,推理时 Hard Top-K 实现真正稀疏激活与硬件加速

3

负载均衡监督机制

基于 MSE 形式惩罚专家利用率偏离均匀分布,有效防止专家坍塌,确保推理稀疏性不被破坏

4

五个大规模基准全面 SOTA

MS COCO、PASCAL VOC、VisDrone、KITTI、SKU-110K 上均取得最优性能,验证自适应计算的泛化性

相关工作

实时目标检测器

  • YOLO 系列:C2f、注意力机制、自适应视觉感知等改进
  • RT-DETR:Transformer 架构,同样采用静态计算模式
  • 共性局限:均缺乏动态资源分配机制

混合专家模型(MoE)

  • 起源于 NLP,通过门控网络路由到专家子网络实现条件计算
  • 视觉领域:主要聚焦图像分类,密集预测任务探索甚少
  • 本文创新:首个面向轻量 CNN 实时检测器的 MoE 框架
关键区别:注意力机制仅自适应加权特征,而 MoE 通过条件专家激活实现输入依赖的容量分配,从根本上打破静态计算约束

整体架构

Backbone
Neck
Detection Head
ES-MoE 插入位置:
Backbone
+
Neck
YOLO-Master Framework

图2. YOLO-Master 整体框架与 ES-MoE 信息流程

最优配置:仅在 Backbone 中集成 ES-MoE(Neck 中插入反而导致性能下降 -5.9%)

ES-MoE 模块设计

1

动态路由网络

生成实例相关的路由信号,决定哪些专家被激活

2

Softmax 门控机制

对路由信号归一化,选择最相关的 Top-K 专家并生成权重分布

3

加权聚合单元

融合被激活专家的输出,经归一化后得到精炼特征表示

Y = Norm( Σi∈TK wi · Experti(X) )

Backbone 中的 ES-MoE

动态增强不同尺度和场景复杂度的特征提取

Neck 中的 ES-MoE

实现多尺度自适应特征融合与信息精炼

专家网络与门控设计

高效专家架构

  • 采用深度可分离卷积(DWConv)降低参数量和计算量
  • 不同卷积核大小捕获多尺度特征:
3×3
小尺度特征
5×5
中尺度特征
7×7
大尺度特征

轻量级门控网络

  • 全局平均池化(GAP)压缩输入为全局描述符
  • 两层 1×1 卷积(Cin → Cred → E)
  • 通道缩减比 γ = 8,确保路由决策本身不构成瓶颈
  • 计算复杂度仅取决于通道数 C 和专家数 E,与空间尺寸 H×W 无关
Λ = Conv1×1out=E( SiLU( Conv1×1out=Cred( GAP(X) ) ) )

分阶段路由策略

训练阶段:Soft Top-K

  • 构造二值硬掩码选择 Top-K 专家
  • 掩码与 Softmax 权重逐元素相乘并重归一化
  • 保留梯度连续性,所有专家获得非零梯度
  • 促进专家专业化与互补分工
VS

推理阶段:Hard Top-K

  • 仅对 Top-K 个最大 logits 应用 Softmax
  • 其余 E-K 个专家权重严格置零
  • 仅调用 K 个专家模块,实现真正稀疏前向传播
  • 在实际硬件上获得显著加速
动态切换:基于 self.training 自动选择路由模式,训练与推理无缝衔接
Ω = { Ωtrain if Training; Ωinfer if Inference }

损失函数设计

Ltotal = LYOLO + λLB × LLB

检测损失 LYOLO

  • 分类损失 Lcls(BCE)
  • 定位损失 Lloc(CIoU / DIoU)
  • 分布焦点损失 LDFL

负载均衡损失 LLB

  • MSE 形式:惩罚专家平均利用率 μi 偏离理想均匀分布 1/E
  • 防止路由网络倾向少数"更强"专家
  • 确保所有专家被充分利用,提升泛化能力
!
关键发现:移除 DFL 损失,仅使用 MoE-only 损失(λ = 1.5)效果最佳(62.2% mAP)
原因:DFL 与 MoE 损失产生冲突梯度,DFL 强制均匀分布细化,而 MoE 鼓励实例自适应专家专业化

实验结果:五个基准全面领先

42.4% MS COCO mAP +0.8%
62.1% PASCAL VOC mAP +1.4%
19.6% VisDrone mAP +2.1%
69.2% KITTI mAP +1.5%
58.2% SKU-110K mAP +0.7%

推理速度

1.62 ms

比 YOLOv13-N 快 17.8%

ImageNet 分类

76.6%

Top-1 准确率(+4.9%)

实例分割

35.6%

mAPmask(+2.8%)

对比基线:YOLOv13-N | VisDrone 与 KITTI 提升最大,验证小目标检测与精确定位优势

消融实验:模块放置与专家数量

ES-MoE 放置策略

配置参数量mAP
Baseline2.63M60.8%
Neck Only2.49M58.2% (-2.6%)
Backbone Only2.66M62.1% (+1.3%)
Both2.76M54.9% (-5.9%)

Backbone+Neck 出现梯度干扰,导致性能严重下降

专家数量

#Experts参数量mAP
22.51M61.0%
42.76M62.3%
83.68M62.0%

4 个专家达到最优平衡,8 个专家过参数化且收益递减

消融实验:Top-K 与损失配置

Top-K 选择(4 个专家)

K稀疏度mAP
175%61.3%
250%61.8%
325%61.8%
40%61.9%

K=2 达到最优:两个互补专家提供充分特征多样性并保持计算效率

损失配置

配置DFLMoEmAP
Config 10.561.9%
Config 2×0.561.9%
Config 41.561.4%
Config 5×1.562.2%

DFL + 强 MoE 损失导致训练震荡;MoE-only 收敛平滑且性能最佳

Loss Ablation

图3. 损失消融实验:DFL 损失、MoE 损失、验证 mAP 与总损失收敛曲线

定性分析与下游任务泛化

检测性能(Small Scale)

YOLO-Master-S 在 MS COCO 上达到 49.1% mAP,Small 模型新 SOTA

跨任务一致性提升

  • 分类:ImageNet Top-1 76.6%(+4.9%)
  • 分割:COCO mAPmask 35.6%(+2.8%)
  • 验证 ES-MoE 作为通用视觉骨干的有效性
Qualitative Comparison

图4. 四个挑战性场景下的定性对比:小目标、类别歧义、复杂场景与密集场景

总结与展望

1

打破静态计算范式

首个将 MoE 条件计算引入轻量 CNN 实时检测器的工作,实现输入依赖的动态容量分配

2

ES-MoE 模块与分阶段路由

Soft Top-K 训练保证稳定性,Hard Top-K 推理实现真正稀疏加速,兼顾优化与部署效率

3

负载均衡监督防止专家坍塌

MSE 形式的均衡损失确保所有专家被充分利用,维持训练稳定性与推理稀疏性

4

精度与速度双提升

五个基准全面 SOTA,COCO 上 42.4% AP / 1.62 ms,比 YOLOv13-N 快 17.8%

未来方向:扩展至视频检测、3D 目标检测等更多视觉任务;面向边缘端与移动端的资源受限自适应部署

感谢聆听

YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection

Xu Lin, Jinlong Peng, Zhenye Gan, Jiawen Zhu, Jun Liu

Tencent Youtu Lab SMU arXiv:2512.23273

Code: github.com/isLinXu/YOLO-Master

1 / 16