← → 或点击翻页
TECHNICAL REPORT 2025
YOLOv12:
Attention-Centric
Real-Time Object Detectors

以注意力机制为核心的实时目标检测框架

Yunjie Tian · Qixiang Ye · David Doermann
University at Buffalo UCAS arXiv:2502.12524 Computer Vision
Abstract

研究摘要

尽管注意力机制在建模能力上已被证明优于CNN,但YOLO框架的架构改进长期聚焦于CNN。原因是注意力模型无法匹敌CNN的速度

  • 提出YOLOv12——以注意力为中心的YOLO框架,速度匹配CNN版本
  • YOLOv12-N 在 T4 GPU 上达到 40.6% mAP,延迟仅 1.64ms
  • 超越 YOLOv10-N 2.1% / YOLOv11-N 1.2% mAP,速度相当
  • YOLOv12-S 超越 RT-DETR-R18,速度快 42%,计算量仅 36%
  • Introduction

    背景与动机

    现状问题

    CNN主导的YOLO

    • YOLO系列架构设计聚焦CNN改进
    • 注意力机制虽建模能力强,但速度慢
    • 注意力计算复杂度为 O(L²d)
    • 内存访问效率远低于CNN
    本文目标

    注意力中心化YOLO

    • 构建以注意力为核心的YOLO框架
    • 匹配CNN版本的推理速度
    • 保持甚至超越检测精度
    • 打破CNN在YOLO系列的统治地位

    核心挑战:注意力机制的二次计算复杂度低效内存访问,使注意力模型比CNN慢约3倍

    Contributions

    主要贡献

    01

    Area Attention (A²)

    简单高效的局部注意力模块,将特征图均匀切分为 l 个区域,大幅降低计算复杂度同时保持大感受野

    02

    R-ELAN

    残差高效层聚合网络,引入残差连接与缩放技术,解决注意力引入的优化挑战,确保大模型稳定收敛

    03

    架构优化

    FlashAttention加速、移除位置编码、MLP比例调整(4→1.2)、大核可分离卷积感知位置等多项改进

    YOLOv12 提供 5个模型尺度 (N/S/M/L/X),在不使用额外技巧的情况下,在所有尺度上实现 SOTA 的延迟-精度权衡

    Related Work

    相关工作综述

    实时检测器

    YOLO系列演进

    • YOLOv4/v5: CSPNet + 数据增强 + 多尺度
    • YOLOv7: E-ELAN + 梯度优化
    • YOLOv8: C2f高效特征提取模块
    • YOLOv9: GELAN + PGI训练改进
    • YOLOv10: NMS-free + 双重标签分配
    • YOLOv11: C3K2 + 轻量深度可分离卷积
    高效ViT

    效率优化方法

    • Swin Transformer: 局部窗口注意力
    • 轴向/十字交叉注意力: 行列方向计算
    • 线性注意力: O(n)复杂度但全局依赖退化
    • FlashAttention: I/O优化解决内存瓶颈
    • Mamba视觉模型: 线性复杂度但仍不及实时

    本文抛弃复杂设计,提出简洁的 Area Attention + FlashAttention 方案,实现真正实时的注意力机制

    Approach — Efficiency

    注意力机制为何比CNN慢?

    01

    计算复杂度

    自注意力 O(L²d) vs CNN O(kLd),其中 L 为序列长度,k 为卷积核大小(通常 k ≪ L)。全局注意力在高分辨率下计算量激增。

    02

    内存访问效率

    注意力需在SRAM与HBM间频繁搬运中间矩阵(QKᵀ, softmax),而HBM读写速度仅为SRAM的1/10。CNN利用结构化局部内存访问天然高效。

    "这两大因素——二次计算复杂度和低效内存访问——共同导致注意力机制比CNN慢约3倍。"

  • 解决方案:Area Attention 降低计算复杂度 + FlashAttention 解决内存瓶颈
  • Core Innovation

    Area Attention (A²)

    将 (H,W) 的特征图沿垂直或水平方向均匀切分为 l 个区域(默认 l=4),仅需简单的 reshape 操作

  • 计算复杂度从 2n²hd → ½n²hd
  • 感受野缩小至原来的 1/4,但仍足够大
  • 无显式窗口划分,无额外开销
  • 性能影响微小,速度大幅提升
  • Area Attention Comparison

    图:Area Attention 与其他局部注意力机制的对比(Window / Criss-Cross / Axial)

    Architecture

    残差高效层聚合网络 (R-ELAN)

    R-ELAN Architecture
    原始ELAN的问题
    • ● 梯度阻塞:缺乏输入到输出的残差连接
    • ● 大模型(L/X)无法收敛或不稳定
    • ● 即使使用Adam/AdamW也无法解决
    • ● 注意力机制加剧了优化困难
    本文改进
    • ● 引入残差捷径 + 缩放因子(默认0.01)
    • ● 重新设计特征聚合:Bottleneck结构
    • ● 降低计算量和参数/内存使用
    • ● 确保大模型稳定训练与收敛

    图:CSPNet → ELAN → C3K2 → R-ELAN 架构演进对比

    Architecture

    架构层面改进

    01

    Conv+BN替代Linear+LN

    充分利用卷积算子的计算效率,Conv2d+BN 比 nn.Linear+LN 更快且性能更好

    02

    移除位置编码

    不使用任何位置编码(RPE/APE)反而获得最佳性能,架构更简洁,推理更快

    03

    MLP Ratio: 4 → 1.2

    降低MLP比例,将更多计算资源分配给注意力机制,凸显Area Attention的重要性

    04

    Position Perceiver

    7×7大核可分离卷积作用于value,通过平滑效果保留像素位置信息

    05

    FlashAttention

    I/O优化解决内存访问瓶颈,N模型加速约0.3ms,S模型加速约0.4ms

    06

    层级设计保留

    保留YOLO层级结构;最后阶段仅保留单个R-ELAN块,减少总块数以利于优化

    Experiments

    实验设置

    📊

    数据集与模型

    MSCOCO 2017数据集
    5个变体: N / S / M / L / X
    640×640 输入分辨率
    以 YOLOv11 为基线

    ⚙️

    训练配置

    600 epochs, SGD优化器
    初始学习率 0.01, 线性衰减
    3 epoch 线性预热
    Batch size: 32×8

    🖥️

    测试平台

    T4 GPU + TensorRT FP16
    RTX 3080 / A5000 / A6000
    CPU: i7-10700K @ 3.80GHz

    📏

    评估指标

    mAP (AP⁵⁰:⁹⁵, AP⁵⁰, AP⁷⁵)
    FLOPs & 参数量
    推理延迟 (ms) — GPU/CPU
    小/中/大目标AP

    Results

    主要结果对比 (COCO)

    MethodFLOPs(G)#Param(M)AP⁵⁰:⁹⁵AP⁵⁰Latency(ms)
    N-Scale Models
    YOLOv8-N8.73.237.452.61.77
    YOLOv10-N6.72.338.553.81.84
    YOLOv11-N6.52.639.455.31.50
    YOLOv12-N6.52.640.656.71.64
    S-Scale Models
    YOLOv10-S21.67.246.363.02.49
    YOLOv11-S21.59.446.963.92.50
    YOLOv12-S21.49.348.065.02.61
    M/L/X-Scale Models
    YOLOv10-M59.115.451.168.14.74
    YOLOv11-M68.020.151.568.54.70
    YOLOv12-M67.520.252.569.64.86
    YOLOv11-X194.956.954.671.611.30
    YOLOv12-X199.059.155.272.011.79

    YOLOv12 在所有尺度上均取得最优精度,同时保持有竞争力的推理速度

    Results

    多GPU速度对比

    ModelScaleFLOPs(G)RTX 3080 (FP32/FP16)A5000 (FP32/FP16)A6000 (FP32/FP16)
    N-Scale
    YOLOv10N6.71.6/1.01.6/1.01.6/1.0
    YOLOv11N6.51.6/1.01.6/1.01.5/0.9
    YOLOv12N6.51.7/1.11.7/1.01.7/1.1
    S-Scale
    YOLOv10S21.62.8/1.42.4/1.42.4/1.3
    YOLOv11S21.52.8/1.32.4/1.42.4/1.3
    YOLOv12S21.42.9/1.52.5/1.52.5/1.4
    M-Scale
    YOLOv10M59.15.7/2.54.5/2.44.2/2.2
    YOLOv11M68.05.6/2.34.5/2.24.4/2.1
    YOLOv12M67.55.8/1.54.6/2.44.4/2.2

    YOLOv12 推理速度与 YOLOv10/v11 持平,但精度更高。所有结果在相同硬件上测量。

    Ablation

    消融实验:R-ELAN

    ModelVanillaRe-Aggre.Resi.ScalingConvergenceFLOPs(G)Param(M)AP
    YOLOv12-N6.92.740.8
    YOLOv12-N6.52.640.6
    L-Scale (大模型需要残差)
    YOLOv12-L
    YOLOv12-L0.0188.926.453.7
    X-Scale (需要极小缩放因子)
    YOLOv12-X
    YOLOv12-X0.01199.059.155.2
  • 小模型(N):残差连接不影响收敛但降低性能,仅需特征聚合改进
  • 大模型(L/X):残差连接至关重要,缩放因子0.01确保稳定训练
  • Ablation

    消融实验:Area Attention 加速效果

    ModelArea AttnCUDA FP32 (ms)CUDA FP16 (ms)CPU (ms)
    YOLOv12-N2.7 / 2.51.5 / 1.562.9
    YOLOv12-N2.0 / 2.01.3 / 1.331.4
    YOLOv12-S5.1 / 4.42.5 / 2.2130.0
    YOLOv12-S3.5 / 3.11.7 / 1.778.4
    YOLOv12-X26.4 / 21.911.1 / 10.4804.2
    YOLOv12-X18.2 / 14.37.1 / 6.7512.5
  • YOLOv12-N 在 FP32 下加速 0.7ms (RTX 3080)
  • CPU 推理速度提升约 50%(N: 62.9→31.4ms, S: 130→78.4ms)
  • 加速效果在所有模型尺度和硬件配置上一致显著
  • CUDA 结果在 RTX 3080 / A5000 上测量,CPU 使用 i7-10700K,均未使用 FlashAttention

    Diagnosis

    诊断分析:关键设计选择

    (a)

    注意力实现方式

    Conv+BN: 40.6 AP, 1.64ms
    Linear+LN: 40.5 AP, 1.68ms
    卷积实现比线性实现更快更优

    (b)

    层级设计

    保留4阶段: 40.6 AP
    Plain ViT (N/A): 38.3 AP
    层级结构对YOLO系统至关重要

    (c)

    训练Epochs

    600 epochs: 40.6 AP
    500 epochs: 40.3 AP
    YOLOv12需要更长训练周期

    (d)

    Position Perceiver

    7×7 kernel: 40.6 AP
    3×3: 40.4 / 9×9: 40.7(慢)
    7×7为速度和精度的最佳平衡

    (e)

    位置编码

    不使用: 40.6 AP
    APE: 40.5 / RPE: 40.3
    无位置编码反而最优且更快

    (g)

    MLP Ratio

    MLP=1.2: 53.8 AP
    MLP=2.0: 53.6 / MLP=4.0: 53.1
    低MLP比例将计算集中于注意力

    Visualization

    热力图对比分析

    YOLOv12 的热力图显示更清晰的目标轮廓更精确的前景激活

  • 对比 YOLOv10 和 YOLOv11(均为X尺度)
  • Area Attention 提供更大的感受野
  • 更好地捕获全局上下文
  • 实现更精确的前景激活
  • Heat Map Comparison

    图:YOLOv10 vs YOLOv11 vs YOLOv12 热力图对比(X尺度模型,第三阶段Backbone)

    Conclusion

    总结与讨论

    🎯

    核心成就

    成功将注意力中心化设计引入YOLO框架,打破CNN在YOLO系列的统治地位,实现SOTA的延迟-精度权衡。

    🔬

    技术创新

    Area Attention降低计算复杂度、R-ELAN确保大模型收敛、多项架构优化适配实时检测场景。

    📈

    性能表现

    5个模型尺度全系列超越主流检测器。YOLOv12-N达40.6% mAP,仅1.64ms延迟。

    🔮

    未来展望

    为更高效、更强大的YOLO系统铺平道路,推动注意力机制在实时目标检测中的广泛应用。

    "This study challenges the dominance of CNN-based designs in YOLO systems and advances the integration of attention mechanisms for real-time object detection."

    感谢聆听

    YOLOv12: Attention-Centric Real-Time Object Detectors
    以注意力机制为核心的实时目标检测新时代
    Yunjie Tian · Qixiang Ye · David Doermann
    arXiv:2502.12524v1 · github.com/sunsmarterjie/yolov12
    Questions & Discussion