news 2026/10/7 4:57:00

YOLO卷不动了,目标检测还能这样发论文!

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
YOLO卷不动了,目标检测还能这样发论文!

YOLO实在卷不动了,不知道目标检测还有哪些baseline好用?不知道怎么选?

实际上DETR系列都是好选择,也一直很火。包括RT-DETR系列、DINO系列、D-FINE系列等,近来更是出现了很多新变体,像是DINOv3、RF-DETR……此外,RetinaNet、轻量化检测等,也是主流。而具体的选择,则需要结合任务的特点。比如速度要求高,可以选RT-DETR;精度要求高,可以考虑Co-DETR……

同时,想往这方向发论文的伙伴,还可以关注一些顶会新赛道:SAM+目标检测、Mamba+目标检测、扩散模型+目标检测、YOLO+多模态……纵观近2年的顶会,这些领域录用量都在上涨,且还不算卷!

为让大家能够紧跟领域前沿,早点发出自己的顶会,以上所提所有baseline和方向,我都给大家准备了配套的参考论文和源码,共145篇!

扫描下方二维码,回复「目检145」

免费获取全部论文合集及项目代码

RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models

内容:这篇论文提出了RT-DETRv4,一个通过视觉基础模型(VFM)知识蒸馏来增强实时目标检测器的新框架。核心创新包括:1)深度语义注入器(DSI),将VFM的高层语义表示整合到检测器深层;2)梯度引导自适应调制(GAM),根据梯度范数比动态调整语义迁移强度。该方法在不增加推理开销的情况下,显著提升了DETR系列模型的性能,在COCO数据集上达到了新的SOTA水平。

D-FINED:REDEFINE REGRESSION TASK IN DETRS ASFINE-GRAINED DISTRIBUTION REFINEMENT

内容:这篇论文提出了D-FINE,一个通过重新定义DETR模型中边界框回归任务来实现出色定位精度的实时目标检测器。核心创新包括:1)细粒度分布细化(FDR),将回归过程从预测固定坐标转变为迭代细化概率分布,提供更精细的中间表示;2)全局最优定位自蒸馏(GO-LSD),通过自蒸馏将深层精炼的分布知识传递到浅层。该方法在COCO数据集上达到SOTA性能(D-FINE-X获得55.8% AP at 78 FPS),并能将各种DETR模型性能提升高达5.3% AP,且几乎不增加额外参数和训练成本。

扫描下方二维码,回复「目检145」

免费获取全部论文合集及项目代码

DEYOLO: Dual-Feature-Enhancement YOLO for Cross-Modality Object Detection

内容:这篇论文提出了DEYOLO,一种用于跨模态目标检测的双特征增强YOLO框架,专门解决低光照环境下的检测问题。核心创新包括:1)双语义增强通道权重分配模块(DECA)和双空间增强像素权重分配模块(DEPA),通过双重增强机制在特征空间聚合跨模态信息,减少两种模态间的相互干扰;2)双向解耦焦点机制,扩大骨干网络在不同方向的感受野。该方法在M3FD和LLVIP数据集上显著优于现有的融合检测方法,mAP50提升超过5%,且DECA和DEPA模块可作为即插即用组件应用于其他模型。

Mamba-YOLO-World: Marrying YOLO-World with Mamba for Open-Vocabulary Detection

内容:这篇论文提出了Mamba-YOLO-World,一种将YOLO-World与Mamba状态空间模型结合的开词汇目标检测方法。核心创新是MambaFusion路径聚合网络(MambaFusion-PAN),通过并行引导选择扫描(PGSS)和串行引导选择扫描(SGSS)算法,以线性复杂度O(N+1)实现全局引导感受野的多模态特征融合。实验表明,该方法在COCO和LVIS数据集上零样本和微调设置下均优于原始YOLO-World,在保持相当参数量和计算量的同时,AP提升0.4%-1.8%,且超越了现有开词汇检测SOTA方法。

扫描下方二维码,回复「目检145」

免费获取全部论文合集及项目代码


版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/5 5:37:30

工业控制主板复位电路PCB布局注意事项

以下是对您提供的技术博文《工业控制主板复位电路PCB布局关键技术分析》的 深度润色与专业重构版本 。本次优化严格遵循您的全部要求: ✅ 彻底去除AI痕迹,语言自然、老练、有工程师现场感; ✅ 摒弃“引言/概述/总结”等模板化结构,全文以 问题驱动+工程叙事+经验沉淀 …

作者头像 李华
网站建设 2026/10/7 3:24:10

ChatGLM-6B效果实测:技术文档翻译质量对比(vs Google/Bing/DeepL)

ChatGLM-6B效果实测:技术文档翻译质量对比(vs Google/Bing/DeepL) 1. 为什么拿ChatGLM-6B做技术文档翻译测试? 你有没有遇到过这样的情况:手头有一份英文API文档,要快速理解接口参数含义,但用…

作者头像 李华
网站建设 2026/10/5 5:06:08

Clawdbot效果展示:Qwen3-32B在代码生成、推理、多轮对话中的真实能力

Clawdbot效果展示:Qwen3-32B在代码生成、推理、多轮对话中的真实能力 1. Clawdbot是什么:一个让AI代理管理变简单的平台 Clawdbot不是另一个需要从零配置的命令行工具,也不是只能跑demo的玩具系统。它是一个真正面向工程落地的AI代理网关与…

作者头像 李华
网站建设 2026/10/5 5:06:06

Z-Image-Turbo升级后体验大幅提升,生成更流畅

Z-Image-Turbo升级后体验大幅提升,生成更流畅 你有没有试过——输入一句提示词,盯着进度条数到第九步,心跳跟着显存占用一起飙升,最后却等来一张模糊、失真、甚至“画猫成狗”的图?不是模型不行,而是传统文…

作者头像 李华
网站建设 2026/10/5 5:06:14

依赖环境说明:InstructPix2Pix运行所需CUDA/Torch版本兼容列表

依赖环境说明:InstructPix2Pix运行所需CUDA/Torch版本兼容列表 1. 为什么需要关注CUDA与PyTorch版本? InstructPix2Pix 是一个对计算环境高度敏感的图像编辑模型——它不是“装上就能跑”的轻量工具,而是一个依赖特定底层算子、精度策略和显…

作者头像 李华