尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
一文读懂UniDetector:CVPR 2023通用目标检测如何做到「不重训就能认万物」?
一文读懂UniDetectorCVPR 2023通用目标检测如何做到「不重训就能认万物」【免费下载链接】UniDetectorCode release for our CVPR 2023 paper Detecting Everything in the Open World: Towards Universal Object Detection.项目地址: https://gitcode.com/gh_mirrors/un/UniDetectorUniDetector 是 CVPR 2023 论文《Detecting Everything in the Open World: Towards Universal Object Detection》的官方开源实现它借助 CLIP 的图文对齐能力让通用目标检测器无需针对新类别重新训练就能在开放世界Open World中识别从「滑板护膝」到「手风琴」的万物目标。本文带你快速看懂它的核心原理与上手方法。一、什么是通用目标检测传统检测器如 Faster R-CNN只能识别「训练时见过」的固定类别比如 COCO 的 80 类。一旦想检测新类别就得重新标注、重新训练。UniDetector 要解决的问题是用一个模型同时学会多个数据源的标签空间并泛化到训练中从未见过的类别与场景。上图中它把 COCO、Objects365、OpenImages 等标签空间各不相同的数据源融合训练推理时就能检测「鱼、船坞、西兰花、暖气片」等开放世界目标。二、「不重训就能认万物」的 3 个核心技巧1️⃣ 用 CLIP 替代普通 ResNet 作骨干网络UniDetector 把 Faster R-CNN 的 ResNet 骨干换成了在图文数据上预训练的CLIPResNet见 clipresnet.py特征天生就「懂」语言语义这是它能识别未见类别的根本原因。2️⃣ 零样本分类用语言嵌入当「类别词典」这是最关键的一步。普通分类头输出固定 80 个分数而 UniDetector 的BBoxHeadCLIP见 bbox_head_clip.py直接取消了固定分类头改为把目标框特征与预计算的 CLIP 语言嵌入做相似度匹配——每个类别只是一句文本描述如 a photo of a bus换类别 换文本完全不用重训。项目已附带各数据集的预计算语言嵌入存放在 clip_embeddings/ 目录也可通过 scripts/dump_clip_features_manyprompt.py 自行生成。3️⃣ 两阶段「解耦训练」 概率校准第一阶段提案只训练区域提案网络CLN产出候选框第二阶段分类冻结提案用 CLIP 嵌入训练 RoI 分类CLM概率校准推理时结合「提案置信度」与「类别先验概率」修正最终分数进一步提升开放世界精度。对应配置可直接参考阶段配置文件端到端训练clip_end2end_faster_rcnn_r50_c4_1x_coco.py解耦训练·第一阶段clip_decouple_faster_rcnn_r50_c4_1x_coco_1ststage.py解耦训练·第二阶段clip_decouple_faster_rcnn_r50_c4_1x_coco_2ndstage.py开放世界推理clip_end2end_faster_rcnn_r50_c4_1x_lvis_v0.5.py带概率校准推理clip_decouple_faster_rcnn_r50_c4_1x_lvis_v0.5_2ndstage_withcalibration.py多数据集COCO Objects365、 OpenImages训练配置也在 configs/multidataset/ 下思路与单数据集一致。三、实际检测效果长什么样这是项目 demo 使用的公园街景原图同一张图片经 UniDetector 通用目标检测后的输出长椅、汽车等目标都被框出并打上类别标签想在自己的图片上体验可以直接运行 image_demo.py配合 demo.jpg 快速跑通一次推理。四、新手快速上手 4 步安装环境代码基于 mmdetection v2.18.0另需安装 CLIP 库准备数据集把 COCO、LVIS、Objects365、OpenImages 按 docs/datasets.md 的结构放到data/目录只需子集无需下载全量准备语言嵌入直接使用 clip_embeddings/ 中已发布的嵌入文件即可跑通推理参考上表的 inference 配置执行tools/dist_test.sh即可得到 LVIS v0.5 上的开放世界检测结果。训练流程bash tools/dist_train.sh 配置文件 8与标准 mmdetection 完全一致详见项目根目录 README.md。五、项目结构速览 目录作用mmdet/models/backbones/clipresnet.pyCLIP 版 ResNet 骨干mmdet/models/roi_heads/bbox_heads/bbox_head_clip.py零样本 CLIP 分类头核心创新configs/单数据集、多数据集、推理三套配置clip_embeddings/各数据集预计算 CLIP 语言嵌入scripts/dump_clip_features_manyprompt.py自定义语言嵌入生成脚本demo/图片/视频/摄像头推理演示总结UniDetector 的思路可以概括为一句话把「分类器」变成「图文相似度匹配器」。通过 CLIP 骨干 语言嵌入零样本分类 两阶段解耦训练与概率校准它让目标检测第一次真正走向开放世界的「万物识别」。如果你想研究开放世界检测这个项目值得一读。✨【免费下载链接】UniDetectorCode release for our CVPR 2023 paper Detecting Everything in the Open World: Towards Universal Object Detection.项目地址: https://gitcode.com/gh_mirrors/un/UniDetector创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

深度学习实战:从零构建自定义数据集训练流程与调优策略

深度学习实战:从零构建自定义数据集训练流程与调优策略

这次我们来看一个深度学习入门到进阶的实战问题:如何用自己的数据集跑通深度学习流程。很多教程还在用MNIST、CIFAR-10这些标准数据集,但一到自己的数据就卡壳。这篇文章不绕弯子,直接解决从数据到模型落地的核心障碍。核心问题有三个&#x…

📅 2026/10/11 18:15:55
PHP(单文件)对接阿里云V3短信签名

PHP(单文件)对接阿里云V3短信签名

PHP (单文件)对接阿里云V3短信签名 无需引入sdk,封装单文件即可 我这里用到了guzzle来发送http请求,如果不需要也可以换成原生curl $data [code > 123456 ]; $aliyun new AliSms(); $result $aliyun->send(1300000000,SMS_500000001,$data,测试…

📅 2026/10/11 18:17:41
UIColor、HSV与RGB颜色空间转换全解:Colorful ColorfulEntity.swift颜色模型详解

UIColor、HSV与RGB颜色空间转换全解:Colorful ColorfulEntity.swift颜色模型详解

UIColor、HSV与RGB颜色空间转换全解:Colorful ColorfulEntity.swift颜色模型详解 【免费下载链接】Color-Picker-for-iOS Colorful: iOS color picker built with Swift. 项目地址: https://gitcode.com/gh_mirrors/co/Color-Picker-for-iOS Colorful 是一款…

📅 2026/10/4 11:29:45
MORE NEWS

更多资讯

📰

R语言钻石价格分析:从数据清洗到回归建模实战

简介:这是一个基于R语言的钻石价格回归分析实战案例,适合数据分析、统计建模和机器学习入门者,目标是厘清影响钻石价格的关键因素并构建预测模型。案例依托ggplot2内置diamonds数据集,覆盖数据概览、缺失与重复值检查、异常值剔除…

📰

YOLOv8实时目标检测与屏幕坐标映射:Python自瞄系统实战

简介:这是一份基于YOLOv8实现的AI自瞄项目Python源码与文档说明,面向计算机、人工智能、自动化等专业的学生与开发者,可用于毕业设计、课程设计、项目立项演示或自学进阶。项目支持YOLOv5、YOLOv8乃至最新YOLOv9模型,可自行训练并…

📰

JVM内存监控与OOM排查实战:从命令到告警体系

你有没有经历过这样的时刻:线上服务突然 CPU 拉满,接口陆续超时,打开监控面板一看,堆内存已经爬到了顶,Full GC 的频率几乎每秒一次。你翻出命令手册想看一眼内存分布,却又不敢贸然执行,生怕 jm…

📰

kenlm.zip预编译包避坑指南:从训练到部署的语言模型实践

简介:一份预编译的KenLM语言模型工具包,专注于解决NLP、语音识别或文本完成场景中统计语言模型的部署难题,开发者解压后即可直接调用,无需自行编译源码或配置C依赖。KenLM以高效的四元n-gram建模为核心,支持在线学习、…

📰

MySQL学习笔记 03、MySQL存储引擎

文章目录 前言 一、介绍存储引擎 1.1、InnoDB引擎 1.2、MyISAM引擎 二、InnoDB与MyISAM的对比 三、不同的场景选择引擎 前言 本文是付费专栏 《Java后端开发从入门到进阶》 的配套文章,所属阶段与专题为「阶段二:数据库与缓存 / 2.1 MySQL」。 专栏介绍:适合 Java 初学者及…

📰

自动侧推定位机构中的接近开关:让工件靠边更准确

自动侧推定位机构常用于装配前校正、检测前靠边、输送线转位和小型工件姿态调整。工件从输送线进入定位区后,通常需要由侧推板或气缸将其推向基准面。如果侧推距离不足,工件可能没有真正贴紧定位边;如果回位不完整,又会影响下一个…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬