人工智能计算机视觉深度学习微调【免费下载链接】rf-detrRF-DETR is a real-time object detection and segmentation model architecture developed by Roboflow, SOTA on COCO, designed for fine-tuning. [ICLR 2026]项目地址https://gitcode.com/gh_mirrors/rf/rf-detr点击查看免费下载RF-DETR 是 Roboflow 提出的实时目标检测与分割模型架构论文收录于 ICLR 2026其官方基准结果集中记录在 docs/learn/benchmarks.md。本文以该文档为骨架完整呈现 RF-DETR 在 Microsoft COCO 与 RF100-VL 上的检测、实例分割、关键点检测实测数据并逐项核对仓库源码中对应的模型变体配置分辨率、patch size、解码层数、query 数量等帮助你读懂每一行数字的来历、理解精度/延迟/参数量之间的取舍并据此选择适合自己场景的模型规格。读完本文你将掌握RF-DETR 官方基准的评估协议含第三方模型的复测方式、6 档检测变体与 6 档分割变体的精度—延迟对照、关键点预览模型的 OKS 精度以及如何在当前仓库中按 benchmark 对应配置复现训练与推理。一、基准评估方法论数字是如何测出来的1.1 精度指标统一的 COCO 协议精度统一采用 pycocotools 计算的标准 COCO 指标AP50IoU 阈值 ≥ 0.50 时的检测精度AP50:95IoU 阈值从 0.50 到 0.95步长 0.05的平均精度是 COCO 最主要的综合指标关键点任务使用基于 OKSObject Keypoint Similarity的 AP50:95这是 COCO 关键点对比的标准指标。COCO 结果在验证集上评估遵循检测器基准测试的惯例。关键点在于本页所有模型——包括第三方模型——都由官方在同一套协议下、用 pycocotools 在 roboflow/sabSingle Artifact Benchmarking中统一复测并在完整的 5,000 张val2017图片上打分因此所有行之间直接可比数字可能与厂商自报数值不同。唯一的例外是标记为 † 的行这些数字引自原作者论文、未经过 SAB 复测应以作者自报而非独立复现来解读。RF100-VL 的结果则是对全部 100 个数据集取平均用以反映模型在多样化真实数据分布下的域迁移泛化能力。1.2 延迟指标单图推理延迟与热缓冲协议延迟测的是单张图片的推理延迟而非持续吞吐。所有延迟数据均在以下固定环境中测得NVIDIA T4 GPUTensorRT 10.4CUDA 12.4FP16 推理batch size 1两次前向之间插入200 ms 热缓冲以降低 GPU 功率节流与热效应带来的方差该流程提升了延迟测量的可复现性但不用于测量最大吞吐。1.3 精度与延迟必须同精度测量精度和延迟始终使用同一个模型产物、同一种数值精度测量。这避免了FP32 精度 FP16 延迟的误导性对比——因为对某些模型朴素 FP16 转换会显著降低精度。1.4 指标定义速查AP50 / AP50:95如上所述Params (M)部署fused状态下nn.Module的参数数model.parameters()以百万为单位不含仅训练用的分支与折叠后的归一化层统计的是模型参数而非保存 checkpoint 的原始张量数† 标记行使用作者自报参数数LatencyNVIDIA T4、TensorRT 10.4、CUDA 12.4、FP16、batch size 1200 ms 热缓冲。二、检测基准COCO 与 RF100-VL 精度 T4 延迟下表完整收录官方检测基准。可以看到 RF-DETR 各变体在 2.3 msNano到 17.2 ms2XL的延迟区间内COCO AP50:95 覆盖 48.4 到 60.1其中RF-DETR-2XL 达到 60.1 AP50:95 17.2 msRF-DETR-L 以 56.5 AP50:95 超过 YOLOv11x50.9且延迟更低6.8 ms vs 10.5 ms。ArchitectureCOCO AP50COCO AP50:95RF100VL AP50RF100VL AP50:95Latency (ms)Params (M)ResolutionRF-DETR-N67.648.485.057.72.330.5384x384RF-DETR-S72.153.086.760.23.532.1512x512RF-DETR-M73.654.787.461.24.433.7576x576RF-DETR-L75.156.588.262.26.833.9704x704RF-DETR-XL77.458.688.562.911.5126.4700x700RF-DETR-2XL78.560.189.063.217.2126.9880x880YOLO11-N52.037.481.455.32.52.6640x640YOLO11-S59.744.482.356.23.29.4640x640YOLO11-M64.148.682.556.55.120.1640x640YOLO11-L64.949.982.256.56.525.3640x640YOLO11-X66.150.981.756.210.556.9640x640YOLO26-N55.840.376.752.01.72.6640x640YOLO26-S64.347.782.757.02.69.4640x640YOLO26-M69.752.584.458.74.420.1640x640YOLO26-L71.154.185.059.35.725.3640x640YOLO26-X74.056.985.660.09.656.9640x640LW-DETR-T60.742.984.757.11.912.1640x640LW-DETR-S66.848.085.057.42.614.6640x640LW-DETR-M72.052.686.859.84.428.2640x640LW-DETR-L74.656.187.461.56.946.8640x640LW-DETR-X76.958.387.962.113.0118.0640x640D-FINE-N60.242.784.458.22.13.8640x640D-FINE-S67.650.685.360.33.510.2640x640D-FINE-M72.655.085.560.65.419.2640x640D-FINE-L74.957.286.461.67.531.0640x640D-FINE-X76.859.386.962.211.562.0640x640SAM 3 †———61.6—~8501008x1008† 由 SAM 3 作者报告arXiv:2511.16719Table 36未经我们在 SAB 中复测。该值来自 SAM 3 在完整 RF100-VL 训练集上微调的结果——与上表 RF100VL 各列的全监督设定一致区别于论文主表中 15.2 zero-shot / 36.5 10-shot 的数字。SAM 3 论文独立报告 LW-DETR-m 在该基准上为 59.8与我们的实测一致说明两套协议是对齐的。破折号表示 SAM 3 未在该协议下报告的结果。参数量为论文所述约 850 M约 450 M 视觉 约 300 M 文本编码器 约 100 M 检测/跟踪器。三、实例分割基准从 Nano 到 2XL 的精度—延迟全谱分割模型在 COCO 上从 Nano 的 40.3 AP3.4 ms覆盖到 2XL 的 49.9 AP21.8 ms六档变体在相同参数量区间33.6–38.6 M内通过分辨率与解码深度的组合拉开性能档位。ArchitectureCOCO AP50COCO AP50:95Latency (ms)Params (M)ResolutionRF-DETR-Seg-N63.040.33.433.6312x312RF-DETR-Seg-S66.243.14.433.7384x384RF-DETR-Seg-M68.445.35.935.7432x432RF-DETR-Seg-L70.547.18.836.2504x504RF-DETR-Seg-XL72.248.813.538.1624x624RF-DETR-Seg-2XL73.149.921.838.6768x768YOLOv8-N-Seg45.628.33.53.4640x640YOLOv8-S-Seg53.834.04.211.8640x640YOLOv8-M-Seg58.237.37.027.3640x640YOLOv8-L-Seg60.539.09.746.0640x640YOLOv8-XL-Seg61.339.514.071.8640x640YOLOv11-N-Seg47.830.03.62.9640x640YOLOv11-S-Seg55.435.04.610.1640x640YOLOv11-M-Seg60.038.56.922.4640x640YOLOv11-L-Seg61.539.58.327.6640x640YOLOv11-XL-Seg62.440.113.762.1640x640YOLO26-N-Seg54.334.72.312.7640x640YOLO26-S-Seg62.440.23.4710.4640x640YOLO26-M-Seg67.844.06.3223.6640x640YOLO26-L-Seg69.845.57.5828.0640x640YOLO26-X-Seg71.646.812.9262.8640x640四、关键点基准RF-DETR KeypointPreview关键点预览模型在 COCO 人体关键点上达到71.8 AP50:95OKS 制 9.7 msT4TensorRT FP16参数 40.7 M是官方当前唯一公开的关键点基准条目。下图对比了它与 YOLO11-pose、YOLO26-pose 系列在 MS COCO 上的 mAP vs 延迟表现。ArchitectureCOCO AP50:95Latency (ms)Params (M)RF-DETR Keypoint (Preview)71.89.740.7YOLO11-pose N48.93.22.9YOLO11-pose S57.53.49.9YOLO11-pose M64.25.220.9YOLO11-pose L65.26.626.2YOLO11-pose X68.610.658.8YOLO26-pose N55.91.92.9YOLO26-pose S62.02.710.4YOLO26-pose M68.04.621.5YOLO26-pose L69.25.925.9YOLO26-pose X71.09.857.6关键点基准报告 OKS 制的 AP50:95这是 COCO 关键点对比的标准指标。五、从基准到源码每个数字对应的模型配置benchmark 表中的Resolution列并非随意选取而是与 src/rfdetr/config.py 中各变体配置类以及 configs 目录下对应的示例训练配置逐一对应的。理解这些配置才能解释为什么延迟随档位爬升以及为什么分割变体参数只小幅增长。5.1 检测变体的配置族谱检测模型共享一个基类RFDETRBaseConfig各档通过覆盖若干关键字段拉开差距变体配置类分辨率patch_sizenum_windowsdec_layers位置编码尺寸预训练权重NanoRFDETRNanoConfig384162224rf-detr-nano.pthSmallRFDETRSmallConfig512162332rf-detr-small.pthMediumRFDETRMediumConfig576162436rf-detr-medium.pthLargeRFDETRLargeConfig704162444rf-detr-large-2026.pthBase旧RFDETRBaseConfig560—4337rf-detr-base.pth例如RFDETRNanoConfigsrc/rfdetr/config.py#L866-L875将num_windows降为 2、dec_layers降为 2并以positional_encoding_size 24对应384 // 16RFDETRLargeConfigsrc/rfdetr/config.py#L902-L925则显式固定num_queries 300、num_select 300——源码注释明确指出这是为了确保 legacy 路径与 PyTorch Lightning 路径在 postprocess 阶段使用一致的 top-k 数量避免推理结果不一致。值得注意的是位置编码的自动同步逻辑src/rfdetr/config.py#L594-L628当你在构造模型时显式传入自定义resolution如RFDETRLarge(resolution640)只要该变体默认的位置编码尺寸是按分辨率 ÷ patch_size公式推导的配置校验器就会自动按resolution // patch_size更新positional_encoding_size。而像RFDETRBaseConfig这类针对 DINOv2 原生 518 网格预设了positional_encoding_size37对应默认 560 分辨率的配置则保持不变。这解释了文档中训练接受自定义 square resolution但必须能被patch_size * num_windows整除的约束——该约束同时体现在各变体类的 docstring 中见 src/rfdetr/variants.py。5.2 分割变体低分辨率 浅层 patch 的性价比设计分割变体统一继承RFDETRSegsrc/rfdetr/variants.py#L149-L156使用patch_size 12与更小的分辨率变体分辨率patch_sizedec_layersnum_queries位置编码尺寸预训练权重Seg-Nano31212410026rf-detr-seg-nano.ptSeg-Small38412410032rf-detr-seg-small.ptSeg-Medium43212520036rf-detr-seg-medium.ptSeg-Large50412520042rf-detr-seg-large.ptSeg-XLarge62412630052rf-detr-seg-xlarge.ptSeg-2XLarge76812630064rf-detr-seg-2xlarge.pt由于各档主干与头结构相近参数从 33.6 MNano到 38.6 M2XL仅增长约 15%精度与延迟的提升主要来自分辨率和解码深度dec_layers4→6以及 query 数100→300。分割变体的分辨率多取 24 的倍数Nano 用 12 的倍数与patch_size * num_windows的可整除约束一致。5.3 XL / 2XL来自 plus 扩展包表中 RF-DETR-XL700x700与 RF-DETR-2XL880x880两个变体在仓库中由rfdetr_plus扩展包提供——src/rfdetr/platform/models.py 中RFDETRXLarge、RFDETR2XLarge在缺少该扩展包时会抛出带安装提示的ImportError这也解释了为何这两档的参数量126.4 / 126.9 M与其他检测变体约 30–34 M不在一个量级。六、复现与实战按基准配置跑训练和推理6.1 训练直接使用官方示例配置仓库 configs 目录为每个主流变体提供了可直接运行的示例训练配置。检测与分割的 Nano 档示例分别是# configs/rfdetr_nano.yaml节选 model: model_config: class_path: rfdetr.config.RFDETRNanoConfig init_args: num_classes: 80 # 改为你的数据集类别数 train_config: class_path: rfdetr.config.TrainConfig init_args: dataset_dir: /data/coco # COCO 格式数据集路径 output_dir: output/rfdetr_nano epochs: 100 batch_size: 8 num_workers: 4 tensorboard: true# configs/rfdetr_seg_nano.yaml节选 model: model_config: class_path: rfdetr.config.RFDETRSegNanoConfig init_args: num_classes: 80 train_config: class_path: rfdetr.config.SegmentationTrainConfig init_args: dataset_dir: /data/coco output_dir: output/rfdetr_seg_nano epochs: 100 batch_size: 4 num_workers: 4 tensorboard: true启动命令统一为rfdetr fit --config configs/rfdetr_nano.yaml # 覆盖数据集路径与训练设备 rfdetr fit --config configs/rfdetr_nano.yaml \ --model.train_config.init_args.dataset_dir /data/my_dataset \ --trainer.devices 4Large 档示例configs/rfdetr_large.yaml展示了高分辨率变体的显存策略batch_size: 2配合grad_accum_steps: 8达到 16 的等效 batch size。所有变体默认从各自发布的预训练权重如 rf-detr-nano.pth、rf-detr-large-2026.pth开始与 benchmark 表中最新发布 checkpoint的口径一致。若显式传入pretrain_weightsNonesrc/rfdetr/config.py 中的_warn_pretrain_compatibility校验器会给出警告提示从零初始化通常会降低精度。6.2 推理predict 接口与分辨率覆盖加载与推理入口在 src/rfdetr/detr.pyRFDETR.from_checkpoint()src/rfdetr/detr.py#L603用于从 checkpoint 恢复模型RFDETR.predict()src/rfdetr/detr.py#L2477-L2489执行推理接受单张或列表形式的图片输入文件路径、PIL Image、NumPy 数组或已归一化到 [0,1] 的(C,H,W)torch.Tensor。predict的两个关键参数与 benchmark 直接相关shape可传(height, width)覆盖模型的默认推理分辨率两个维度必须是能被patch_size * num_windows整除的正整数未设置时默认(model.resolution, model.resolution)patch_size用于整除性校验的 backbone patch size默认取model_config.patch_size。也就是说你可以把任意变体临时调整到 benchmark 表中的分辨率档位如把 Large 降到 576 换取更快延迟只要满足整除约束即可推理输出为 Supervision 的Detections/KeyPoints对象可直接接下游可视化与部署管线。七、如何阅读与使用这张基准表综合检测与分割两张表可提炼出三条选择模型档位的实用规律同参数量下靠分辨率与解码深度换取精度检测变体 Nano→Large 参数量仅从 30.5 M 增至 33.9 M但 COCO AP50:95 从 48.4 提升到 56.5代价是延迟从 2.3 ms 增至 6.8 ms——分辨率384→704与解码器深度是主要推手精度拐点出现在 Medium 以上检测表中从 M54.7到 L56.5再到 XL58.6的增益递减而 XL/2XL 以 4 倍参数量126 M 级换取最后 1.5–3 个点边际收益明显下降适合对精度有极致要求的场景分割与关键点任务可复用同一套编码器分割六档共享约 34–39 M 参数关键点预览模型 40.7 M说明三者是基于同一检测骨架的头部扩展训练与部署经验可互相迁移。各变体的完整配置参考、训练参数说明与模型权重清单可进一步查阅 docs/reference 下的对应文档如 nano.md、seg_2xlarge.md、keypoint_train_config.md以及 docs/learn/pretrained.md 的预训练模型清单。赞分享人工智能计算机视觉深度学习微调【免费下载链接】rf-detrRF-DETR is a real-time object detection and segmentation model architecture developed by Roboflow, SOTA on COCO, designed for fine-tuning. [ICLR 2026]项目地址https://gitcode.com/gh_mirrors/rf/rf-detr点击查看免费下载相关推荐RF-DETR 完全上手指南基于 DINOv2 的实时目标检测、实例分割与关键点检测Roboflow, ICLR 2026RF DETR 完全上手指南基于 DINOv2 的实时目标检测、实例分割与关键点检测Roboflow, ICLR 2026 RF DETRRoboflo人工智能计算机视觉深度学习微调MMPose 基准测试解读COCO 关键点检测的速度与精度对比分析MMPose 基准测试解读COCO 关键点检测的速度与精度对比分析 导读 本篇文章围绕 docs/en/notes/benchmark.md https://计算机视觉人工智能深度学习关键点检测与实例分割实战应用关键点检测与实例分割实战应用 本文详细介绍了三种重要的计算机视觉技术DeepPose回归式关键点检测、HRNet高分辨率特征保持和Mask R CNN实例分割示例工程创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
基于PyQt6的本地快捷启动器:统一管理软件、文档、文件夹与网址 你有没有这种感觉:浏览器书签栏攒了几百个链接,桌面上铺满快捷方式,硬盘里的文档散落在七八个文件夹,每次开工前光找入口就要花掉五分钟。我就是被这种“找东西”的体验折磨到忍无可忍,才动手做了这个编号 806 的小项目… · 2026/9/25 7:47:12
PaddleSpeech GE2E 说话人编码器实战:从多数据集预处理到说话人嵌入提取与迁移学习 人工智能语音音频NLP媒体生成 【免费下载链接】PaddleSpeech Easy-to-use Speech Toolkit including Self-Supervised Learning model, SOTA/Streaming ASR with punctuation, Streaming TTS with text frontend, Speaker Verification System, End-to-End Speech Translation … · 2026/9/25 7:47:00
Word表格跨页断开怎么合并?视觉与物理合并全攻略 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 8:20:58
DeskcommCRM深度解析:桌面通讯型客户管理平台的价值与落地实践 做销售管理和客户运营这些年,我接触最多的一类系统就是DeskcommCRM这类桌面通讯型客户管理平台。不是说传统CRM不好,而是过去很长一段时间里,很多团队的客户资料散落在Excel、手机通讯录和一堆聊天记录里,真正需要查客户历史的时候… · 2026/9/25 8:20:58
嵌入式通信协议对比:i2c、spi、uart、i2s选型与调试实战指南 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 8:20:58
DeskcommCRM落地指南:从选型到数据迁移,避开常见销售管理坑 1. 先从销售团队的真实痛点说起:为什么需要一个叫DeskcommCRM的东西1.1 客户资料满天飞,销售每天都在做重复劳动我带过好几个销售团队,也帮朋友团队做过CRM选型咨询。说句实在话,大部分团队在客户管理上最大的问题不是“没工具”&… · 2026/9/25 8:20:58
PPT波浪线怎么去掉?四种彻底关闭拼写检查的方法 1. 波浪线到底是个什么东西1.1 先搞清楚敌人是谁很多人第一次在PPT里看到文字下面冒出红色或蓝色的波浪线,第一反应是“我是不是打错字了”,第二反应是“这玩意儿怎么删不掉”。你选中文字按Delete,波浪线纹丝不动;你换字体换颜色… · 2026/9/25 8:20:58
Golang 构建 DevOps 平台:架构设计与核心实现 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 8:20:52
创维E900V22D刷机全攻略:S905L3SB芯片兼容性解析与救砖实战 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:31
MQTT协议原理与Broker服务器搭建实战:从Mosquitto到EMQX /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/25 1:00:37