ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Ultralytics YOLO26 单目深度估计的室外分布外基准:Make3D 数据集解析与零样本评测实践

Ultralytics YOLO26 单目深度估计的室外分布外基准:Make3D 数据集解析与零样本评测实践 Ultralytics YOLO26 单目深度估计的室外分布外基准Make3D 数据集解析与零样本评测实践【免费下载链接】ultralyticsUltralytics YOLO26, YOLO11, YOLOv8 — object detection, instance segmentation, semantic segmentation, image classification, pose estimation, object tracking项目地址: https://gitcode.com/GitHub_Trending/ul/ultralytics本文基于 Ultralytics YOLO 仓库的 Make3D 深度数据集文档讲解 Make3D 这一经典室外单目深度估计基准的数据构成、评测协议多尺度 水平翻转 TTA、log-最小二乘尺度对齐、YOLO26-Depth 系列模型在其上的零样本 delta1 结果以及如何用仓库源码中的预测与指标实现复现和解读这些数字。读完后你可以理解分布外基准为什么 delta1 偏低属于预期并能直接复制命令在 Make3D 图像上运行预训练深度模型。Make3D 数据集概览Make3D 是单目深度估计领域的经典室外基准它由校园实景照片Cornell 校区场景与深度真值配对构成深度真值由定制 3D 激光扫描仪捕获。其关键特性在原文档中明确列出深度真值来自定制 3D 激光扫描仪而非普通 RGB-D 传感器覆盖真实室外校园场景深度范围最大约70 m官方评测在标准134 张图像的测试集上进行被广泛用作分布外out-of-distribution, OOD泛化探针。在 YOLO26 的深度估计体系里数据集按用途分为三类调试集如 Depth8、预训练数据源ARKitScenes、SUN RGB-D、DIODE、Hypersim、TartanAir、Virtual KITTI 2、KITTI、ImageNet 伪标签等以及评测基准。Make3D 属于第三类与 NYU Depth V2、KITTI Eigen、ETH3D、iBims-1 并列详见 深度数据集总览。Make3D 在 YOLO26-Depth 中的定位零样本评测基准文档明确指出 Make3D 是 YOLO26-Depth 系列的零样本评测基准发布的预训练模型并未在其上训练过。这意味着它专门用来检验模型对训练中未见过的室外场景的泛化能力。由于训练混合集以室内≤10 m和较规整的室外驾驶场景为主Make3D 的校园场景在成像条件、深度分布上偏离训练域因此文档称它是对所有模型而言最难的基准——所有模型的绝对 delta1 值整体偏低这在该数据集上是预期现象不能与室内基准如 NYU Eigen 的 0.933直接横向比较。另外可以从仓库的 任务文档交叉印证这一协议差异其中说明 NYU 等基准的数字带有多尺度 水平翻转 TTA 与 log-最小二乘对齐而本仓库内置 validator 实现的是中位数仅尺度对齐的单尺度评测因此 Make3D 页上的数字对应的是带 TTA 与 log-最小二乘对齐的标准评测脚本口径而非仓库内yolo depth val的直接复算。评测协议要点Make3D 上的指标计算包含两个前置步骤测试时增强TTA多尺度推理 水平翻转尺度对齐在计算指标前对预测深度图与真值深度图做log-最小二乘log-least-squares尺度对齐——单目深度网络预测的往往是相对尺度评测前统一对齐才能公平比较绝对精度。最终报告的指标是delta1 精度预测深度落在真值 1.25 倍阈值内即max(p/g, g/p) 1.25的像素百分比数值越高越好。各尺寸模型的零样本结果文档给出的 YOLO26-Depth 系列在 Make3D 测试集上的 delta1 如下模型delta1YOLO26n-depth0.307YOLO26s-depth0.311YOLO26m-depth0.293YOLO26l-depth0.297YOLO26x-depth0.299几点解读结合文档与源码口径所有尺寸 delta1 集中在 0.29–0.31 区间验证了OOD 基准上绝对值整体偏低的说法最小模型 YOLO26s-depth0.311甚至略高于更大尺寸说明在分布外泛化上模型规模并不是单调优势项任务页面中 YOLO26x-depth 在 Make3D 上的行0.302带 TTA 与 log-最小二乘协议与本表同属发布口径可相互印证。delta1 指标在仓库中的实现仓库源码中的指标实现与上述口径严格对应可以作为复现时的参照DepthMetrics 类实现了 delta1/2/3、abs_rel、rmse、silog 五项指标delta1 即逐图像计算(max(p/g, g/p) 1.25)的像素占比每图结果先在 float64 累加再对验证集逐图平均每图权重相同与 Depth Anything V2 的 per-sample 平均一致有效真值像素不足 10 张的图像被跳过非有限预测值按深度边界计分GT 落在(min_depth, max_depth)之外的像素被剔除且预测值被截断到该区间Eigen 评测协议DepthValidator 继承自DetectionValidator无 NMS 后处理预测图经双线性插值对齐真值尺寸后送入DepthMetrics并支持 DDP 下跨 rank 的统计量 all-reduce 归并默认max_depth100.0可由数据集 YAML 的max_depth覆盖对齐方式为逐图中位数尺度对齐。注意仓库内 validator 的默认对齐是中位数尺度对齐alignmedian而 Make3D 发布数字使用的是 log-最小二乘对齐 多尺度/翻转 TTA这正是文档强调该基准由专用评测脚本评测的原因。评测方式无内置 YAML使用专用评测脚本文档明确说明Make3D 不随仓库附带数据集 YAML。可以在ultralytics/cfg/datasets/下确认这一点——内置的深度 YAML 包括nyu-depth.yaml、depth8.yaml、depth-kitti.yaml、depth-sunrgbd.yaml、depth-arkitscenes.yaml、depth-hypersim.yaml、depth-tartanair.yaml、depth-vkitti2.yaml、depth-diode.yaml等但没有 Make3D 对应文件。因此 Make3D 的评测路径是使用仓库文档所述的专用评测脚本加载 Make3D 图像与激光扫描仪深度真值套用标准 TTA log-最小二乘尺度对齐后报告深度指标。对普通使用者而言Make3D 是外部基准最常见的用法是直接用predict在其图像上跑推理。在 Make3D 图像上运行预测继承原文档的完整用法示例。Make3D 为外部基准典型工作流是用预训练模型predict其图像目录完整参数说明见 Prediction 文档# Python from ultralytics import YOLO # Load a model model YOLO(yolo26x-depth.pt) # load a pretrained depth model # Predict depth on Make3D images results model.predict(path/to/make3d/images)# CLI: Predict depth with a pretrained *.pt model yolo depth predict modelyolo26x-depth.pt sourcepath/to/make3d/images预测结果访问方式结合 深度任务文档 的 Results 输出说明每个图像返回一个Results对象result.depth.data是形状(H, W)的torch.Tensor单位为米可直接.cpu().numpy()转为 NumPy float32 深度图depth 任务没有实例框boxes和实例掩码masks。若需可视化可调用ultralytics.utils.plotting中的colorize_depth将深度图着色为 BGR uint8 图像无效像素 0渲染为黑色result.plot()默认以cmapjet、modedisparity叠加显示。预训练模型与引用信息预训练模型YOLO26 深度系列yolo26n/s/m/l/x-depth覆盖从轻量到重型多种规模首次使用时自动从最新 Ultralytics 发布自 v8.4.0 起下载模型结构定义可见 yolo26-depth.yaml。发布权重在约 2.19M 张室内外混合图像室内 ≤10 m 到室外约 80 m上预训练并已内置一次全局尺度校准model.calibrate()在预训练验证混合集上拟合的两参数 log 仿射变换因此可直接输出米制深度。引用若在研究中使用 Make3D 数据集请引用其原始论文article{saxena2009make3d, title{Make3D: Learning 3D Scene Structure from a Single Still Image}, author{Saxena, Ashutosh and Sun, Min and Ng, Andrew Y.}, journal{IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)}, year{2009} }小结与适用前提Make3D 在 YOLO26-Depth 体系中是零样本 OOD 室外基准134 张测试图、深度至约 70 m各尺寸模型 delta1 约 0.29–0.31偏低属预期发布数字的口径是多尺度 水平翻转 TTA log-最小二乘尺度对齐与仓库内 DepthValidator 的默认中位数对齐单尺度口径不同复算时需注意这一协议差异仓库未附带 Make3D 数据集 YAML官方评测依赖专用脚本日常使用以yolo depth predict直接推理其图像为主本文所有数字、参数与命令均以当前仓库 Make3D 文档、深度任务文档 及 指标源码 为准适用于 YOLO26-Depth 系列-depth后缀权重及depth任务模式。【免费下载链接】ultralyticsUltralytics YOLO26, YOLO11, YOLOv8 — object detection, instance segmentation, semantic segmentation, image classification, pose estimation, object tracking项目地址: https://gitcode.com/GitHub_Trending/ul/ultralytics创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表