TAO深度估计训练Skill tao-train-depth-anything-v2

该技能是NVIDIA TAO框架下的单目深度估计模型技能,基于Depth Anything V2架构(包括Metric和Relative两种变体),支持从单张RGB图像预测逐像素深度。它提供数据转换、训练(含AutoML、多GPU/多节点)、评估、推理、导出量化和TensorRT部署的全链路能力和多套微调配方。关键词:TAO、Depth Anything V2、单目深度估计、MetricDepthAnything、RelativeDepthAnything、模型训练、AutoML、TensorRT部署。

视觉模型训练 0 次安装 4 次浏览 更新于 9/6/2026
名称 tao-train-depth-anything-v2
描述 使用Metric Depth Anything v2或Relative Depth Anything架构进行单目深度估计。从单个RGB图像预测逐像素深度,支持训练、评估、导出与推理。触发短语:训练单目深度、DepthAnything v2、metric depth from single image、monocular depth estimation。
开源协议 Apache-2.0 compatibility: 需要docker + nvidia-container-toolkit。 metadata:
版本 “0.1.0”
作者 NVIDIA Corporation allowed-tools: Read Bash tags: - monocular - depth - estimation

Depth Net Mono(单目深度网络)

独立安装? 如果此会话不是由TAO技能库插件初始化的,请先运行tao-setup技能(主机预检、凭据、跨技能发现)。

该技能基于Metric Depth Anything v2或Relative Depth Anything架构,实现从单张RGB图像预测逐像素深度的单目深度估计任务。

主要能力

  • 训练(train)、评估(evaluate)、推理(inference)、导出(export)和量化(quantize)
  • 支持AutoML自动搜索配置(默认开启,可关闭)
  • 支持多GPU/多节点训练(DDP/FSDP)
  • 支持TensorRT导出与部署流程
  • 内置数据转换(convert)和多种数据集适配类

工作流概述

  1. 准备图像+深度真值数据集,并确保容器内可访问。
  2. 根据数据编码(视差或公制深度)设置model_typedataset_name
  3. 编写spec YAML,指定数据源、模型类型、训练精度等。
  4. 使用depth_net <action> -e <spec.yaml>运行相应操作。
  5. 检查运行状态、status.json中的kpi指标以及输出产物。

关键参数

  • model.model_type: RelativeDepthAnythingMetricDepthAnything
  • dataset.<split>.data_sources: 必须提供 data_filedataset_name
  • 推荐训练精度:fp32(或Ampere GPU上的bf16)
  • 多GPU策略:ddpfsdp

配置与部署

  • TAO Deploy的TensorRT操作需阅读references/tao-deploy-depth-anything-v2.md
  • 部署规范模板位于references/spec_template_deploy_*.yaml