TAO-HF 集成技能
本技能用于将一个 HuggingFace 计算机视觉模型集成到 NVIDIA TAO Toolkit 生态系统中(包括 tao-core 配置、tao-pytorch 训练器、tao-deploy TensorRT 流水线)。它适用于将 ViT、DETR、SegFormer、Mask2Former、OneFormer、Grounding DINO、单目深度等常见 CV 模型接入 TAO。涵盖完整的 7 阶段流程:先决条件检查、HF 检查与验证、代码库探索、tao-core 配置与原生训练器实现、ONNX 导出与 TensorRT 部署集成、打包与 L0 测试、基于容器的端到端验证,以及可选的精度/延迟调优。支持分类、目标检测、语义/实例/全景分割、零样本检测和深度估计。
本地限制
所有工作仅限本地执行;不得向远程推送或发布 Docker 镜像。
子模块覆盖策略
只能安装顶层 tao-core;应使用本地挂载和 PYTHONPATH 确保修改生效。
Phase 0 - 先决条件检查
验证 Python、git,由 tao-setup-nvidia-gpu-host 检查主机;确认 NGC 登录并让用户提供 TAO Toolkit 镜像引用,拉取并标记为 tao-pytorch-base、tao-deploy-base 等。
Phase 1 - 信息收集与验证
在 HF inspection 容器中验证 pipeline_tag 是否为 CV;记录配置和状态字典;执行 ONNX 健全性检查;非 CV 任务拒绝。
Phase 2 - 代码库探索
在 TAO 仓库中定位最接近的参考模型(例如分类 classification_pyt、检测 dino/rtdetr、分割 segformer 等),决定主干是复用还是新增。
Phase 3 - TAO Core 配置与原生实现
编写 ExperimentConfig,实现 tao-pytorch 训练器/推理/评估,并逐步骤冒烟测试。
Phase 4 - 导出、部署与 TensorRT 集成
从 pytorch 导出的 ONNX,用 tao-deploy 构建 TensorRT 引擎并执行推理/评估。
Phase 5 - 打包与 L0 测试
注册 console_scripts,添加并运行 L0 测试。
Phase 6 - 容器测试与端到端验证
在容器内直接运行单元/静态测试,执行 train→export→gen_trt_engine→inference/evaluate 的完整流程。
Phase 7 - 优化与调优(条件)
如满足条件,可通过超参调优、INT8 量化、剪枝、蒸馏、分辨率调整来改善精度/延迟/体积。
参数
$ARGUMENTS:如果提供,将其作为 HuggingFace 模型 ID/URL 启动 Phase 1。