TAO单步训练Skill tao-train-single-step

此技能实现NVIDIA TAO模型的标准单步训练/评估/导出工作流,适用于无需AutoML或DEFT循环的简单训练任务。它指导用户完成平台选择、数据集解析、容器镜像确认和训练监控设置,并按需触发评估与导出。关键词:TAO训练、单步训练、模型微调、模型评估、模型导出、AutoML、NVIDIA TAO、视觉模型训练、训练工作流。

视觉模型训练 0 次安装 3 次浏览 更新于 9/6/2026
名称 tao-train-single-step
描述 适用于任何TAO模型的标准单步训练/评估/导出工作流。当在没有迭代数据增强、AutoML或DEFT循环的情况下对数据集训练TAO模型时使用。 触发短语包括“单次训练运行”、“训练然后评估然后导出”、“普通TAO训练”、“正常训练”、“无AutoML”、“跳过循环”。通过每个模型的SKILL.md获取操作细节,并通过tao-launch-workflow获取平台/凭据/数据集输入。
开源协议 Apache-2.0 compatibility: 需要docker + nvidia-container-toolkit。工作流声明额外要求。 metadata:
作者 NVIDIA Corporation
版本 “0.1.0” allowed-tools: Read Bash Write tags: - training - single-step - generic

独立安装? 如果此会话未由TAO技能库插件初始化,请先运行tao-setup技能(主机预检、凭据、跨技能发现)。

正常训练

标准监督微调:在标记数据集上训练模型,可选择评估,然后可选择导出。这是将预训练模型适应新数据集时最常用的TAO工作流。

步骤

  1. 训练 — 当所选模型具有automl_enabled: trueautoml_policyon时,通过AutoML执行;设置automl_policy=off以进行普通的单次训练运行
  2. 评估 — 如果解析了eval_dataset_uri则执行
  3. 导出 — 可选,在训练后根据用户请求执行

先决条件

所选模型技能解析出的container_image是默认训练运行时。除非用户明确要求该执行模式,否则不要用主机venv、uv环境、通用训练镜像或手写训练器替换它。SDK/控制器Python环境仅用于控制平面;模型操作仍由容器支持。

必需项

  • 模型:兼容的TAO模型(例如clip、nvdinov2、grounding_dino)
  • 训练数据集URI:训练数据集的URI(例如s3://bucket/train/
  • 平台:从生成的支持平台列表中询问: ${TAO_SKILL_BANK_PATH:-~/tao-skills-external}/scripts/list_tao_platforms.py --format text
  • 容器镜像确认:从所选模型/操作配置中解析默认镜像,向用户展示,并要求确认或image=<override>,然后再创建运行器文件或提交训练。

可选

  • 评估数据集URI:某些模型技能将其标记为必需——在将其视为可选之前,请检查解析后的模型技能。
  • 基础检查点:如果未提供,则默认为模型技能中列出的NGC预训练检查点;如果不存在NGC检查点,则从头训练。
  • automl_policy:默认为on;设置为off可在此次运行中绕过模型级AutoML,同时保持模型元数据不变。在新的启动设置中仅使用“on”/“off”。
  • 镜像覆盖:在查看解析后的默认镜像后,使用image=<override>固定特定的TAO工具包构建。

启动输入

在用户确认他们希望采用此标准训练/评估/导出工作流后,询问他们打算在哪个受支持的平台上运行。使用scripts/list_tao_platforms.py --format text生成选项;不要扫描平台文档或文件夹。

在创建普通训练运行器之前,使用scripts/list_tao_models.py --scope automl --format json检查所选模型的元数据,或读取skills/models/<network>/references/skill_info.yaml。如果automl_enabled为true且帮助器报告该模型存在有效的训练模式,则默认通过skills/applications/tao-run-automl路由训练阶段。仅在以下情况下保持普通训练路径:automl_policy=off、用户明确要求不进行HPO/AutoML,或AutoML已启用但因模型的训练模式尚未打包而无法运行。

还要询问是否使长时间运行的监控保持启用,以及状态更新之间的时间间隔(分钟)。默认值:启用,5分钟。

在模型/操作确定后,运行scripts/resolve_tao_image.py --model <network> --action train --format text并询问是使用解析出的镜像还是image=<override>。在镜像确认之前,不要创建tao-train-single-step运行器。

在平台选择后,运行scripts/list_tao_platforms.py --platform <platform> --format text,并且仅询问与该平台相关的凭据,以及任何选定模型的凭据。不要询问无关的平台凭据。