Mask2Former通用图像分割技能Skill tao-train-mask2former

该技能用于训练、评估、导出、量化和部署Mask2Former模型,实现全景、实例和语义分割。通过TAO Core提供自动化训练和AutoML,支持TensorRT FP32/FP16引擎构建。关键词:Mask2Former、通用图像分割、全景分割、实例分割、语义分割、Transformer、掩码注意力、TAO、AutoML、TensorRT。

视觉模型训练 0 次安装 1 次浏览 更新于 9/6/2026
名称 tao-train-mask2former
描述 Mask2Former用于通用图像分割(全景、实例和语义)。基于Transformer和掩码注意力机制。
开源协议 Apache-2.0 compatibility: 需要docker + nvidia-container-toolkit。 metadata:
版本 0.1.0
作者 NVIDIA Corporation allowed-tools: Read Bash tags: - 分割

Mask2Former

独立安装? 如果当前会话不是由TAO技能库插件初始化的,请先运行tao-setup技能。

Mask2Former用于通用图像分割(全景、实例和语义)。可为Swin骨干设置预训练权重。需阅读相关deploy文档。

数据类模式

TAO Core模式打包在schemas目录中,每个操作生成配置模板。AutoML启用状态在skill_info.yaml中声明。

训练操作策略

模型在模型层启用AutoML。默认automl_policy为on。仅在自动化关闭时直接训练。

训练要求

  • 数据集类型:分割;格式:coco_panoptic、coco;监控指标:mIoU。
  • 训练/评估/推理/量化等均需从S3提供图像和标注文件,包括images.tar.gz、annotations.json、annotations_panoptic.json、images_panoptic.tar.gz、label_map_panoptic.json等。

典型规范覆盖

必须为每个操作配置数据源路径,指定num_gpus、num_epochs、num_classes、contiguous_id等,具体配置见原始文档。

评估数据集

可选,验证数据源可与训练数据一同配置。

重要参数

  • model.sem_seg_head.num_classes:类别数,默认200。
  • model.backbone.swin.type:Swin变体,默认tiny。
  • model.mode:分割模式,默认panoptic。
  • train.optim.lr:学习率,默认2e-4。
  • dataset.train.batch_size:每GPU批大小,默认1。
  • dataset.contiguous_id:控制类别ID连续性。

多GPU/多节点

Lightning管理。支持num_gpus、gpu_ids、num_nodes、distributed_strategy。多节点环境变量由编排器设置。

导出/TRT默认

TRT支持FP32/FP16,不支持INT8。导出使用960x544默认尺寸可成功构建TensorRT引擎。

硬件

推荐至少1个GPU,推荐4个A100 24GB以上显存。

错误模式

包括CUDA内存不足、Panoptic和实例格式不匹配、部署配置dataset.type错误、极小分辨率导出断言失败、量化检查点加载错误等。

规范参数/父模型推理

各操作通过SDK将父作业结果推断为checkpoint、engine、onnx等路径。不要手工猜测检查点路径。

部署

参考references/tao-deploy-mask2former.md。