| 名称 | tao-train-mask2former |
| 描述 | Mask2Former用于通用图像分割(全景、实例和语义)。基于Transformer和掩码注意力机制。 |
| 开源协议 | Apache-2.0 compatibility: 需要docker + nvidia-container-toolkit。 metadata: |
| 版本 | 0.1.0 |
| 作者 | NVIDIA Corporation allowed-tools: Read Bash tags: - 分割 |
Mask2Former
独立安装? 如果当前会话不是由TAO技能库插件初始化的,请先运行
tao-setup技能。
Mask2Former用于通用图像分割(全景、实例和语义)。可为Swin骨干设置预训练权重。需阅读相关deploy文档。
数据类模式
TAO Core模式打包在schemas目录中,每个操作生成配置模板。AutoML启用状态在skill_info.yaml中声明。
训练操作策略
模型在模型层启用AutoML。默认automl_policy为on。仅在自动化关闭时直接训练。
训练要求
- 数据集类型:分割;格式:coco_panoptic、coco;监控指标:mIoU。
- 训练/评估/推理/量化等均需从S3提供图像和标注文件,包括images.tar.gz、annotations.json、annotations_panoptic.json、images_panoptic.tar.gz、label_map_panoptic.json等。
典型规范覆盖
必须为每个操作配置数据源路径,指定num_gpus、num_epochs、num_classes、contiguous_id等,具体配置见原始文档。
评估数据集
可选,验证数据源可与训练数据一同配置。
重要参数
- model.sem_seg_head.num_classes:类别数,默认200。
- model.backbone.swin.type:Swin变体,默认tiny。
- model.mode:分割模式,默认panoptic。
- train.optim.lr:学习率,默认2e-4。
- dataset.train.batch_size:每GPU批大小,默认1。
- dataset.contiguous_id:控制类别ID连续性。
多GPU/多节点
Lightning管理。支持num_gpus、gpu_ids、num_nodes、distributed_strategy。多节点环境变量由编排器设置。
导出/TRT默认
TRT支持FP32/FP16,不支持INT8。导出使用960x544默认尺寸可成功构建TensorRT引擎。
硬件
推荐至少1个GPU,推荐4个A100 24GB以上显存。
错误模式
包括CUDA内存不足、Panoptic和实例格式不匹配、部署配置dataset.type错误、极小分辨率导出断言失败、量化检查点加载错误等。
规范参数/父模型推理
各操作通过SDK将父作业结果推断为checkpoint、engine、onnx等路径。不要手工猜测检查点路径。
部署
参考references/tao-deploy-mask2former.md。