| 名称 | tao-train-oneformer |
| 描述 | OneFormer 用于通用图像分割。使用任务条件查询,在单一架构中统一全景分割、实例分割和语义分割。适用于对 TAO OneFormer 模型进行训练、评估、导出、量化或推理。触发短语包括“train OneFormer”、“universal segmentation”、“task-conditioned segmentation”、“panoptic / instance / semantic in one model”。 |
| 开源协议 | Apache-2.0 compatibility: 需要 docker + nvidia-container-toolkit。 metadata: |
| 版本 | ‘0.1.0’ |
| 作者 | NVIDIA 公司 allowed-tools: Read Bash tags: - 分割 |
OneFormer
OneFormer 是一种用于通用图像分割的模型,将全景分割、实例分割和语义分割统一到一个架构中,通过任务条件查询(task-conditioned queries)实现。该技能覆盖 TAO OneFormer 模型的训练、评估、推理、导出、量化以及 TensorRT 部署等操作,并支持 AutoML 自动调优。
主要能力
- 训练:支持 COCO/COCO Panoptic 数据集,监控指标 mIoU,默认训练 50 轮,支持多 GPU 分布式训练。
- 评估:语义、实例、全景三种模式均可评估。
- 推理:可通过 checkpoint 或 TensorRT engine 运行语义/实例/全景分割。
- 导出:支持导出 ONNX,并生成 TensorRT 引擎。
- 量化:支持 PTQ 量化。
- AutoML:模型层启用 AutoML,可自动搜索超参。
模型结构
- 骨干网络:默认 Swin Transformer(D2SwinTransformer),embed_dim=192,depths=[2,2,18,2]。
- 关键参数:model.sem_seg_head.num_classes 默认 133;hidden_dim 默认 256;学习率默认 1e-5。
数据集要求
- 类型:分割
- 格式:coco_panoptic、coco
- 文件:images.tar.gz、annotations.json、label_map.json、images_panoptic.tar.gz(取决于操作)
训练注意事项
- batch_size 默认 1,显存要求高,建议至少 2 张 24GB+ GPU(A100)。
- 默认轮数 50,需要较长时间收敛,建议多卡训练。
- 需将 precision 设为 ‘32’,不兼容 fp32 写法。
- 导出 ONNX 路径不可预先创建目录。
- 推理数据源要配置 inference.images_dir。
部署
TensorRT 部署相关操作需参考 references/tao-deploy-oneformer.md,spec 模板位于 references/spec_template_deploy_*.yaml。