NVPanoptix3D全景3D场景重建Skill tao-train-nvpanoptix3d

NVPanoptix3D是NVIDIA TAO平台中的技能,用于全景3D场景重建。它从带位姿的RGB图像生成3D语义、实例和全景分割,并完成占用补全。该技能支持模型训练、评估、推理和导出,基于VGGT和Mask2Former架构,适用于Front3D、Matterport等数据集。关键词:NVPanoptix3D、3D全景分割、场景重建、VGGT、Mask2Former、占用补全、TAO、3D视觉。

视觉模型训练 0 次安装 0 次浏览 更新于 9/6/2026
名称 tao-train-nvpanoptix3d
描述 NVPanoptix3D用于从带位姿的RGB图像进行全景3D场景重建。生成具备占用补全的3D全景分割(语义、实例和全景掩码)。基于VGGT骨干、Mask2Former风格头部和3D视锥重建。用于训练、评估、导出或运行TAO NVPanoptix3D模型推理。
开源协议 Apache-2.0 compatibility: 需要docker + nvidia-container-toolkit。 metadata:
版本 0.1.0
作者 NVIDIA Corporation allowed-tools: Read Bash tags: - 全景 - 3D - 重建

NVPanoptix3D 中文技能描述

本文档是对英文原版 NVPanoptix3D 技能文档的中文精简翻译,保留主要结构和格式说明。

功能概述

NVPanoptix3D 用于从带位姿的RGB图像进行全景3D场景重建,生成语义、实例、全景分割掩码,并完成3D占用补全。该模型基于VGGT骨干网络、Mask2Former风格头部和3D视锥重建模块。

支持的操作

  • 训练(train)
  • 评估(evaluate)
  • 推理(inference)
  • 导出(export)

数据集要求

  • 数据集类型:nvpanoptix3d
  • 支持格式:front3d、matterport

关键参数

  • model.sem_seg_head.num_classes: 默认13
  • model.mode: panoptic/instance/semantic
  • dataset.name: front3d/matterport/synthetic等
  • train.precision: fp32

硬件建议

至少2块GPU,推荐4块A100(40GB以上)GPU。

错误处理

  • 使用 fp32 精度,fp16 会在训练时报错。
  • 确保提供 meta/frustum_mask.npz 文件。

更多技术细节和示例命令请参考英文原文档。