| 名称 | paidf-auto-labeling |
| 描述 | >- 当用户需要开始使用PAIDF自动标注,规划场景,运行或调试随附的cookbook,编写提示词或cookbook,迁移流水线,或配置阶段时使用。确认关键输入(数据路径、输出路径、端点),如有缺失则询问。这是一个路由器:阅读匹配的参考文档,而不是自行编造工作流程。 |
| 开源协议 | Apache-2.0 owner: NVIDIA service: physical-ai-data-factory |
| 版本 | 1.1.0 reviewed: 2026-08-25 |
| 作者 | “NVIDIA opensource@nvidia.com” metadata: |
| 作者 | “NVIDIA opensource@nvidia.com” tags: [入门, 上手引导, 新领域, 快速开始, 新用例] |
PAIDF 自动标注
当用户想要在自有数据、领域或用例上启动PAIDF自动标注,或请求与随附的cookbook、阶段、编写或迁移任务匹配时,使用此技能。这是一个路由器:依次参考专门的参考文档,而不是重复其细节。
路由(先阅读)
| 请求类似 | 阅读 |
|---|---|
| 新用户,干净检出,首次验证运行,“我如何开始” | 本文件,然后阅读下方匹配的参考文档 |
| 为某个领域选择注释目标/阶段子集 | references/scenario-planning.md |
| 创建、审查或改编cookbook | references/cookbook-authoring.md |
| 编写或改编VLM/LLM提示词或问题库 | references/prompt-authoring.md |
| 将现有注释仓库迁移到此仓库 | references/pipeline-migration.md |
| 运行视频数据增强cookbook | references/video-data-augmentation.md |
| 运行或选择EPAS / PAS cookbook | references/event-and-person-attribute-search.md |
| 运行事件验证推理 | references/event-verification-reasoning.md |
| 调试已集成的流程 | references/workflow-runner-debugging.md |
| 实现或审查新阶段或Docker化服务 | references/workflow-stage-integration.md |
| 配置或调试某个生产阶段 | references/stages/ 下对应的文件 |
阶段参考:super-resolution、 detection-and-tracking、 captioning、 visual-qa、 reasoning、 person-attribute-search、 grounding-2d、 referring-expressions、 training-export。
说明
- 在采取任何其他操作之前,先与用户确认关键运行输入;当任何输入缺失或模糊时,提出一个简洁的问题——绝不猜测或默默发明默认值。至少确认:输入数据路径、输出路径、VLM/LLM端点URL和模型名称、模型缓存路径、GPU ID,以及(对于支持推理的模型)
max_tokens上限。在首次执行前将确认的值重述给用户。 - 验证环境:仓库已克隆,
make目标可用,模型缓存路径存在,VLM/LLM端点可达,并且GPU可用。将任何缺失的先决条件声明为阻塞,而不是假设它存在。 - 先运行随附示例以确认整个技术栈端到端工作,然后再进行自定义。选择最接近的算子流水线——视频数据增强、事件和人物属性搜索或事件验证推理——并运行其提交的cookbook。使用匹配的算子参考文档。
- 规划目标场景:定义模态、领域、预期消费者和所需标注,并获得最小的阶段子集。使用scenario-planning。
- 改编最接近的随附cookbook到新领域,而不是从头编写。使用cookbook-authoring。
- 编写领域提示词和问题库。使用prompt-authoring。
- 为领域配置每阶段设置(检测器类或SAM3提示词、端点、窗口化、
max_tokens)。使用相关的阶段参考文档,从detection-and-tracking开始。 - 试运行改编的cookbook,然后执行并验证输出。使用workflow-runner-debugging。
将现有的外部标注或数据集生成仓库采用到PAIDF,而不是从随附cookbook开始,属于迁移任务;对于该路径请使用pipeline-migration。
示例
新用户,新领域:“我已经克隆了仓库,并且有自己的仓库安全视频。如何为我的领域生成自动标签?”
引导路径:
- 确认环境(模型缓存、VLM/LLM端点、GPU),然后在自定义之前先在随附示例上证明技术栈有效:
make run SCRIPT=workflow-runner:main \
ARGS='--cookbook-file cookbooks/video_data_augmentation/configs/pipeline_video.yaml --container-dry-run'
- 规划领域(scenario-planning)-> 子集
detection_and_tracking -> captioning -> visual_qa -> reasoning -> training_export(如需句子到框可添加grounding_2d,如需框到短语可添加referring_expressions;使用grounding-2d / referring-expressions)。 - 将最接近的cookbook复制到
cookbooks/warehouse_safety/configs/pipeline.yaml并调整输入、检测器类/SAM3提示词、提示词和问题库。 - 试运行新cookbook,然后正式运行并验证输出:
make run SCRIPT=workflow-runner:main \
ARGS='--cookbook-file cookbooks/warehouse_safety/configs/pipeline.yaml --container-dry-run'
护栏
- 不要猜测或编造步骤1中列举的关键输入;如有缺失或模糊,请询问用户并在执行前确认。
- 在随附示例干净运行之前,不要自定义cookbook;基础损坏会使领域调试变得模糊。
- 保持第一个自定义流水线最小化——仅包含请求的标注所需的阶段——然后后续再扩展。
- 在承诺端到端运行之前,验证每个选定阶段的服务的软件包和镜像在当前分支中存在。
- 不要将机密、令牌或绝对主目录路径放入提交的cookbook中;使用诸如
<model-cache>之类的占位符和环境变量来存放端点密钥。 - 对于支持推理的模型(例如Gemini 3 Flash),在
visual_qa和reasoningLLM子阶段提高max_tokens,以避免思考令牌开销;对于非推理模型保持默认上限。 - 不要依赖非PAIDF的流水线、命令或文件位置。首次运行必须通过此仓库内的
workflow-runner:main可复现。