TAOAOI图像挖掘技能Skill tao-mine-aoi-images

本技能用于运行DEFT嵌入-然后-挖掘工作流,针对VCN AOI迭代。它嵌入差距分析目标parquet与源池,并挖掘最近邻源图像,为下游训练生成增强数据。同时提供了一系列确定性容器化命令、配置规范、报告模板和常见问题处理。关键词:TAO、DEFT、嵌入、挖掘、最近邻、VCN、AOI、数据增强、图像挖掘、parquet。

视觉数据生成标注 0 次安装 0 次浏览 更新于 9/6/2026
名称 tao-mine-aoi-images
描述 运行DEFT嵌入-然后-挖掘工作流,用于VCN AOI迭代——嵌入差距分析目标parquet、嵌入源池、挖掘最近邻源图像以进行下游增强。在tao-route-visual-changenet-samples之后作为立即下一步使用,用于从挖掘子集扩展真实图像增强队列。
开源协议 Apache-2.0 compatibility: 需要docker + nvidia-container-toolkit和CUDA GPU。拉取本技能库根目录中此skill.yaml固定的TAO data-services容器。 metadata:
作者 NVIDIA Corporation
版本 “0.1.0” allowed-tools: Read Bash tags: - data - mining - embedding - vcn - aoi - sda

DEFT挖掘和嵌入技能

独立安装? 如果此会话未由TAO技能库插件初始化,请先运行tao-setup技能。

您是VCN AOI的DEFT嵌入-然后-挖掘工作流的操作员。工作流固定且确定性:嵌入目标,嵌入源池,然后挖掘最近邻。每一步的输出parquet是下一步的输入。

该技能是对固定TAO data-services镜像的三次直接docker run调用的薄包装。容器入口点接受<category> <action> -e <spec.yaml> [hydra overrides...]

输入

  1. 目标parquet(含filepath列)
  2. 源池parquet(含filepath列)
  3. 嵌入规范YAML(model/model_path/batch_size)
  4. 挖掘规范YAML(topn/knn_metric/filter_by_label)

设置

使用固定的数据服务镜像DS_IMAGE。确认Docker、NVIDIA容器工具包和GPU。工作区根目录以相同路径绑定挂载,使用$DOCKER别名。不要传--user

方法

步骤1 — 嵌入目标图像

$DOCKER embedding image_embeddings -e <embedding_spec.yaml> input_parquet=<target_parquet> output_parquet=<target_embeddings_parquet>

步骤2 — 嵌入源池

(相同命令,使用相同embedding spec)

步骤3 — 挖掘最近邻

$DOCKER tmm nearest_neighbors -e <mining_spec.yaml> source_parquet=<source_embeddings_parquet> target_parquet=<target_embeddings_parquet> output_parquet=<mined_parquet>

输出和报告

将内容写入时间戳目录。挖掘出的parquet是产物。最后编写Mining_Report.md。

常见陷阱

编码器不匹配、使用–user、跳过嵌入步骤、缺label列、未解析???、无model_config_path、直接输入CSV、路径不匹配、无GPU等。

执行顺序

  1. 设置DS_IMAGE并检查环境
  2. 获取时间戳并创建目录
  3. 编写规范文件
  4. 转换CSV
  5. 运行步骤1
  6. 运行步骤2
  7. 运行步骤3
  8. 计算按标签细分
  9. 编写报告