| 名称 | tao-mine-aoi-images |
| 描述 | 运行DEFT嵌入-然后-挖掘工作流,用于VCN AOI迭代——嵌入差距分析目标parquet、嵌入源池、挖掘最近邻源图像以进行下游增强。在tao-route-visual-changenet-samples之后作为立即下一步使用,用于从挖掘子集扩展真实图像增强队列。 |
| 开源协议 | Apache-2.0 compatibility: 需要docker + nvidia-container-toolkit和CUDA GPU。拉取本技能库根目录中此skill.yaml固定的TAO data-services容器。 metadata: |
| 作者 | NVIDIA Corporation |
| 版本 | “0.1.0” allowed-tools: Read Bash tags: - data - mining - embedding - vcn - aoi - sda |
DEFT挖掘和嵌入技能
独立安装? 如果此会话未由TAO技能库插件初始化,请先运行
tao-setup技能。
您是VCN AOI的DEFT嵌入-然后-挖掘工作流的操作员。工作流固定且确定性:嵌入目标,嵌入源池,然后挖掘最近邻。每一步的输出parquet是下一步的输入。
该技能是对固定TAO data-services镜像的三次直接docker run调用的薄包装。容器入口点接受<category> <action> -e <spec.yaml> [hydra overrides...]。
输入
- 目标parquet(含filepath列)
- 源池parquet(含filepath列)
- 嵌入规范YAML(model/model_path/batch_size)
- 挖掘规范YAML(topn/knn_metric/filter_by_label)
设置
使用固定的数据服务镜像DS_IMAGE。确认Docker、NVIDIA容器工具包和GPU。工作区根目录以相同路径绑定挂载,使用$DOCKER别名。不要传--user。
方法
步骤1 — 嵌入目标图像
$DOCKER embedding image_embeddings -e <embedding_spec.yaml> input_parquet=<target_parquet> output_parquet=<target_embeddings_parquet>
步骤2 — 嵌入源池
(相同命令,使用相同embedding spec)
步骤3 — 挖掘最近邻
$DOCKER tmm nearest_neighbors -e <mining_spec.yaml> source_parquet=<source_embeddings_parquet> target_parquet=<target_embeddings_parquet> output_parquet=<mined_parquet>
输出和报告
将内容写入时间戳目录。挖掘出的parquet是产物。最后编写Mining_Report.md。
常见陷阱
编码器不匹配、使用–user、跳过嵌入步骤、缺label列、未解析???、无model_config_path、直接输入CSV、路径不匹配、无GPU等。
执行顺序
- 设置DS_IMAGE并检查环境
- 获取时间戳并创建目录
- 编写规范文件
- 转换CSV
- 运行步骤1
- 运行步骤2
- 运行步骤3
- 计算按标签细分
- 编写报告