CLIP(对比语言-图像预训练)视觉-语言模型技能,用于零样本/微调图像分类、图像文本检索和嵌入提取。支持的操作:train、evaluate、inference、export、gen_trt_engine。
训练:模型层启用AutoML,支持自定义图像-标题数据集或WebDataset,监控指标为val/t2i_mAP。支持多种模型(OpenCLIP/NV-CLIP、Radio-CLIP、SigLIP2)。训练/评估/推理等操作需根据规范设置数据集路径。
推理:生成image_embeddings.h5和/或text_embeddings.h5,嵌入经L2归一化。导出支持combined或separate的视觉/文本ONNX。gen_trt_engine用于TensorRT引擎生成,相关TensorRT操作需在TAO Deploy镜像中运行。
重要参数:model.type、model.adaptor_name、model.image_size、train.num_epochs、train.optim.vision_lr/text_lr、freeze_vision_encoder/freeze_text_encoder、train.loss_type、export.encoder_type等。
更多错误模式、参数推断和部署参考见references目录。