计算机视觉 Skill技能列表
AI视觉准确性检查Skill ai-visual-accuracy-check
AI视觉准确性检查是一种基于人工智能的质量保证技能,用于验证HTML页面渲染与原始PDF文档的视觉一致性。该技能通过多模态AI模型(如Claude)对PDF截图和HTML渲染截图进行智能对比分析,评估布局匹配、视觉层次、内容定位和排版样式四个维度,提供0-100的客观评分和详细差异报告。作为流水线中的阻塞性质量门控,当评分低于85%时会自动停止部署流程,确保数字出版物的视觉保真度和用户体验。关键词:AI视觉验证、PDF转HTML质量检查、多模态AI比较、自动化质量门控、视觉一致性评估、Claude API集成、网页渲染准确性、文档数字化质量控制。
Gemini视觉API技能Skill gemini-vision
此技能基于Google的Gemini API,实现图像理解和分析功能,支持图像描述、分类、视觉问答、对象检测、分割和多图像比较,适用于AI应用和计算机视觉任务,关键词:图像理解、Gemini API、人工智能、计算机视觉、图像分析、AI模型。
PDF分析器Skill pdf-analyzer
PDF 分析器是一个使用视觉模型分析 PDF、DOCX 和电子表格文档的技能,通过将文档渲染为图像以保留布局和格式,并提取关键见解。适用于文档自动化处理、数据提取和内容分析,关键词包括:文档分析、视觉模型、布局保留、PDF 处理、数据提取、自动化分析。
BLIP-2视觉语言预训练框架Skill blip-2-vision-language
BLIP-2是一个先进的视觉语言预训练框架,用于实现图像字幕生成、视觉问答(VQA)、图像文本检索和多模态聊天等功能。它采用Q-Former架构,桥接冻结的图像编码器和大型语言模型,提供零样本性能,无需任务特定训练。适用于计算机视觉和自然语言处理的多模态AI应用。关键词:BLIP-2、视觉语言预训练、图像字幕、视觉问答、VQA、多模态AI、计算机视觉、自然语言处理、零样本学习、Q-Former。
校准工具技能Skill CalibrationToolsSkill
校准工具技能是用于机器人及传感器系统精确校准的专业技能,涵盖相机、IMU、LiDAR、手眼、运动学及多传感器校准。关键词包括:机器人校准、传感器校准、Kalibr、手眼校准、相机标定、IMU校准、LiDAR校准、运动学校准、多传感器融合、校准验证。
CLIP模型Skill clip
CLIP(对比语言-图像预训练模型)是OpenAI开发的一个多模态人工智能模型,专门用于连接视觉和语言信息。它能够执行零样本图像分类、图像-文本相似度计算、跨模态检索等任务,广泛应用于图像搜索、内容审核、视觉-语言任务等领域,无需额外训练。关键词:零样本图像分类、图像-文本匹配、内容审核、多模态AI、视觉语言模型。
FiftyOne代码风格指南Skill fiftyone-code-style
FiftyOne代码风格指南是一套完整的Python编码规范,专门为FiftyOne计算机视觉数据集管理框架设计。该指南详细规定了模块结构、导入组织、文档字符串格式、私有函数命名、延迟导入策略、错误处理模式和代码质量检查清单。适用于开发者为FiftyOne贡献代码、开发插件或编写与FiftyOne代码库集成的Python程序时遵循,确保代码风格统一、可维护性强。关键词:FiftyOne, Python代码规范, 计算机视觉, 数据集管理, 代码风格, 开发指南, 开源贡献
图像增强器Skill image-enhancer
图像增强器是一个基于AI的技能,用于自动提升图像质量,包括智能放大分辨率、锐化细节、减少压缩伪影,优化图像以适用于博客、文档、社交媒体和演示等场景,提升视觉表现。
FiftyOne数据集推理工具Skill fiftyone-dataset-inference
FiftyOne数据集推理工具是一个用于计算机视觉任务的端到端解决方案,支持从本地目录创建数据集、导入COCO/YOLO/VOC等标准格式标签、运行深度学习模型推理并存储预测结果。该工具提供完整的ML管道,适用于目标检测、图像分类、语义分割等计算机视觉应用,帮助用户高效管理视觉数据集和模型评估。
数字病理学全幻灯片图像处理技能Skill histolab
Histolab是一个用于数字病理学的Python库,专为全幻灯片图像(WSI)的组织检测、瓦片提取和预处理设计,支持自动化组织分割、多种瓦片提取策略(随机、网格、评分)和图像过滤,适用于深度学习管道、数据集准备和医学图像分析。关键词:数字病理学、WSI、组织检测、瓦片提取、预处理、Python库、深度学习、医学图像、计算机视觉、H&E染色。
计算机视觉Skill ComputerVision
利用PyTorch和TensorFlow实现图像分类、目标检测、语义分割等计算机视觉任务
NVIDIAIsaacSim逼真模拟与合成数据生成技能Skill NVIDIAIsaacSimSkill
NVIDIA Isaac Sim 技能是一个专注于利用NVIDIA Isaac Sim平台进行高保真、照片级逼真模拟和合成数据生成的专家级工具。它集成了Omniverse和Replicator,能够高效创建虚拟环境、配置物理引擎、实现领域随机化,并生成带标注的训练数据,广泛应用于机器人仿真、自动驾驶、数字孪生和强化学习等领域。 关键词:NVIDIA Isaac Sim,逼真模拟,合成数据生成,Omniverse,Replicator,物理模拟,领域随机化,机器人仿真,自动驾驶,数字孪生,USD格式,ROS桥接,RTX光线追踪。