数据工程 Skill技能列表

PDF处理技能Skill pdf

4.5

PDF处理技能用于编程方式处理PDF文档,包括文本和表格提取、PDF创建、合并分割、表单处理以及自动化操作。关键词包括:PDF处理、文本提取、表格提取、Python库、自动化、数据提取、文档管理。

数据库优化技术Skill DatabaseOptimizationTechniques

4.5

数据库优化技术是一系列用于提升数据库查询性能、降低资源消耗、确保数据高效访问的方法和策略。关键词包括查询优化、索引策略、连接池、缓存策略、数据库维护等。

日志解析与导入SOPSkill "self/import/file_path"

4.5

此技能是定义和执行日志解析的标准操作程序(SOP),用于处理Apache、Nginx、Syslog、JSON和自定义等多种日志格式,通过数据类和LogEntry类表示解析后的日志条目。它帮助用户标准化日志处理流程,提高数据解析效率,便于数据收集和分析。关键词:日志解析、SOP、文件导入、Apache日志、Nginx日志、Syslog、JSON日志、自定义日志、数据工程、数据类、LogEntry。

数据公共客户端Skill datacommons-client

4.5

这个技能提供对Data Commons平台的程序化访问,用于查询和探索公共统计数据、知识图谱和实体标识符。适用于数据科学家、分析师和开发者获取人口统计、经济指标、健康数据、环境统计等全球权威数据,进行数据分析、建模和决策支持。关键词:Data Commons、API、统计数据、知识图谱、Python、数据工程、经济指标、人口统计、健康数据。

阶段技能Skill stage

4.5

阶段技能用于将数据文件从登陆区移动到待处理区,执行解压缩和确认文件处理,是数据摄取管道的第一步,确保数据准备就绪供后续加载。关键词:数据阶段化、ETL、数据工程、ACK文件处理、数据管道、数据摄取、文件管理。

预加载技能Skill preload

4.5

该技能用于在数据加载流程中检查landing或pending区域的文件可用性,确保文件就绪后触发加载,适用于数据工程、ETL开发和自动化编排,关键词:文件检查、数据加载、编排、ETL、数据仓库、预加载。

引导技能Skill bootstrap

4.5

引导技能是Starlake数据工程工具的核心功能,用于快速创建新的项目结构和配置文件。它支持使用模板进行项目搭建,包含标准目录、配置示例和数据,适用于数据工程师进行ETL开发、数据加载和转换。关键词:Starlake、项目引导、模板、配置、数据工程、ETL开发。

查询专家Skill query-expert

4.5

查询专家技能用于掌握和优化SQL及NoSQL数据库查询,生成高效查询、分析性能、设计索引并解决慢查询问题。关键词:数据库查询、SQL优化、性能分析、索引设计、查询调试、NoSQL、EXPLAIN计划、聚合管道、GraphQL、ETL开发。

增量模型策略选择器Skill IncrementalModelStrategySelector

4.5

增量模型策略选择器是一款用于数据工程和ETL开发的专业工具。它能够根据数据源特征(如更新模式、数据量、频率)和平台环境,智能选择和配置最优的增量数据处理策略(如追加、合并、删除后插入)。该工具专注于提升数据转换管道的效率和性能,通过优化分区裁剪、唯一键配置、回看窗口和迟到数据处理等关键参数,确保数据仓库和BI报表的数据新鲜度与准确性。关键词:增量模型,数据工程,ETL开发,dbt配置,数据转换,分区优化,数据仓库,策略选择。

渐变维度实现生成器Skill SCDImplementationGenerator

4.5

渐变维度实现生成器是一款自动化数据建模工具,专门用于跨平台生成渐变维度(SCD)实现方案。该工具支持SCD类型1/2/3/4/6,可自动生成MERGE语句、dbt快照配置、代理键管理和历史跟踪优化代码。适用于数据仓库、ETL开发、维度建模和商业智能场景,帮助数据工程师高效实现数据历史版本管理和变更跟踪。关键词:渐变维度,SCD,数据建模,数据仓库,ETL开发,历史跟踪,维度建模,代理键,dbt,数据工程

SQL查询优化Skill sql-query-optimization

4.5

SQL查询优化是一项技术,用于分析和优化数据库查询,提高查询性能,减少执行时间。关键词包括:性能瓶颈、索引策略、查询重写、EXPLAIN分析、批量操作。

NeMoCurator-GPU加速数据整理工具Skill nemo-curator

4.5

NeMo Curator 是 NVIDIA 推出的 GPU 加速数据整理工具,专为大规模语言模型(LLM)训练数据准备而设计。它支持文本、图像、视频、音频等多模态数据,提供模糊去重(比 CPU 快 16 倍)、质量过滤(30+ 启发式)、语义去重、PII 脱敏、NSFW 检测等功能,显著提升数据处理效率并降低成本。适用于 AI 研究人员、数据工程师和开发者,用于高效清理和优化训练数据集,关键词包括 GPU 加速、数据整理、LLM 训练、去重、过滤、多模态、RAPIDS、NVIDIA。