数据工程 Skill技能列表
高级数据工程师Skill senior-data-engineer
高级数据工程师技能专注于构建和管理可扩展的数据基础设施、ETL/ELT系统、数据管道和数据质量,支持生产级AI/ML和数据系统。关键技术包括Python、SQL、Spark、Airflow、dbt、Kafka等,适用于数据架构设计、数据工作流优化、数据治理等场景,助力企业实现数据驱动的决策和创新。关键词:数据工程、ETL、数据管道、数据基础设施、Spark、Airflow、Python、SQL、DataOps。
YAML转Excel转换器Skill yml2xls
该技能用于将 Starlake YAML 数据定义转换为 Excel 电子表格,便于与非技术用户共享数据模型,支持 YAML 和 Excel 之间的双向转换,适用于数据工程、数据治理和数据处理工作流。关键词:YAML 转 Excel, Starlake 数据转换, 数据模型共享, 数据工程工具, ETL 开发, 数据可视化。
Snakemake工作流管理器Skill snakemake-workflow-manager
Snakemake工作流管理器是一个用于生物信息学和数据分析领域的自动化流程管理工具。该技能支持基于规则的管道执行、DAG工作流调度、集群计算资源管理、Conda环境隔离、检查点恢复机制和性能基准收集。适用于构建可重复、可扩展的科研分析流程,特别适合高通量测序数据处理、批量数据分析和自动化报告生成等场景。 关键词:Snakemake工作流管理, 生物信息学流程自动化, 可重复研究, DAG任务调度, Conda环境管理, 集群计算, 数据分析管道, 工作流检查点, 基准测试, 报告生成
Firecrawl抓取技能Skill firecrawl-scrape
Firecrawl抓取技能是一个通过Firecrawl MCP工具抓取网页并提取内容的技能,支持从URL或搜索查询获取结构化数据,适用于数据采集和网络内容分析,关键词包括:网页抓取、数据提取、Firecrawl、MCP、爬虫、内容抓取、SEO搜索。
电子书文本提取器Skill ebook-extractor
电子书文本提取器是一个用于从EPUB、MOBI、PDF格式电子书中提取纯文本的工具。它支持常见电子书格式,使用Python脚本实现,无需大型语言模型调用,纯文本提取。适用于数据分析、文本处理、阅读转换等场景。关键词:电子书提取、文本转换、Python工具、EPUB、MOBI、PDF、数据提取。
生物信息学分析师Skill bio-informatics-analyst
该技能用于协调和管理生物信息学数据处理流程,包括数据转换、分析管道设置、质量控制以及报告生成,确保工作流程的可重复性和高效性,特别适用于单细胞分析等生物医学研究领域。关键词:生物信息学、数据分析、数据处理、工作流程自动化、可重复性、Nextflow、Python、单细胞分析、质量控制、生物医药。
dbt项目分析器Skill dbt-project-analyzer
dbt项目分析器是一款用于评估和优化dbt(data build tool)数据转换项目的专业工具。它能自动分析项目结构、模型依赖、测试覆盖率、文档完整性和命名规范,检测性能瓶颈与循环依赖,并提供基于最佳实践的具体改进建议。适用于数据工程师、数据分析师和DevOps团队,帮助提升数据仓库项目的质量、可维护性和运行效率。关键词:dbt分析,数据工程,数据仓库优化,测试覆盖率,模型依赖分析,性能调优,CI/CD集成,数据治理。
数据库模式可视化工具Skill schema-visualizer
该技能用于从数据库模式生成可视化图表、实体关系图(ERD)和文档,支持多种格式如Mermaid、PlantUML和来源如SQL、ORM模型,帮助数据库设计、分析和优化,关键词包括数据库、模式、可视化、ERD、文档、SQL、ORM。
分布式NoSQL数据库专家Skill nosql-expert
本技能提供分布式NoSQL数据库(如Cassandra和DynamoDB)的专业设计模式和指导,包括思维模型、查询优先建模、单表设计、避免热分区等,适用于大规模系统开发、数据工程和云计算场景。关键词:分布式NoSQL数据库、Cassandra、DynamoDB、查询优先建模、热分区、数据工程。
ApacheSpark优化器Skill ApacheSparkOptimizer
Apache Spark 优化器是一款专注于提升大数据处理效率的专业技能。它通过深度分析 Spark 作业的执行计划、数据分区和资源配置,提供针对性的代码优化、参数调优和策略建议,旨在显著降低作业运行时间、减少计算资源消耗并节约成本。核心功能包括数据倾斜治理、Shuffle 优化、缓存策略推荐和集群配置调优,适用于 ETL、流处理和数据迁移等多种大数据场景。关键词:Spark优化,大数据性能调优,分布式计算,ETL加速,成本节约,数据倾斜处理,执行计划分析。
流处理Skill stream-processing
流处理技能专注于实时数据处理技术,用于构建事件驱动系统和流分析应用。它涉及使用框架如Apache Kafka、Apache Flink等处理无界数据流,支持低延迟响应、窗口操作、状态管理和精确一次交付。关键词:流处理、实时数据、事件流、Kafka、Flink、流分析、数据管道、事件驱动架构。
数据流设计Skill data-flow
数据流设计技能用于根据需求描述设计和实施数据管道架构,包括数据源集成、转换处理、目标系统部署,支持批处理、流处理、Lambda、Kappa等多种模式,适用于数据仓库、数据湖、机器学习、商业智能等应用场景。关键词:数据管道、ETL、流处理、数据架构、数据工程、Spark、Flink、Kafka、数据湖仓。