数据工程 Skill技能列表

ClickHouse高性能分析模式与优化Skill clickhouse-io

4.5

本技能专注于 ClickHouse 数据库的高性能分析模式、查询优化和数据工程最佳实践,适用于大规模数据分析工作负载。关键词包括 ClickHouse、数据分析、查询优化、数据仓库、ETL、物化视图、性能监控、OLAP、列式存储。

数据公共客户端Skill datacommons-client

4.5

这个技能提供对Data Commons平台的程序化访问,用于查询和探索公共统计数据、知识图谱和实体标识符。适用于数据科学家、分析师和开发者获取人口统计、经济指标、健康数据、环境统计等全球权威数据,进行数据分析、建模和决策支持。关键词:Data Commons、API、统计数据、知识图谱、Python、数据工程、经济指标、人口统计、健康数据。

PostgreSQL模式Skill postgres-patterns

4.5

这项技能涵盖审查PostgreSQL特定问题的迁移和编写高效查询,包括索引审查、部分索引、JSONB索引、并发索引创建、查询性能分析、UUID性能、约束审查、批量操作、表锁定意识、连接管理、数据类型选择等。

DatabaseBackup&RestoreSkill database-backup-restore

4.5

数据库备份与恢复策略实施指南,包括备份类型、保留策略、恢复测试和RTO/RPO规划。

数据分析工程Skill data-analytics-engineering

4.5

数据分析工程是一种技能,专注于构建可靠的数据指标和准备商业智能(BI)系统。它涉及定义指标和维度模型、构建数据转换层、实施数据质量测试、以及文档化数据集和数据血统。适用于需要数据建模、指标定义或分析数据处理的场景。关键词:数据分析工程、数据建模、指标定义、数据质量、BI准备、dbt、SQL转换。

PDF处理Skill pdf

4.5

PDF处理技能涉及使用Python库(如pypdf、pdfplumber、reportlab)和命令行工具(如pdftotext、qpdf)来处理PDF文档。包括提取文本和表格、创建新PDF、合并和拆分文档、处理表单、添加水印、密码保护等操作。适用于数据提取、文档自动化、报告生成等场景。关键词:PDF处理,文本提取,表格提取,Python,自动化,文档管理,SEO。

提取BigQuery架构Skill extract-bq-schema

4.5

此技能用于直接从Google BigQuery数据集中提取表架构,并将其转换为Starlake YAML配置文件。适用于数据工程、ETL开发和数据仓库构建,提升元数据管理效率。关键词:BigQuery、架构提取、Starlake、YAML、数据工程、ETL、数据仓库、元数据。

SQL查询优化编写Skill data-write-query

4.5

这个技能用于根据自然语言描述,编写针对特定SQL方言优化的查询,遵循最佳实践。它帮助用户高效进行数据提取和分析,提升数据库查询性能。关键词:SQL查询,数据编写,优化,数据分析,数据库,数据工程,ETL开发。

CDC模式实施器Skill CDCPatternImplementer

4.5

CDC 模式实施器是一个专注于变更数据捕获(CDC)的专业技能,用于实现实时数据集成。它提供在多种数据库和流式平台(如PostgreSQL、MySQL、Kafka)上配置和实施CDC解决方案的专家能力,包括连接器配置、模式选择、快照策略、模式变更处理和监控设置。关键词:变更数据捕获,CDC,实时数据集成,Debezium,Kafka,数据同步,ETL,流式处理,数据管道。

PostgreSQL性能工程Skill postgres-performance

4.5

本技能涵盖了从一开始就构建高性能数据库交互的模式,以及修复性能问题,包括查询优化、索引策略、分页、批量处理、聚合优化、连接池调整、读取副本、非规范化、表分区和缓存策略等。

AlembicMigrationPatternsSkill py-alembic-patterns

4.5

这是一个关于如何安全地使用Alembic进行PostgreSQL数据库迁移的指南,包括自动生成迁移的审查、安全迁移结构、非空列添加、数据迁移、大型表迁移、枚举变更处理、多开发者分支合并以及迁移测试等关键实践。

数据库设计专家Skill database-designer

4.5

数据库设计专家技能是一套综合工具和知识体系,用于构建和优化现代数据库系统。关键词包括数据库架构、性能优化、数据迁移、索引策略、规范化设计。