数据科学 Skill技能列表

连接加载技能Skill cnxload

4.5

此技能用于将Parquet、CSV或JSON文件直接加载到JDBC数据库表,提供快速数据导入功能,支持多种数据库驱动和并行写入选项,适用于数据集成、ETL开发和数据仓库场景,关键词包括:数据加载、JDBC、Parquet、CSV、JSON、数据库连接、ETL、批量处理。

排队系统分析器Skill queuing-analyzer

4.5

排队系统分析器是一个基于排队论的AI分析工具,用于对各类等待线系统进行数学建模和性能评估。它支持M/M/1、M/M/c、M/G/1等多种经典排队模型,能够计算系统利用率、平均等待时间、队列长度等关键性能指标,并应用于呼叫中心人员配置、服务能力规划、系统优化等场景。关键词:排队论,系统分析,性能评估,数学模型,服务优化,呼叫中心,容量规划,仿真建模。

CSV数据可视化器Skill csv-data-visualizer

4.5

CSV数据可视化器是一款专业的数据分析工具,专门用于处理CSV文件格式的数据集。该工具提供三大核心功能:1) 使用Plotly库创建交互式数据可视化图表,包括直方图、散点图、箱线图、热力图等;2) 自动数据剖析与质量分析,生成详细的统计报告;3) 多图表仪表板生成,支持自定义配置和自动布局。适用于数据分析、商业智能、数据探索、统计报告等场景,帮助用户快速理解数据分布、发现数据规律、识别异常值,并生成演示就绪的可视化成果。

DatabaseSchemaDesignerSkill database-schema-designer

4.5

这项技能提供全面的指导,用于设计健壮、可扩展的数据库架构,适用于SQL和NoSQL数据库。无论是从头开始构建还是演进现有架构,此框架确保数据完整性、性能和可维护性。

数据复制设置Skill data-replication-setup

4.5

本文档提供了数据库复制的详细指南,包括主从复制、多主复制、复制监控和故障转移等,旨在帮助实现高可用性和灾难恢复。

数据管道架构师Skill data-pipeline-architect

4.5

数据管道架构师技能专注于设计和实现高效、可靠的数据管道,涵盖ETL/ELT流程、编排工具、错误处理和数据质量验证,确保数据从源到目标的顺畅流动。关键词:数据管道、ETL、ELT、数据工程、架构设计、数据质量、编排、数据仓库。

JSON转换器技能Skill json-transformer

4.5

JSON转换器技能是一个用于处理JSON数据的工具,支持解析、验证、转换、合并、提取等高级操作,广泛应用于数据工程、后端开发和数据分析领域,方便数据处理和API集成。关键词:JSON处理、数据转换、数据分析、数据清洗、编程工具、API数据、格式转换、数据提取。

提取模式技能Skill extract-schema

4.5

这个技能用于从JDBC数据库提取数据库表模式(如列名、类型、约束),并生成Starlake YAML配置文件,是数据工程中反向工程数据库到Starlake项目的关键第一步。关键词包括:数据库模式提取、Starlake配置、YAML文件生成、ETL开发、数据治理、反向工程。

PDF处理技能Skill pdf

4.5

PDF处理技能用于编程方式处理PDF文档,包括文本和表格提取、PDF创建、合并分割、表单处理以及自动化操作。关键词包括:PDF处理、文本提取、表格提取、Python库、自动化、数据提取、文档管理。

企业支出智能分析框架Skill afrexai-spend-intelligence

4.5

企业支出智能分析框架是一款专为B2B运营团队设计的成本优化工具。它通过系统化分析交易数据,自动识别浪费模式(如重复SaaS订阅、僵尸订阅、价格爬升),对比行业基准,并生成可执行的降本行动计划与现金流预测。帮助企业实现成本削减、供应商合同优化及现金流管理。关键词:支出分析,成本优化,SaaS浪费,供应商管理,现金流预测,B2B运营,财务智能,降本增效。

时间序列数据库技术Skill using-timeseries-databases

4.5

时间序列数据库技术用于高效存储和查询时间戳数据,如金融交易数据、物联网传感器、监控指标和日志。该技能涉及数据库选择(包括TimescaleDB、InfluxDB、ClickHouse、QuestDB)、连续聚合、降采样(LTTB算法)和保留策略优化,适用于构建实时仪表板、监控系统、物联网平台和金融应用。关键词:时间序列数据库、数据存储、查询优化、数据库技术、降采样、连续聚合。

DAG部署技能Skill dag-deploy

4.5

DAG部署技能专用于自动化部署生成的DAG文件到目标目录,如Airflow DAGs文件夹,支持清理和文件组织,优化数据管道管理,适用于数据工程、ETL开发和DevOps场景,提升数据工作流效率。