数据科学 Skill技能列表

数据库优化技术Skill DatabaseOptimizationTechniques

4.5

数据库优化技术是一系列用于提升数据库查询性能、降低资源消耗、确保数据高效访问的方法和策略。关键词包括查询优化、索引策略、连接池、缓存策略、数据库维护等。

日志解析与导入SOPSkill "self/import/file_path"

4.5

此技能是定义和执行日志解析的标准操作程序(SOP),用于处理Apache、Nginx、Syslog、JSON和自定义等多种日志格式,通过数据类和LogEntry类表示解析后的日志条目。它帮助用户标准化日志处理流程,提高数据解析效率,便于数据收集和分析。关键词:日志解析、SOP、文件导入、Apache日志、Nginx日志、Syslog、JSON日志、自定义日志、数据工程、数据类、LogEntry。

阶段技能Skill stage

4.5

阶段技能用于将数据文件从登陆区移动到待处理区,执行解压缩和确认文件处理,是数据摄取管道的第一步,确保数据准备就绪供后续加载。关键词:数据阶段化、ETL、数据工程、ACK文件处理、数据管道、数据摄取、文件管理。

预加载技能Skill preload

4.5

该技能用于在数据加载流程中检查landing或pending区域的文件可用性,确保文件就绪后触发加载,适用于数据工程、ETL开发和自动化编排,关键词:文件检查、数据加载、编排、ETL、数据仓库、预加载。

引导技能Skill bootstrap

4.5

引导技能是Starlake数据工程工具的核心功能,用于快速创建新的项目结构和配置文件。它支持使用模板进行项目搭建,包含标准目录、配置示例和数据,适用于数据工程师进行ETL开发、数据加载和转换。关键词:Starlake、项目引导、模板、配置、数据工程、ETL开发。

查询专家Skill query-expert

4.5

查询专家技能用于掌握和优化SQL及NoSQL数据库查询,生成高效查询、分析性能、设计索引并解决慢查询问题。关键词:数据库查询、SQL优化、性能分析、索引设计、查询调试、NoSQL、EXPLAIN计划、聚合管道、GraphQL、ETL开发。

CocoIndex数据索引框架Skill cocoindex

4.5

CocoIndex 是一个用于 AI 数据处理的实时数据转换框架,支持构建 ETL 工作流,包括文档嵌入到向量数据库、知识图谱构建、搜索索引创建等。关键功能包括增量处理、实时更新、多数据源和目标支持,适用于数据工程师和 AI 开发者进行高效数据转换和索引。关键词:数据转换、ETL、AI 数据处理、文档嵌入、向量数据库、知识图谱、实时索引。

增量模型策略选择器Skill IncrementalModelStrategySelector

4.5

增量模型策略选择器是一款用于数据工程和ETL开发的专业工具。它能够根据数据源特征(如更新模式、数据量、频率)和平台环境,智能选择和配置最优的增量数据处理策略(如追加、合并、删除后插入)。该工具专注于提升数据转换管道的效率和性能,通过优化分区裁剪、唯一键配置、回看窗口和迟到数据处理等关键参数,确保数据仓库和BI报表的数据新鲜度与准确性。关键词:增量模型,数据工程,ETL开发,dbt配置,数据转换,分区优化,数据仓库,策略选择。

SQL查询优化Skill sql-query-optimization

4.5

SQL查询优化是一项技术,用于分析和优化数据库查询,提高查询性能,减少执行时间。关键词包括:性能瓶颈、索引策略、查询重写、EXPLAIN分析、批量操作。

RevenueOperationsSkill revenue-operations

4.5

分析销售管道覆盖率,跟踪预测准确性与MAPE,并计算GTM效率指标,以优化SaaS收入

创业趋势预测Skill startup-trend-prediction

4.5

这个技能提供系统化框架,通过分析2-3年的历史信号来预测未来1-2年的市场、技术或业务模型趋势。它结合采用曲线、周期模式和信号分析,评估市场进入时机(如进入/等待/避免),支持决策制定,包括趋势轨迹(上升/峰值/下降)、采用阶段识别等。关键词:趋势预测、市场分析、创业时机、数据驱动决策、采用曲线、市场进入、周期模式、信号分析。

NeMoCurator-GPU加速数据整理工具Skill nemo-curator

4.5

NeMo Curator 是 NVIDIA 推出的 GPU 加速数据整理工具,专为大规模语言模型(LLM)训练数据准备而设计。它支持文本、图像、视频、音频等多模态数据,提供模糊去重(比 CPU 快 16 倍)、质量过滤(30+ 启发式)、语义去重、PII 脱敏、NSFW 检测等功能,显著提升数据处理效率并降低成本。适用于 AI 研究人员、数据工程师和开发者,用于高效清理和优化训练数据集,关键词包括 GPU 加速、数据整理、LLM 训练、去重、过滤、多模态、RAPIDS、NVIDIA。