大模型微调 Skill技能列表

verl强化学习训练技能Skill verl-rl-training

4.5

这个技能提供了使用verl库进行大型语言模型强化学习训练的全面指导,包括RLHF、GRPO、PPO等多种算法,支持分布式训练、多后端切换,适用于数学推理、视觉语言模型等场景。关键词:verl, 强化学习, LLM, RLHF, GRPO, PPO, 分布式训练, 大模型微调。

少样本示例生成技能Skill few-shot-example-gen

4.5

该技能专注于为大语言模型(LLM)生成和优化少样本示例,旨在通过提供高质量、多样化的示例来提升模型的提示遵循能力、意图识别准确性和任务执行效果。核心功能包括示例生成、智能选择策略、排序优化和格式设计,是提示工程和AI应用开发的关键工具。 关键词:少样本学习,示例生成,提示工程,大语言模型优化,AI性能提升,意图分类,语义相似性,示例选择策略

路由器统计Skill router-stats

4.5

Claude Router使用统计与成本分析工具,用于监控AI模型路由使用情况、查询分布统计和成本节省分析。关键词:Claude Router,AI模型路由,成本优化,使用统计,查询分析,大模型部署,AI成本管理,路由监控,性能分析,费用节省。

HQQ模型量化技术Skill hqq-quantization

4.5

HQQ(Half-Quadratic Quantization)是一种先进的AI模型量化技术,专为大语言模型设计,支持无校准数据的4/3/2-bit精度权重压缩,实现快速模型优化和内存效率提升,适用于AI推理加速、模型部署、vLLM和HuggingFace框架集成,以及LoRA微调。关键词:量化、模型压缩、无校准、AI推理、大模型微调、内存优化。

LocalLLMDeploymentSkill LocalLLMDeployment

4.5

这项技能涉及在本地环境中部署和优化大型语言模型(LLMs),包括使用Ollama、vLLM和llama.cpp等工具进行模型服务的设置、性能调优、量化策略和监控。关键词包括:Docker容器化、GPU硬件优化、Python编程、模型量化、张量并行、流水线并行。

提示工程模式Skill prompt-engineering-patterns

4.5

此技能专注于通过高级提示工程技术优化大型语言模型(LLM)的性能、可靠性和可控性。它涉及Few-Shot学习、Chain-of-Thought提示、提示优化、模板系统等核心能力,适用于AI应用开发和LLM微调。关键词:提示工程、LLM优化、Few-Shot学习、Chain-of-Thought、Prompt模板、AI智能体。

LLM量化与内存优化技术Skill quantizing-models-bitsandbytes

4.5

这个技能涉及使用bitsandbytes库对大型语言模型进行量化和内存优化,通过8位和4位量化减少GPU内存占用50-75%,精度损失小于1%,支持INT8、NF4、FP4格式、QLoRA微调和8位优化器,适用于有限内存环境下的模型加载、推理和训练,与HuggingFace Transformers集成。关键词:LLM量化、内存优化、bitsandbytes、QLoRA、深度学习、大模型微调、GPU加速、HuggingFace、AI模型优化。

知识蒸馏Skill knowledge-distillation

4.5

知识蒸馏是一种压缩大型语言模型的技术,通过从大型教师模型向小型学生模型传递知识,以在部署时保持高性能并降低推理成本。适用于模型压缩、能力迁移、成本优化和专业模型创建等场景。关键词:知识蒸馏,模型压缩,LLM,教师-学生模型,温度缩放,软目标,反向KLD,大语言模型,人工智能,深度学习。

Megatron-Core大语言模型训练Skill training-llms-megatron

4.5

Megatron-Core 是一个用于训练大规模语言模型(2B-462B 参数)的框架,采用先进的并行策略(如张量并行、管道并行、专家并行),在 NVIDIA GPU(如 H100)上实现高 GPU 效率(最高 47% 模型浮点运算利用率),适用于生产环境训练如 LLaMA、Nemotron、DeepSeek 等模型。关键词:大语言模型训练,Megatron-Core,并行计算,GPU 优化,分布式训练,AI 模型训练。

miles强化学习训练框架Skill miles-rl-training

4.5

miles是一个企业级强化学习框架,专注于训练大型混合专家模型,支持FP8和INT4量化训练,确保训练与推理的精确对齐,并通过推测性RL优化性能,适合生产环境使用。关键词: 强化学习, MoE模型, FP8训练, INT4量化, 训练-推理对齐, 推测性RL, 企业级AI框架。

提示架构师Skill prompt-architect

4.5

这个技能用于根据Claude 4.x标准,将用户需求转化为结构化、可执行的最佳实践提示。它基于Nate B. Jones的四个初学者动作(定义输出形状、提供上下文、建议静默计划、添加自检)和Anthropic的最佳实践,通过合同风格模板生成优化提示,提升AI模型交互效率和质量。适用于大模型微调、提示工程优化,关键词:提示架构、Claude 4.x、最佳实践、提示生成、AI模型优化、Nate B. Jones、大模型微调、提示工程、合同风格模板、自检验证。

模型合并Skill model-merging

4.5

模型合并技能用于无需重新训练即可结合多个预训练或微调AI模型的能力,通过混合不同领域专家(如数学、编程和聊天)来创建专业模型,提高性能并降低成本。关键词包括模型合并、mergekit、AI模型融合、无训练合并、大模型优化、深度学习应用。