大模型微调 Skill技能列表
路由器统计Skill router-stats
Claude Router使用统计与成本分析工具,用于监控AI模型路由使用情况、查询分布统计和成本节省分析。关键词:Claude Router,AI模型路由,成本优化,使用统计,查询分析,大模型部署,AI成本管理,路由监控,性能分析,费用节省。
verl强化学习训练技能Skill verl-rl-training
这个技能提供了使用verl库进行大型语言模型强化学习训练的全面指导,包括RLHF、GRPO、PPO等多种算法,支持分布式训练、多后端切换,适用于数学推理、视觉语言模型等场景。关键词:verl, 强化学习, LLM, RLHF, GRPO, PPO, 分布式训练, 大模型微调。
GRPO/RL微调训练技能Skill grpo-rl-training
这个技能提供专家级指导,用于使用TRL库实现GRPO(组相对策略优化)来微调语言模型。它专注于推理能力和任务特定行为,通过自定义奖励函数优化模型输出,适用于需要结构化输出和可验证任务的应用,如数学、编码和事实核查。关键词:GRPO, 强化学习, TRL, 模型微调, 推理, 奖励函数, 结构化输出, 大语言模型
LocalLLMDeploymentSkill LocalLLMDeployment
这项技能涉及在本地环境中部署和优化大型语言模型(LLMs),包括使用Ollama、vLLM和llama.cpp等工具进行模型服务的设置、性能调优、量化策略和监控。关键词包括:Docker容器化、GPU硬件优化、Python编程、模型量化、张量并行、流水线并行。
知识蒸馏Skill knowledge-distillation
知识蒸馏是一种压缩大型语言模型的技术,通过从大型教师模型向小型学生模型传递知识,以在部署时保持高性能并降低推理成本。适用于模型压缩、能力迁移、成本优化和专业模型创建等场景。关键词:知识蒸馏,模型压缩,LLM,教师-学生模型,温度缩放,软目标,反向KLD,大语言模型,人工智能,深度学习。
提示工程模式Skill prompt-engineering-patterns
此技能专注于通过高级提示工程技术优化大型语言模型(LLM)的性能、可靠性和可控性。它涉及Few-Shot学习、Chain-of-Thought提示、提示优化、模板系统等核心能力,适用于AI应用开发和LLM微调。关键词:提示工程、LLM优化、Few-Shot学习、Chain-of-Thought、Prompt模板、AI智能体。
Megatron-Core大语言模型训练Skill training-llms-megatron
Megatron-Core 是一个用于训练大规模语言模型(2B-462B 参数)的框架,采用先进的并行策略(如张量并行、管道并行、专家并行),在 NVIDIA GPU(如 H100)上实现高 GPU 效率(最高 47% 模型浮点运算利用率),适用于生产环境训练如 LLaMA、Nemotron、DeepSeek 等模型。关键词:大语言模型训练,Megatron-Core,并行计算,GPU 优化,分布式训练,AI 模型训练。
参数高效微调(PEFT)Skill peft-fine-tuning
参数高效微调(PEFT)是一种技术,用于对大语言模型(LLM)进行微调,通过训练少量参数(如少于1%)来适应新任务,使用LoRA、QLoRA等方法,适用于GPU内存有限的情况,支持多适配器服务。关键词:PEFT, LoRA, QLoRA, 参数高效微调, 大模型微调, 人工智能, 机器学习。
HQQ模型量化技术Skill hqq-quantization
HQQ(Half-Quadratic Quantization)是一种先进的AI模型量化技术,专为大语言模型设计,支持无校准数据的4/3/2-bit精度权重压缩,实现快速模型优化和内存效率提升,适用于AI推理加速、模型部署、vLLM和HuggingFace框架集成,以及LoRA微调。关键词:量化、模型压缩、无校准、AI推理、大模型微调、内存优化。
LitGPT模型实现与微调技能Skill implementing-llms-litgpt
这个技能专注于使用 Lightning AI 的 LitGPT 工具来实现和训练大型语言模型(LLM),支持 20 多种预训练架构(如 Llama、Gemma、Phi 等)。适用于教育目的、生产级微调(使用 LoRA/QLoRA)、单文件实现等场景。关键词包括:LitGPT、LLM、微调、LoRA、QLoRA、模型训练、Lightning AI。
本地LLM微调Skill local-llm-fine-tuning
本地LLM微调技能专注于在本地硬件上使用LoRA、QLoRA等高效技术微调大型语言模型,如Llama、Mistral、Gemma。涉及数据集准备、模型配置、训练优化和评估,适用于人工智能、自然语言处理和大模型应用开发。关键词:本地LLM微调、LoRA、QLoRA、PEFT、Hugging Face、模型训练、AI微调。
提示架构师Skill prompt-architect
这个技能用于根据Claude 4.x标准,将用户需求转化为结构化、可执行的最佳实践提示。它基于Nate B. Jones的四个初学者动作(定义输出形状、提供上下文、建议静默计划、添加自检)和Anthropic的最佳实践,通过合同风格模板生成优化提示,提升AI模型交互效率和质量。适用于大模型微调、提示工程优化,关键词:提示架构、Claude 4.x、最佳实践、提示生成、AI模型优化、Nate B. Jones、大模型微调、提示工程、合同风格模板、自检验证。