大模型微调 Skill技能列表
AxolotlLLM微调技能Skill axolotl
这个技能提供关于Axolotl框架的全面指导,用于大语言模型(LLM)的微调。它支持YAML配置、100+模型、LoRA/QLoRA、DPO/KTO/ORPO/GRPO等技术,以及多模态支持。适用于开发者进行模型微调、代码调试和最佳实践学习。关键词:Axolotl, LLM微调, YAML配置, LoRA, QLoRA, DPO, KTO, ORPO, GRPO, 多模态支持。
OpenRLHFRLHF训练技能Skill openrlhf-training
该技能专注于使用OpenRLHF框架进行高性能强化学习人类反馈(RLHF)训练,支持PPO、GRPO、RLOO、DPO等多种算法,用于微调7B至70B+的大型语言模型。通过Ray分布式架构和vLLM推理加速,优化GPU资源使用,提高训练效率。关键词:RLHF、PPO、大模型微调、分布式训练、vLLM加速。
HuggingFace分类器微调技能Skill huggingface-classifier
该技能专注于使用Hugging Face transformer模型进行意图分类任务的微调与推理。核心功能包括模型选择(如BERT、RoBERTa、DeBERTa)、配置训练流程、实现高效推理、设计标签体系以及模型评估与部署。适用于构建意图识别系统、实体抽取等自然语言处理应用。关键词:HuggingFace,Transformer模型微调,意图分类,NLP,模型训练,推理优化,标签映射,模型评估。
TRL强化学习Skill fine-tuning-with-trl
TRL(Transformer 强化学习)是一个用于通过强化学习对齐语言模型与人类偏好的技能,包括监督微调(SFT)、直接偏好优化(DPO)、PPO和GRPO等方法,适用于RLHF流程、偏好对齐和奖励模型训练。关键词:TRL, 强化学习, 语言模型, 微调, RLHF, DPO, PPO, 人工智能, 大模型, HuggingFace, 偏好学习。
Opus4.5MigrationGuideSkill claude-opus-4-5-migration
这是一个用于将代码库从Sonnet 4.0、Sonnet 4.5或Opus 4.1迁移到Opus 4.5的指南,包括模型字符串更新、代码调整和行为差异处理。
AWQ量化技术Skill awq-quantization
AWQ(激活感知权重量化)是一种先进的4位量化技术,专为大型语言模型(LLM)设计,通过分析激活模式来保护关键权重,实现高达3倍的推理加速,同时保持最小精度损失。适用于AI模型部署、大模型微调、生产推理加速等场景,关键词包括AWQ、量化、LLM压缩、推理优化、AI部署。
GPTQ量化Skill gptq
GPTQ是一种后训练量化技术,用于大型语言模型,通过4位量化实现4倍内存减少和3-4倍推理加速,精度损失低于2%。它易于与Hugging Face Transformers和PEFT集成,支持QLoRA微调,适用于在有限GPU资源上部署大模型。关键词:量化,大型语言模型,内存优化,推理加速,4位量化,GPTQ,大模型部署,AI优化。