大模型微调 Skill技能列表
简单偏好优化(SimPO)Skill simpo-training
简单偏好优化 (SimPO) 是一种用于大型语言模型对齐的训练方法,无需参考模型,比DPO更高效,适用于AI模型的微调和优化,提升模型在偏好数据上的性能。关键词:SimPO, 偏好优化, LLM对齐, AI训练, 大模型微调, 深度学习, 机器学习。
Unsloth快速微调指南Skill unsloth
Unsloth 技能提供专家指导,用于使用Unsloth工具进行快速模型微调,实现2-5倍的训练加速和50-80%的内存节省,支持LoRA和QLoRA优化技术。适用于Llama、Mistral、Gemma、Qwen等大型语言模型的微调。关键词:Unsloth, 快速微调, AI模型微调, 训练优化, 内存效率, LoRA, QLoRA, 大模型。
AWQ量化技术Skill awq-quantization
AWQ(激活感知权重量化)是一种先进的4位量化技术,专为大型语言模型(LLM)设计,通过分析激活模式来保护关键权重,实现高达3倍的推理加速,同时保持最小精度损失。适用于AI模型部署、大模型微调、生产推理加速等场景,关键词包括AWQ、量化、LLM压缩、推理优化、AI部署。
HuggingFace分类器微调技能Skill huggingface-classifier
该技能专注于使用Hugging Face transformer模型进行意图分类任务的微调与推理。核心功能包括模型选择(如BERT、RoBERTa、DeBERTa)、配置训练流程、实现高效推理、设计标签体系以及模型评估与部署。适用于构建意图识别系统、实体抽取等自然语言处理应用。关键词:HuggingFace,Transformer模型微调,意图分类,NLP,模型训练,推理优化,标签映射,模型评估。
OpenRLHFRLHF训练技能Skill openrlhf-training
该技能专注于使用OpenRLHF框架进行高性能强化学习人类反馈(RLHF)训练,支持PPO、GRPO、RLOO、DPO等多种算法,用于微调7B至70B+的大型语言模型。通过Ray分布式架构和vLLM推理加速,优化GPU资源使用,提高训练效率。关键词:RLHF、PPO、大模型微调、分布式训练、vLLM加速。
Opus4.5MigrationGuideSkill claude-opus-4-5-migration
这是一个用于将代码库从Sonnet 4.0、Sonnet 4.5或Opus 4.1迁移到Opus 4.5的指南,包括模型字符串更新、代码调整和行为差异处理。
GPTQ量化Skill gptq
GPTQ是一种后训练量化技术,用于大型语言模型,通过4位量化实现4倍内存减少和3-4倍推理加速,精度损失低于2%。它易于与Hugging Face Transformers和PEFT集成,支持QLoRA微调,适用于在有限GPU资源上部署大模型。关键词:量化,大型语言模型,内存优化,推理加速,4位量化,GPTQ,大模型部署,AI优化。