大模型微调 Skill技能列表
LitGPT模型实现与微调技能Skill implementing-llms-litgpt
这个技能专注于使用 Lightning AI 的 LitGPT 工具来实现和训练大型语言模型(LLM),支持 20 多种预训练架构(如 Llama、Gemma、Phi 等)。适用于教育目的、生产级微调(使用 LoRA/QLoRA)、单文件实现等场景。关键词包括:LitGPT、LLM、微调、LoRA、QLoRA、模型训练、Lightning AI。
参数高效微调(PEFT)Skill peft-fine-tuning
参数高效微调(PEFT)是一种技术,用于对大语言模型(LLM)进行微调,通过训练少量参数(如少于1%)来适应新任务,使用LoRA、QLoRA等方法,适用于GPU内存有限的情况,支持多适配器服务。关键词:PEFT, LoRA, QLoRA, 参数高效微调, 大模型微调, 人工智能, 机器学习。
宪法人工智能技能Skill constitutional-ai
宪法人工智能技能是一种用于AI安全对齐的技术,通过自我批判和AI反馈训练模型变得无害,无需人类标签。它涉及监督学习阶段的自我批判和修订,以及强化学习阶段的RLAIF,旨在提高AI的无害性、透明度和可扩展性。关键词:AI安全、宪法AI、RLAIF、自我批判、强化学习、无害训练、安全对齐。
add-domainSkill add-domain
向现有系统添加新的知识领域。通过对话推导出特定于领域的配置,生成领域文件夹、模板和词汇表,同时保留并连接到现有的架构。
LLaMA-Factory微调工具Skill llama-factory
LLaMA-Factory技能是一个专为大型语言模型(LLM)微调设计的无代码WebUI工具,支持超过100种模型、多种量化技术如QLoRA,以及多模态应用,提供从入门到高级的全面文档和指导,助力人工智能开发者高效进行模型定制。关键词:LLaMA-Factory, 微调, LLM, WebUI, 无代码, QLoRA, 多模态, 人工智能
Slime大模型强化学习微调框架Skill slime-rl-training
Slime 是一个专为大语言模型(LLM)设计的后训练强化学习框架,结合 Megatron-LM 进行高效训练和 SGLang 进行高吞吐量推理生成。它支持 GLM、Qwen3、DeepSeek 等多种模型,适用于自定义数据生成、多轮对话训练和智能体开发,关键词包括:大语言模型、强化学习、后训练、Megatron-LM、SGLang、微调、AI 智能体。
TRL强化学习Skill fine-tuning-with-trl
TRL(Transformer 强化学习)是一个用于通过强化学习对齐语言模型与人类偏好的技能,包括监督微调(SFT)、直接偏好优化(DPO)、PPO和GRPO等方法,适用于RLHF流程、偏好对齐和奖励模型训练。关键词:TRL, 强化学习, 语言模型, 微调, RLHF, DPO, PPO, 人工智能, 大模型, HuggingFace, 偏好学习。
本地LLM微调Skill local-llm-fine-tuning
本地LLM微调技能专注于在本地硬件上使用LoRA、QLoRA等高效技术微调大型语言模型,如Llama、Mistral、Gemma。涉及数据集准备、模型配置、训练优化和评估,适用于人工智能、自然语言处理和大模型应用开发。关键词:本地LLM微调、LoRA、QLoRA、PEFT、Hugging Face、模型训练、AI微调。
RWKV架构Skill rwkv-architecture
RWKV是一种结合Transformer和RNN的混合神经网络架构,具有线性推理复杂度、无限上下文处理能力和高效内存使用。适用于长序列处理、流式应用和大模型训练与推理,特别适合AI领域的模型开发和优化。关键词:RWKV, Transformer, RNN, 线性复杂度, 无限上下文, 高效推理, 机器学习, AI模型, 大模型微调
HuggingFace模型训练器Skill hugging-face-model-trainer
此技能用于在Hugging Face Jobs云基础设施上,利用TRL(Transformer Reinforcement Learning)技术训练或微调大型语言模型。支持SFT、DPO、GRPO和奖励建模等多种方法,包含GGUF格式转换用于本地部署。涵盖数据集准备、硬件选择、成本估算、实时监控等全流程指导,适用于云端GPU训练、大模型微调、AI应用开发、深度学习、NLP和AIGC场景。
AxolotlLLM微调技能Skill axolotl
这个技能提供关于Axolotl框架的全面指导,用于大语言模型(LLM)的微调。它支持YAML配置、100+模型、LoRA/QLoRA、DPO/KTO/ORPO/GRPO等技术,以及多模态支持。适用于开发者进行模型微调、代码调试和最佳实践学习。关键词:Axolotl, LLM微调, YAML配置, LoRA, QLoRA, DPO, KTO, ORPO, GRPO, 多模态支持。
AI大模型迁移技能Skill claude-opus-4-5-migration
这个技能用于帮助开发者和AI工程师将Claude AI模型从旧版本(如Sonnet或Opus)迁移到Opus 4.5,包括更新模型字符串、调整提示以处理行为差异,并优化代码库和API调用。关键词:AI模型迁移,Claude,Opus 4.5,代码更新,提示工程,大模型升级,AI工具调整。