将TileGym内核集成到Transformers模型Skill tilegym-monkey-patch-kernels-to-transformers

该技能用于将TileGym项目的cuTile高性能内核非侵入式集成到Hugging Face Transformers模型中,通过猴子补丁方式替换模型子模块和类,在实例化时自动启用TileGym内核,支持训练与推理加速;并能自主创建新cuTile内核以提升覆盖率和端到端吞吐。关键词:TileGym、cuTile、transformers、内核集成、monkey-patch、LLM、性能优化。

TileGym内核优化 0 次安装 1 次浏览 更新于 9/7/2026
名称 tilegym-monkey-patch-kernels-to-transformers
描述 通过替换 transformers 库的子模块和某些类的实现,并在实例化模型之前修补相应类的初始化/前向传播/权重加载方法,将 TileGym 内核集成到 Hugging Face transformers 模型中。当用户需要将 TileGym 内核集成到 transformers 模型中时使用。
开源协议 CC-BY-4.0 AND Apache-2.0 compatibility: 已在 Claude Code 上使用 Opus-4.6 及以上版本、CodeX 使用 GPT-5.5 及以上版本、Cursor(Agent 模式)使用 GPT-5.3-CodeX 及更强模型进行验证。 metadata:
作者 “TileGym Team TileGym@nvidia.com
版本 “2026.06.03” tags: - tilegym - transformers - integration - kernel - monkey-patch

将 cuTile 内核集成到 🤗 Transformers 并创建新内核

TileGym 项目的主要目标是为 LLM 训练和推理提供高性能的内核。我们将 TileGym 项目中合适的内核集成到 Hugging Face transformers 库提供的 LLM 模型中,以验证端到端的功能正确性和性能提升。我们不会修改 transformers 的源代码,而是采用非侵入式的猴子补丁(monkey-patch)方法:我们将替换 transformers 库中负责实现目标 Transformer 模型的某些模块/类/方法,使得在模型实例化时,该模型的核心组件会被 TileGym 的实现替换。在运行时,模型实际上会在底层调用 TileGym 内核。此外,我们还将遵循一个自动研究式的智能体循环(agent harness loop),为目标模型创建并集成新的 cuTile 内核,以提升内核覆盖率和端到端吞吐量。

说明

本部分面向人类用户:只需向您喜欢的 AI Agent 提示技能名称和目标模型 ID。例如:

你好,请 /monkey-patch-kernels-to-transformers Qwen/Qwen3.5-0.8B。

Agent 可能会询问您一些问题。请做出澄清并给出执行确认。

工作流程

  1. 准备实验环境。参考 environment-setup.md
  2. 将现有 TileGym 内核集成到目标模型。参考 kernel-integration.md
  3. 为尚未覆盖的 PyTorch 代码自主创建新的 cuTile 内核。参考 auto-kernelize.md
    • 在遵守约束的前提下,随意添加新的 cuTile 内核
    • 在达到 auto-kernelize 循环停止条件之前,不要停止
  4. 汇总并报告

规范

该部分供执行此工作流的 AI Agents 使用。

内核清单

可复用的 transformer 本地内核必须使用 FlashInfer-Bench 风格的 Definition(定义)和 Solution(解决方案)元数据来表示。当研究计算需求、盘点现有内核、提出候选方案或创建新的生成内核时,请参考 kernel-inventory-schema.md