| 名称 | tilegym-monkey-patch-kernels-to-transformers |
| 描述 | 通过替换 transformers 库的子模块和某些类的实现,并在实例化模型之前修补相应类的初始化/前向传播/权重加载方法,将 TileGym 内核集成到 Hugging Face transformers 模型中。当用户需要将 TileGym 内核集成到 transformers 模型中时使用。 |
| 开源协议 | CC-BY-4.0 AND Apache-2.0 compatibility: 已在 Claude Code 上使用 Opus-4.6 及以上版本、CodeX 使用 GPT-5.5 及以上版本、Cursor(Agent 模式)使用 GPT-5.3-CodeX 及更强模型进行验证。 metadata: |
| 作者 | “TileGym Team TileGym@nvidia.com” |
| 版本 | “2026.06.03” tags: - tilegym - transformers - integration - kernel - monkey-patch |
将 cuTile 内核集成到 🤗 Transformers 并创建新内核
TileGym 项目的主要目标是为 LLM 训练和推理提供高性能的内核。我们将 TileGym 项目中合适的内核集成到 Hugging Face transformers 库提供的 LLM 模型中,以验证端到端的功能正确性和性能提升。我们不会修改 transformers 的源代码,而是采用非侵入式的猴子补丁(monkey-patch)方法:我们将替换 transformers 库中负责实现目标 Transformer 模型的某些模块/类/方法,使得在模型实例化时,该模型的核心组件会被 TileGym 的实现替换。在运行时,模型实际上会在底层调用 TileGym 内核。此外,我们还将遵循一个自动研究式的智能体循环(agent harness loop),为目标模型创建并集成新的 cuTile 内核,以提升内核覆盖率和端到端吞吐量。
说明
本部分面向人类用户:只需向您喜欢的 AI Agent 提示技能名称和目标模型 ID。例如:
你好,请 /monkey-patch-kernels-to-transformers Qwen/Qwen3.5-0.8B。
Agent 可能会询问您一些问题。请做出澄清并给出执行确认。
工作流程
- 准备实验环境。参考 environment-setup.md
- 将现有 TileGym 内核集成到目标模型。参考 kernel-integration.md
- 为尚未覆盖的 PyTorch 代码自主创建新的 cuTile 内核。参考 auto-kernelize.md
- 在遵守约束的前提下,随意添加新的 cuTile 内核
- 在达到 auto-kernelize 循环停止条件之前,不要停止
- 汇总并报告
规范
该部分供执行此工作流的 AI Agents 使用。
内核清单
可复用的 transformer 本地内核必须使用 FlashInfer-Bench 风格的 Definition(定义)和 Solution(解决方案)元数据来表示。当研究计算需求、盘点现有内核、提出候选方案或创建新的生成内核时,请参考 kernel-inventory-schema.md。