cuPyNumeric并行分片数据加载Skill cupynumeric-parallel-data-load

将磁盘上分片存储的数据集并行加载到cuPyNumeric分布式数组。利用Legate叶任务实现多GPU/CPU/OMP读取,支持各分片行数不一致。没有内置加载器时的首选方案。关键词:cuPyNumeric、Legate、并行数据IO、分片数据、分布式数组、GPU加速、手动分区、叶@task。

分布式数组 0 次安装 0 次浏览 更新于 9/7/2026
名称 cupynumeric-parallel-data-load
描述 将一个分片、磁盘上的数据集(分片.npy、Parquet/Arrow、原始二进制、分片HDF5、自定义布局)通过手动分区 + 叶@task 启动加载到分布式 cuPyNumeric ndarray 中。当没有单一调用加载器适用时使用,包括各分片行数在不同文件中可能不同的情况。优先使用内置加载器。

并行分片数据 -> cupynumeric 加载

为什么需要这个技能? cupynumeric 镜像 NumPy 的数组 API,包括单个 .npy 文件的加载。除此之外文件加载属于 Legate。本技能展示了缺失行的规范方法:编写 Legate Python 任务,在任务体内调用格式所需读取器,并让 Legate 跨 GPU/节点分发读取。规范模式是手动分区+手动任务启动,按机器规模划分。本技能包含数据布局假设、使用场景、示例命令、五个操作步骤、硬性约束、变体以及常见陷阱等完整中文化内容。例如,操作步骤包括:读取每个分片元数据(.npy头部)、创建输出存储、按处理器数分块、定义叶任务并手动启动、栅栏验证。此外还讨论了均匀分片快速路径、过度分解和其他格式支持。常见陷阱包括叶任务内不能使用 cn.asarray、任务内assert会中止、启动域需与分块数匹配等。由于JSON字符串不能直接包含未转义换行,本txt以转义形式呈现;完整翻译内容应包含原文档中全部代码示例与表格。