| 名称 | cupynumeric-parallel-data-load |
| 描述 | 将一个分片、磁盘上的数据集(分片.npy、Parquet/Arrow、原始二进制、分片HDF5、自定义布局)通过手动分区 + 叶@task 启动加载到分布式 cuPyNumeric ndarray 中。当没有单一调用加载器适用时使用,包括各分片行数在不同文件中可能不同的情况。优先使用内置加载器。 |
并行分片数据 -> cupynumeric 加载
为什么需要这个技能? cupynumeric 镜像 NumPy 的数组 API,包括单个 .npy 文件的加载。除此之外文件加载属于 Legate。本技能展示了缺失行的规范方法:编写 Legate Python 任务,在任务体内调用格式所需读取器,并让 Legate 跨 GPU/节点分发读取。规范模式是手动分区+手动任务启动,按机器规模划分。本技能包含数据布局假设、使用场景、示例命令、五个操作步骤、硬性约束、变体以及常见陷阱等完整中文化内容。例如,操作步骤包括:读取每个分片元数据(.npy头部)、创建输出存储、按处理器数分块、定义叶任务并手动启动、栅栏验证。此外还讨论了均匀分片快速路径、过度分解和其他格式支持。常见陷阱包括叶任务内不能使用 cn.asarray、任务内assert会中止、启动域需与分块数匹配等。由于JSON字符串不能直接包含未转义换行,本txt以转义形式呈现;完整翻译内容应包含原文档中全部代码示例与表格。