| 名称 | earth2studio-discover |
| 版本 | 0.16.0 |
| 开源协议 | Apache-2.0 metadata: |
| 作者 | NVIDIA Earth-2 团队 tags: - earth2studio - earth2 - python - discovery - models - data-sources |
| 描述 | > 查找用于天气/气候用例的 Earth2Studio 模型、数据源和示例。 请勿用于编写推理代码、下载数据或安装。 |
Earth2Studio 可发现性技能
目的
帮助用户识别合适的 Earth2Studio 模型、数据源和示例,以满足其天气/气候任务。适用于:按 GPU/VRAM 需求比较模型、选择预测类别(临近预报、中期预报、季节预报)、通过词典寻找兼容的数据源,或查找用于降尺度、集合生成和数据同化的示例库。
先决条件
- 可访问互联网以抓取 nvidia.github.io 上的最新文档页面
- 熟悉 Earth2Studio 徽章系统(Class、Region、VRAM、Release)
您正在帮助用户找到适合其使用场景的 Earth2Studio 组件。您的工作是理解他们想要做什么,然后根据实时文档的验证,为他们指出匹配的模型、数据源和示例。
核心原则:从实时文档中发现,而非死记硬背
Earth2Studio 每个版本都会新增模型、数据源和示例。模型类别会获得新徽章,出现新的数据源,示例会被重新组织。本技能中的任何静态列表都会过时。
规则:
- 在推荐组件之前,务必先获取相关的实时文档页面。
- 使用徽章元数据(Region、Class、VRAM、Release)来筛选候选。
- 使用词典系统验证数据源与模型的兼容性(见步骤 4)。
- 引用文档 URL,以便用户进一步探索。
实时文档参考
根据需要获取这些页面(不要一次性全部获取 —— 只获取回答用户问题所需的页面):
交互协议
步骤 1. 理解用户的问题
从用户所说内容中提取(如有需要可追问,最多 3 个问题):
- 任务类型 —— 中期预报、临近预报、降尺度/超分辨率、季节/次季节预报、数据同化、气候预测、集合生成、派生诊断
- 区域 —— 全球、北美、欧洲、亚洲、特定国家/地区
- 时间尺度 —— 数小时后(临近预报)、数天后(中期预报)、数周/数月(季节预报)、气候
- 关注的变量 —— 温度、降水、风、气压、辐射、特定层次等
- 硬件约束 —— GPU 类型、可用 VRAM(40GB、48GB、80GB、96GB)
- 确定性预报还是集合预报 —— 单一最佳估计预报或包含不确定性的预报
好的追问措辞:“您是在寻找单一最佳估计预报,还是需要带不确定性的集合预报?” —— 而不是 “您的使用场景是什么?”
步骤 2. 获取相关模型文档
根据用户的任务类型,获取适当的模型页面:
- 预报 → 预后模型 (px)
- 后处理 / 降尺度 / 派生变量 → 诊断模型 (dx)
- 观测数据整合 → 数据同化 (da)
- 工作流通常将 px → dx 串联,因此请同时检查两者
从文档页面提取每个候选模型的以下信息:
- 类别徽章 —— NWC、DS、MR、S2S、DA、CM
- 区域徽章 —— Global、NA、EU、AS 等
- 推荐 VRAM 徽章 —— 最低 GPU 内存
- 发布年份 —— 同类中较新的模型通常取代较旧的模型
筛选出与用户任务类型、区域和硬件相匹配的模型。展示一个简短列表(不是完整目录),并附上徽章元数据。
步骤 3. 获取相关数据源文档
根据用户的数据需求,获取适当的数据源页面:
- 历史再分析 → 分析类数据源
- 实时或业务运行 → 预报类数据源
- 观测 / 站点数据 → 数据帧类数据源
注意哪些数据源覆盖用户的区域和变量。
步骤 4. 通过词典验证兼容性
这是关键技术步骤。Earth2Studio 模型通过 input_coords() 声明其所需的输入变量。数据源通过其词典 VOCAB 公开可用变量。如果某个数据源的词典 VOCAB 键包含模型 input_coords(“variable”维度)中的所有变量,则它们兼容。
进行验证:
- 查看模型的文档页面或源码,找到其
input_coords—— 特别是变量列表 - 在
earth2studio/lexicon/<source>.py查看数据源的词典文件中的 VOCAB 键 - 确认数据源的 VOCAB 覆盖模型所需的全部变量
如果直接检查源码(例如用户有本地克隆),词典文件位于:
earth2studio/lexicon/gfs.py
earth2studio/lexicon/hrrr.py
earth2studio/lexicon/cds.py
earth2studio/lexicon/arco.py
earth2studio/lexicon/wb2.py
... (每个数据源一个)
每个文件都定义了一个 VOCAB: dict[str, str | tuple],将 Earth2Studio 变量名映射到源特定的标识符。
清晰地说明兼容性结果:“GraphCastOperational 需要 [变量列表] —— GFS 和 ERA5(通过 ARCO/CDS)都提供这些变量,但 HRRR 不覆盖高于 X 的气压层。”
步骤 5. 推荐示例
获取示例库,并识别演示用户工作流模式的示例。示例按类别组织:
01_getting_started—— 基础确定性、诊断、集合管道02_medium_range—— 集合扩展、扰动、气旋跟踪03_downscaling—— CorrDiff、CBottle、集合降尺度04_nowcasting—— StormCast、StormScope05_data_assimilation—— StormCast SDA、HealDA06_seasonal—— DLESyM、统计方法07_misc—— 分布式推理、IO、自定义数据、生成08_extend—— 构建自定义模型、诊断、数据源
为用户指出最相关的 1–3 个示例作为起点。解释每个示例演示了什么,以及它与其问题的关系。
步骤 6. 返回推荐
输出结构(省略空部分):
## 您的使用场景
[用1-2句话重述用户想做的事]
## 推荐模型
| 模型 | 类别 | 区域 | VRAM | 原因 |
|---|---|---|---|---|
[每行附简要理由]
## 兼容的数据源
| 数据源 | 覆盖 | 与以下模型兼容 |
|---|---|---|
[通过词典验证]
## 相关示例
- [示例名称](链接) —— 演示内容
## 后续步骤
[安装什么,接下来阅读什么]
最多保留 2–4 个模型的推荐。如果存在多个选项,请解释权衡(准确性 vs 速度、确定性 vs 集合、VRAM 等),而不是全部列出。
局限性
- 推荐仅与实时文档同步;未发布的模型无法被发现。
- 新添加模型的徽章元数据可能不完整。
- 词典兼容性检查需要访问源码才能完全准确;仅基于文档的检查是近似的。
故障排查
| 错误 | 原因 | 解决方法 |
|---|---|---|
| 模型页面返回 404 | 发布后 URL 发生变化 | 查看 https://nvidia.github.io/earth2studio/ 获取更新的导航 |
| 词典文件未找到 | 数据源是新的或重命名 | 在 earth2studio/lexicon/ 目录中搜索当前文件名 |
| 模型缺少徽章 | 模型文档尚未更新 | 回退到模型源码中的 __init__ 或 README 获取规格 |
所有权与范围外
负责: 组件发现、模型/数据源兼容性检查、基于徽章的筛选、示例推荐、硬件适配性评估。
不负责: 安装(使用 earth2studio-install 技能)、编写推理代码、模型训练、自定义模型开发、运行时调试、PhysicsNeMo 模型发现。