| 名称 | “nemotron-speech” |
| 描述 | 路由 NVIDIA Nemotron Speech (Riva) NIM 任务 — 在 build.nvidia.com 或自托管环境中部署、运行和测试 ASR、TTS 和 NMT NIM。 triggers: - Nemotron 语音 - 部署 Riva NIM - 部署 ASR/TTS/NMT NIM - Riva ASR - Riva TTS - Riva 翻译 - Parakeet - Canary - Whisper - Nemotron ASR 流式 - Magpie TTS - DNT 标签 - nemo2riva - riva-build - riva-deploy - RMIR - Riva NIM 设置 - NGC API 密钥 - force_eou - Silero VAD - Sortformer 说话人分离 - Riva chunk 大小 - Riva HTTP - Riva WebSocket - grpc.nvcf.nvidia.com - build.nvidia.com Riva - 自定义 TTS 模型 - 微调 TTS - 零样本 TTS - 零样本声音克隆 - TTS 发音词典 - SSML Riva - exaggeration_factor - OGG_OPUS TTS - TTS 流水线配置 - IPA 发音 TTS - 音素 Riva TTS - 自定义 TTS 发音 - TTS 错词发音 - 如何发音 Riva TTS - TTS IPA 候选词 |
| 版本 | “1.0.0” |
| 开源协议 | Apache-2.0 metadata: |
| 作者 | “Nemotron 语音团队” team: riva tags: - nvidia - nemotron-语音 - riva - nim - asr - tts - nmt - 语音 - 语音转文字 - 文字转语音 - 翻译 - parakeet - canary - whisper - magpie - nemotron - grpc - http - websocket - 云 - nvcf - 发音 - ipa - 音素 domain: ml |
Nemotron 语音技能
注意: “Nemotron Speech” 是 NVIDIA 当前以 Riva / Riva NIM 文档公开的名称。所有命令、容器镜像、gRPC API、Python 导入和文档 URL 仍使用 “Riva” —— 此次更名仅是品牌层面的变化。请勿重命名命令、镜像或文档 URL。
代理(Agent): 在引导用户执行多步骤工作流时,请先宣布每一步再展示:步骤 N/M — 步骤标题(例如,“步骤 1/4 — 部署容器”)。
目的
作为所有 NVIDIA Nemotron Speech (Riva) NIM 工作流的唯一入口:涵盖 ASR(语音转文本)、TTS(文本转语音)和 NMT(翻译)。内容包括通过 build.nvidia.com 的云托管推理、自托管 Docker 部署、ASR 的客户端协议选择(gRPC、HTTP、WebSocket)、通过 riva-build 部署自定义 NeMo 模型、ASR 流水线调优(VAD、说话人分离、语言模型)以及前置的 Docker / NGC / 驱动安装。
何时使用此技能
在任何 Nemotron Speech / Riva NIM 任务中使用此技能 — 包括部署、测试、自定义模型构建、系统要求检查,或在 ASR / TTS / NMT 模态之间进行模型选择。
工作流
识别用户的任务类型,然后从 references/ 加载对应的参考文件。参考文件包含每个工作流的详细内容;本 SKILL.md 仅作为路由表面。只需加载与当前任务相关的参考文件。
先决条件
- 对于 自托管部署:需要 NVIDIA AI Enterprise(NVAIE)授权,然后完成环境设置 — NVIDIA 驱动、Docker、容器工具包、NGC API 密钥、Riva Python 客户端。参见
references/setup.md。 - 对于 云托管推理:执行
pip install -U nvidia-riva-client,并从 https://build.nvidia.com 获取有效的NVIDIA_API_KEY。 - 请将
NVIDIA_API_KEY和NGC_API_KEY视为机密:切勿打印、粘贴、提交或记录真实密钥。Docker 登录建议使用--password-stdin,持久化密钥请存储在凭据管理器或chmod 600的环境文件中,而不是放在全局可读的 shell 启动文件中。 - 对于 自托管 Docker 模型缓存:挂载到
/opt/nim/.cache的主机目录必须允许容器用户(NIM 容器内部以nvs:1000运行)写入,而不仅仅是宿主用户。创建目录后请运行sudo chown 1000:1000 $LOCAL_NIM_CACHE,以便容器可以写入。避免使用全局可写模式——否则任何本地用户都可以替换缓存的模型工件。同时避免在docker run中使用-u "$(id -u):$(id -g)"—— 容器内的/opt/nim/workspace对任意 UID 并不可写。如果在模型下载时看到I/O error Permission denied (os error 13),则说明主机目录所有权有问题。
使用说明
- 将用户的任务与一个参考文件匹配,且仅加载该文件;这些参考文件非常详细,因此渐进式披露可以保持上下文紧凑。
- 将驱动、Docker、容器工具包和 NGC 的设置请求路由到
references/setup.md。 - 将 GPU 兼容性、部署就绪性和容器健康检查路由到
references/deployment-readiness-checks.md。 - 将 ASR、TTS、NMT 的模型选择路由到
references/model-selection.md。 - 将 Parakeet、Canary、Whisper 和 Nemotron ASR 流式的 ASR 部署或推理路由到
references/asr.md。 - 将自定义训练的 NeMo ASR 部署(
.nemo→ RMIR → NIM)路由到references/asr-custom.md。 - 将 VAD、说话人分离、语言模型和 chunk 大小的 ASR 流水线配置路由到
references/pipelines.md。 - 将 Magpie 的 TTS 部署或推理路由到
references/tts.md。 - 将自定义或微调 TTS 模型部署(
.nemo→ RMIR → NIM)路由到references/tts-custom.md。 - 将 TTS 合成流水线配置(SSML、零样本声音克隆、应用现有发音词典、音频编码、采样率、
custom_configuration键)路由到references/tts-pipelines.md。(若要发现并构建发音本身,请使用tts-pronunciation.md。) - 将 TTS 发音发现——查找、测试和应用特定单词或短语的 IPA 发音——路由到
references/tts-pronunciation.md。 - 将 Riva Translate、语言对和 DNT 标签的 NMT 部署或推理路由到
references/nmt.md。
事实来源
对于每个发布版本的详细信息——当前模型目录、容器 ID、函数 ID、语音列表、最小显存、按模型的功能支持——请获取或打开 NVIDIA 官方文档,而不是依赖本 SKILL.md 或参考文件中的文字。每个参考文件都包含指向相关文档页面的路由表。
顶层登陆页面:
示例
“部署一个 Parakeet ASR NIM” → 加载 references/asr.md,按照选项 B(自托管)的步骤 1–4 操作。
“使用 Magpie 合成语音” → 加载 references/tts.md,按照选项 A(云)或选项 B(自托管)操作。
“将英语翻译为德语” → 加载 references/nmt.md,按照 4 步流程操作。
“将我微调后的 .nemo 转换为 NIM” → 加载 references/asr-custom.md 了解 4 阶段流水线,并加载 references/pipelines.md 了解构建时配置。
“将自定义的微调 TTS 声音部署为 NIM” → 加载 references/tts-custom.md 了解 4 阶段流水线。
“使用 Magpie 进行零样本声音克隆” → 加载 references/tts-pipelines.md。
“向我的 TTS 请求添加 SSML 强调标记” → 加载 references/tts-pipelines.md。
“‘NVIDIA’ 在我的 Magpie TTS 输出中发音不对——建议几个 IPA 选项进行测试” → 加载 references/tts-pronunciation.md,生成 IPA 候选方案,合成变体,然后输出全部三种交付格式。
“如何通过 gRPC Python 中的 custom_dictionary 修复 Riva TTS 中 ‘NIM’ 的发音?” → 加载 references/tts-pronunciation.md,为“NIM”提供 IPA,展示线格式和 gRPC 示例。
“我的 GPU 能运行这个吗?” → 加载 references/deployment-readiness-checks.md 并运行 6 步系统检查。
“我应该使用哪个 Riva 模型?” → 加载 references/model-selection.md,应用决策框架,然后获取具体当前模型名称的支持矩阵。
命名与术语
- 技能品牌:Nemotron Speech(对外名称)。
- 保留内部命名:命令(
riva-build、riva-deploy、riva_streaming_asr_client)、Python 客户端(riva.client)、gRPC 命名空间(nvidia.riva.asr.*)、容器仓库(nvcr.io/nim/nvidia/*)以及所有 NVIDIA 文档 URL 仍使用 “Riva”。请勿在代码、命令或文档中重命名这些名称。
故障排除
对于特定任务或模态的运行时问题,请使用相应的参考文件(references/<task>.md)。跨领域的就绪检查:
- 容器无法就绪 →
references/deployment-readiness-checks.md(系统检查 + 健康检查表) - 健康检查失败 →
references/deployment-readiness-checks.md - 从
nvcr.io执行docker pull返回 403 →references/setup.md(步骤 5 — Docker 登录) - 基础镜像错误 / 模型架构不匹配 →
references/asr-custom.md(阶段 2 基础镜像) - VRAM / GPU 兼容性 →
references/deployment-readiness-checks.md,然后在支持矩阵上验证
限制条件
- 仅支持 x86_64 架构 —— Windows 上的 WSL2 需要使用 Podman,且仅支持一部分 NIM(见
references/setup.md) - 自托管部署需要 NVIDIA AI Enterprise 许可
- 云托管推理需要有效的
NVIDIA_API_KEY和互联网访问 - 公共技能品牌为 “Nemotron Speech”;命令、容器镜像、Python 导入(
riva.client)、gRPC 服务(nvidia.riva.*)以及 NVIDIA 文档 URL 仍使用 “Riva” —— 请遵循官方文档和目录进行命名,不要在这些命令或代码中重命名