Nemotron语音技能Skill "nemotron-speech"

本技能为NVIDIA Nemotron Speech/Riva NIM语音AI全流程操作手册,覆盖ASR语音识别、TTS语音合成、NMT语音翻译的云端/自托管部署、推理测试、自定义NeMo模型转换、流水线配置与调优、发音词典、零样本声音克隆,并包含环境准备、故障排查和模型选型指南。关键词:Nemotron Speech、Riva、NIM、ASR、TTS、NMT、语音识别、语音合成、机器翻译、Docker部署、gRPC、WebSocket、Parakeet、Canary、Whisper、Magpie、IPA发音。

Nemotron模型 0 次安装 0 次浏览 更新于 9/7/2026
名称 “nemotron-speech”
描述 路由 NVIDIA Nemotron Speech (Riva) NIM 任务 — 在 build.nvidia.com 或自托管环境中部署、运行和测试 ASR、TTS 和 NMT NIM。 triggers: - Nemotron 语音 - 部署 Riva NIM - 部署 ASR/TTS/NMT NIM - Riva ASR - Riva TTS - Riva 翻译 - Parakeet - Canary - Whisper - Nemotron ASR 流式 - Magpie TTS - DNT 标签 - nemo2riva - riva-build - riva-deploy - RMIR - Riva NIM 设置 - NGC API 密钥 - force_eou - Silero VAD - Sortformer 说话人分离 - Riva chunk 大小 - Riva HTTP - Riva WebSocket - grpc.nvcf.nvidia.com - build.nvidia.com Riva - 自定义 TTS 模型 - 微调 TTS - 零样本 TTS - 零样本声音克隆 - TTS 发音词典 - SSML Riva - exaggeration_factor - OGG_OPUS TTS - TTS 流水线配置 - IPA 发音 TTS - 音素 Riva TTS - 自定义 TTS 发音 - TTS 错词发音 - 如何发音 Riva TTS - TTS IPA 候选词
版本 “1.0.0”
开源协议 Apache-2.0 metadata:
作者 “Nemotron 语音团队” team: riva tags: - nvidia - nemotron-语音 - riva - nim - asr - tts - nmt - 语音 - 语音转文字 - 文字转语音 - 翻译 - parakeet - canary - whisper - magpie - nemotron - grpc - http - websocket - 云 - nvcf - 发音 - ipa - 音素 domain: ml

Nemotron 语音技能

注意: “Nemotron Speech” 是 NVIDIA 当前以 Riva / Riva NIM 文档公开的名称。所有命令、容器镜像、gRPC API、Python 导入和文档 URL 仍使用 “Riva” —— 此次更名仅是品牌层面的变化。请勿重命名命令、镜像或文档 URL。

代理(Agent): 在引导用户执行多步骤工作流时,请先宣布每一步再展示:步骤 N/M — 步骤标题(例如,“步骤 1/4 — 部署容器”)。

目的

作为所有 NVIDIA Nemotron Speech (Riva) NIM 工作流的唯一入口:涵盖 ASR(语音转文本)、TTS(文本转语音)和 NMT(翻译)。内容包括通过 build.nvidia.com 的云托管推理、自托管 Docker 部署、ASR 的客户端协议选择(gRPC、HTTP、WebSocket)、通过 riva-build 部署自定义 NeMo 模型、ASR 流水线调优(VAD、说话人分离、语言模型)以及前置的 Docker / NGC / 驱动安装。

何时使用此技能

在任何 Nemotron Speech / Riva NIM 任务中使用此技能 — 包括部署、测试、自定义模型构建、系统要求检查,或在 ASR / TTS / NMT 模态之间进行模型选择。

工作流

识别用户的任务类型,然后从 references/ 加载对应的参考文件。参考文件包含每个工作流的详细内容;本 SKILL.md 仅作为路由表面。只需加载与当前任务相关的参考文件。

先决条件

  • 对于 自托管部署:需要 NVIDIA AI Enterprise(NVAIE)授权,然后完成环境设置 — NVIDIA 驱动、Docker、容器工具包、NGC API 密钥、Riva Python 客户端。参见 references/setup.md
  • 对于 云托管推理:执行 pip install -U nvidia-riva-client,并从 https://build.nvidia.com 获取有效的 NVIDIA_API_KEY
  • 请将 NVIDIA_API_KEYNGC_API_KEY 视为机密:切勿打印、粘贴、提交或记录真实密钥。Docker 登录建议使用 --password-stdin,持久化密钥请存储在凭据管理器或 chmod 600 的环境文件中,而不是放在全局可读的 shell 启动文件中。
  • 对于 自托管 Docker 模型缓存:挂载到 /opt/nim/.cache 的主机目录必须允许容器用户(NIM 容器内部以 nvs:1000 运行)写入,而不仅仅是宿主用户。创建目录后请运行 sudo chown 1000:1000 $LOCAL_NIM_CACHE,以便容器可以写入。避免使用全局可写模式——否则任何本地用户都可以替换缓存的模型工件。同时避免在 docker run 中使用 -u "$(id -u):$(id -g)" —— 容器内的 /opt/nim/workspace 对任意 UID 并不可写。如果在模型下载时看到 I/O error Permission denied (os error 13),则说明主机目录所有权有问题。

使用说明

  • 将用户的任务与一个参考文件匹配,且仅加载该文件;这些参考文件非常详细,因此渐进式披露可以保持上下文紧凑。
  • 将驱动、Docker、容器工具包和 NGC 的设置请求路由到 references/setup.md
  • 将 GPU 兼容性、部署就绪性和容器健康检查路由到 references/deployment-readiness-checks.md
  • 将 ASR、TTS、NMT 的模型选择路由到 references/model-selection.md
  • 将 Parakeet、Canary、Whisper 和 Nemotron ASR 流式的 ASR 部署或推理路由到 references/asr.md
  • 将自定义训练的 NeMo ASR 部署(.nemo → RMIR → NIM)路由到 references/asr-custom.md
  • 将 VAD、说话人分离、语言模型和 chunk 大小的 ASR 流水线配置路由到 references/pipelines.md
  • 将 Magpie 的 TTS 部署或推理路由到 references/tts.md
  • 将自定义或微调 TTS 模型部署(.nemo → RMIR → NIM)路由到 references/tts-custom.md
  • 将 TTS 合成流水线配置(SSML、零样本声音克隆、应用现有发音词典、音频编码、采样率、custom_configuration 键)路由到 references/tts-pipelines.md(若要发现并构建发音本身,请使用 tts-pronunciation.md。)
  • 将 TTS 发音发现——查找、测试和应用特定单词或短语的 IPA 发音——路由到 references/tts-pronunciation.md
  • 将 Riva Translate、语言对和 DNT 标签的 NMT 部署或推理路由到 references/nmt.md

事实来源

对于每个发布版本的详细信息——当前模型目录、容器 ID、函数 ID、语音列表、最小显存、按模型的功能支持——请获取或打开 NVIDIA 官方文档,而不是依赖本 SKILL.md 或参考文件中的文字。每个参考文件都包含指向相关文档页面的路由表。

顶层登陆页面:

主题 URL
ASR 支持矩阵 https://docs.nvidia.com/nim/speech/latest/reference/support-matrix/asr.html
TTS 支持矩阵 https://docs.nvidia.com/nim/speech/latest/reference/support-matrix/tts.html
NMT 支持矩阵 https://docs.nvidia.com/nim/speech/latest/reference/support-matrix/nmt.html
前置要求(驱动 / GPU / 操作系统) https://docs.nvidia.com/nim/speech/latest/get-started/prerequisites.html
ASR 流水线配置 https://docs.nvidia.com/nim/speech/latest/asr/customization/pipeline-configuration.html
ASR 运行时定制 https://docs.nvidia.com/nim/speech/latest/asr/customization/customization.html
TTS 自定义部署(.nemo / .rivariva-build、RMIR) https://docs.nvidia.com/nim/speech/latest/tts/custom-deployment.html
TTS 请求时定制(SSML、发音词典、custom_configuration https://docs.nvidia.com/nim/speech/latest/tts/customization.html
TTS 语音和情感风格 https://docs.nvidia.com/nim/speech/latest/tts/voices.html
TTS 零样本声音克隆 https://docs.nvidia.com/nim/speech/latest/tts/voice-cloning.html
TTS IPA 音素集 https://docs.nvidia.com/nim/speech/latest/tts/phoneme-support.html
云函数 ID(按模型) https://build.nvidia.com/<org>/<model>/api
NGC 模型目录 https://catalog.ngc.nvidia.com/models

示例

“部署一个 Parakeet ASR NIM” → 加载 references/asr.md,按照选项 B(自托管)的步骤 1–4 操作。

“使用 Magpie 合成语音” → 加载 references/tts.md,按照选项 A(云)或选项 B(自托管)操作。

“将英语翻译为德语” → 加载 references/nmt.md,按照 4 步流程操作。

“将我微调后的 .nemo 转换为 NIM” → 加载 references/asr-custom.md 了解 4 阶段流水线,并加载 references/pipelines.md 了解构建时配置。

“将自定义的微调 TTS 声音部署为 NIM” → 加载 references/tts-custom.md 了解 4 阶段流水线。

“使用 Magpie 进行零样本声音克隆” → 加载 references/tts-pipelines.md

“向我的 TTS 请求添加 SSML 强调标记” → 加载 references/tts-pipelines.md

“‘NVIDIA’ 在我的 Magpie TTS 输出中发音不对——建议几个 IPA 选项进行测试” → 加载 references/tts-pronunciation.md,生成 IPA 候选方案,合成变体,然后输出全部三种交付格式。

“如何通过 gRPC Python 中的 custom_dictionary 修复 Riva TTS 中 ‘NIM’ 的发音?” → 加载 references/tts-pronunciation.md,为“NIM”提供 IPA,展示线格式和 gRPC 示例。

“我的 GPU 能运行这个吗?” → 加载 references/deployment-readiness-checks.md 并运行 6 步系统检查。

“我应该使用哪个 Riva 模型?” → 加载 references/model-selection.md,应用决策框架,然后获取具体当前模型名称的支持矩阵。

命名与术语

  • 技能品牌:Nemotron Speech(对外名称)。
  • 保留内部命名:命令(riva-buildriva-deployriva_streaming_asr_client)、Python 客户端(riva.client)、gRPC 命名空间(nvidia.riva.asr.*)、容器仓库(nvcr.io/nim/nvidia/*)以及所有 NVIDIA 文档 URL 仍使用 “Riva”。请勿在代码、命令或文档中重命名这些名称。

故障排除

对于特定任务或模态的运行时问题,请使用相应的参考文件(references/<task>.md)。跨领域的就绪检查:

限制条件

  • 仅支持 x86_64 架构 —— Windows 上的 WSL2 需要使用 Podman,且仅支持一部分 NIM(见 references/setup.md
  • 自托管部署需要 NVIDIA AI Enterprise 许可
  • 云托管推理需要有效的 NVIDIA_API_KEY 和互联网访问
  • 公共技能品牌为 “Nemotron Speech”;命令、容器镜像、Python 导入(riva.client)、gRPC 服务(nvidia.riva.*)以及 NVIDIA 文档 URL 仍使用 “Riva” —— 请遵循官方文档和目录进行命名,不要在这些命令或代码中重命名

后续步骤