临床语音识别评估Skill "digital-health-clinical-asr-eval"

该技能用于对临床ASR语音识别任务生成的NeMo清单(manifest)进行自动评分与路由。它调用NVIDIA ASR NIM转写音频,计算WER/CER/KER/SER四项指标,按entity_category、ipa_source、noise_level等维度输出五部分KER排行榜,并根据评估结果决定后续操作(微调或返回构建)。关键词:临床语音识别、ASR评估、KER、WER、排行榜、NeMo、Parakeet、医疗语音、语音识别评测。

临床语音 0 次安装 1 次浏览 更新于 9/6/2026

临床ASR飞轮 — 阶段3(评估)

⚠ Agent: 回答前请阅读核心工作流规则。SKILL.md 为自包含文件,evals/references/assets/ 均为指针而非关键内容。

你是评分与路由阶段。用户提供一个 NeMo 格式的 manifest.jsonl,你通过所选 ASR NIM 进行转写,计算四项指标,生成五部分排行榜,并根据决策树决定进入微调、返回构建还是停止强化评估。

音频离开环境提示

将每个音频片段及文本发送至外部 NVIDIA 服务,需提前告知用户。不得传送真实患者数据或 PHI。

核心工作流规则

  1. 先走离场旁路:非评分范围问题,路由至相应技能并停止。
  2. 默认 ASR NIM:nvidia/parakeet-tdt-0.6b-v2,函数 ID d3fe9151-442b-4204-a70d-5fcc597fd610
  3. ASR 转写在步骤 3b 内联,认证等详见 /riva-asr
  4. KER 是头条指标,关键词必须连续、有序出现。
  5. ipa_source 的拆分为排行榜最重要的信息。
  6. merriam-webster 好而 magpie_g2p 差时,属于发音覆盖缺口,返回 build,不应微调。
  7. 排行榜顺序:头条 → entity_category → ipa_source → noise_level → 逐术语 KER。

操作步骤

  • 3a 选择 ASR NIM,并回显所选模型及函数 ID。
  • 3b 转写,生成 per_sample.json
  • 3c 计算 WER / CER / KER / SER,规范化后做严格 KER。
  • 3d 生成五部分 Markdown 排行榜。

决策树

  • KER > 0.3 → 进入微调技能。
  • KER 0.1–0.3 → 首次评估先扩展术语集,或在后续评估中微调。
  • KER < 0.1 → 评估已饱和,应强化评估难度并返回构建。
  • 特殊情况:ipa_source 差距大 → 返回 build 步骤 2d 检查 IPA 覆盖。

示例与故障排除

场景A/B 分别展示首次评分与混合结果路由。故障排除涵盖 manifest 缺失、KER 恒高/恒低、噪声鲁棒性等问题,并注明横向路由。

局限性与后续

默认英文、严格 KER 保守、单模型单次运行。后续可转向微调或返回构建。