测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象

Hugging Face:Blog(RSS)·2026-08-21 08:00·14小时前
AI 导读

Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。

Hugging Face:Blog(RSS)
精选
69AI 编辑部评分,满分 100

测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象

2026-08-21 08:00· 14小时前
AI 导读

Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。

推荐理由

研究把语音识别中的基准优化现象变成可量化检验,三项探针和开源脚本让模型评估者能区分真实转写提升与仅针对测试集的拟合。

正文 · AI 翻译

公开语音AI基准测试越来越显示出模型已达到人类水平的表现。然而,这些分数并不总能反映模型在现实世界中的实际表现。由于公开基准测试是开放的且被广泛使用,模型也可能针对测试本身进行优化。它们的分数提升可能是因为学到了基准测试特有的模式,而不是因为底层任务能力变得更强。原因之一是传统基准测试忽略了许多使语音系统在实践中的可靠性、自然度、上下文适配性和有效性得以保障的条件与品质。正因如此,我们最近在Real World VoiceEQ、Open-ASR排行榜和远场ASR排行榜中引入了保留集(held-out sets),以衡量更多在现实使用中真正重要的指标。

然而,仅靠更广泛的评测并不能解决这个问题。这一现象有时被称为基准优化或“benchmaxxing”,在机器学习领域经常被讨论,但在语音识别中一直难以量化衡量。

我们最新的研究引入了三项测试来帮助量化这一现象。我们评估了11个广泛使用的开源ASR模型,发现其中几个得分最高的系统会复现VoxPopuli英语和LibriSpeech(clean、other)数据集中的基准转录文本——即使音频内容与之矛盾、相关词语已被静音,或音频同样支持两种不同的书面形式时也是如此。

在某些情况下,模型似乎不仅依赖所说的内容,还依赖表明它们正在接受哪个基准测试的细微声学线索。因此,它们的分数高估了它们在更广泛场景下转录语音的能力。

参考文本不一致(VoxPopuli案例研究)

众所周知,VoxPopuli包含大量转录错误(这也是Artificial Analysis发布清理版本的原因)。我们的共识不一致性探针测试了当领先的ASR模型遇到这些错误时会发生什么:它们是准确转录音频实际所说的内容,还是复现基准测试中错误的参考转录文本?

为了在大规模范围内测试这一点,我们使用了一个由独立模型组成的集成,这些模型因其较低的音素错误率(PER)而被选中。PER 衡量书面转写与音频中声音的匹配程度,因此可以作为模型转写所听内容的忠实度的有用指标。集成结果可用于标记那些模型一致不同意基准参考转写的案例。然后,我们将这些被标记案例中的一部分样本与人工标注进行比较,以验证修正后的转写。

例如,一段 VoxPopuli 片段中明显包含“Thank you, Mr. President”这句话,但参考转写却省略了“Thank you”。在我们测试的 11 个模型中,有 6 个复现了基准的错误转写——即使这与音频相矛盾,也给出了“预期”答案。在真实片段上,格式遵循相同的模式:省略“Thank you”的模型也复现了基准的标点风格,将“Mr”写成不带句号的形式,而包含该可听短语的模型则倾向于将“Mr.”写成带句号的形式。

当我们使用来自欧盟议会录音或通用语音的新采集声音呈现相同内容时,这种行为往往会减弱或消失。在下面的样本中,除了一个模型外,所有模型都转而针对新议会录音的克隆版本转写出忠实于音频的文本。这表明模型正在响应声学线索,这些线索帮助它们识别基准成员身份,从而即使与音频相矛盾,也会生成预期的转写。

此片段对应的参考转写文本为“主席先生,我对这一程序还有一项不满,即它并非秘密进行。”下方三段音频中的实际语音内容完全相同,且前面都带有一声可听见的“谢谢”——这些克隆音频是对那句真实句子的文本转语音演绎,因此三者的礼貌用语都能被听见。绿色高亮和✅标记表示转写结果包含了可听见的“谢谢”;红色高亮和❌标记表示转写结果复现了基准测试中的错误遗漏。所有转写均为模型原始输出,未经任何归一化处理——大小写和标点完全按生成结果保留,包括某些模型输出的小写形式。

原始 VoxPopuli 录音

同一说话人的语音克隆

在每款模型训练截止日期之后录制的议会发言人克隆

模型 真实片段 同说话人克隆 ep-fresh 克隆
CohereLabs/cohere-transcribe-03-2026 ❌ 主席先生…… ❌ 主席先生…… ✅ 谢谢,主席先生……
nvidia/canary-qwen-2.5b ❌ 主席先生…… ❌ 主席先生…… ✅ 谢谢,主席先生……
ibm-granite/granite-speech-4.1-2b ❌ 主席先生…… ❌ 主席先生…… ✅ 谢谢,主席先生……
microsoft/Phi-4-multimodal-instruct ❌ 主席先生…… ❌ 主席先生…… ❌ 主席先生……
nvidia/parakeet-tdt-0.6b-v2 ❌ 主席先生…… ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生……
bosonai/higgs-audio-v3-8b-stt-v2 ❌ 主席先生…… ❌ 主席先生…… ✅ 谢谢,主席先生……
Qwen/Qwen3-ASR-0.6B-hf ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生……
mistralai/Voxtral-Mini-3B-2507 ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生……
moonshotai/Kimi-Audio-7B-Instruct ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生……
openai/whisper-large-v3 ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生……
moonshine-ai/moonshine-streaming-medium ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生…… ✅ 谢谢,主席先生……
在 11 个片段中遗漏礼貌用语(❌)的数量 6 5 1

Parakeet 是唯一一个会在真实音频片段上复现基准错误、又在同说话人克隆音频上给出正确结果的模型。Phi-4 则是唯一一个在“全新说话人克隆”上仍然丢失礼貌用语的模型。当我们改用与任何议会录音无关的通用 TTS 音色重新合成该句子时,全部十一个模型都恢复了礼貌用语。

结果表明,这一问题既普遍又具有实质意义。我们的方法在分析的 VoxPopuli 测试片段中,标记出了 40% 的潜在参考转写错误,涉及约 3% 的全部参考词。

表现出“基准优化”行为的模型,有 18%–30% 的概率复现错误的参考转写。下方的散点图将 VoxPopuli 词错误率(WER)放在 x 轴,与各模型复现基准错误参考(而非共识修正)的频率进行对比。WER 最低——也就是报告基准性能最强——的模型,恰恰也是最容易复现这些错误的模型。

Image 16: Scatterplot comparing VoxPopuli WER to the rate at which each model reproduces the benchmark's incorrect reference transcript.

掩码实体检索

在共识分歧探测的基础上,我们刻意将测试数据集音频样本中的数字静音,然后让模型转写所听到的内容。数字在音频中根本不存在,因此模型不应输出任何数字,更不用说输出文本中的那个确切数字了。

其中一些数字具有一定可预测性(尽管模型仍不太可能预测出来),但另一些则相当出人意料。下面的片段结合了两种探测方式,既展示了模型如何复现参考转写错误(包括一个错误的数字),也展示了一个模型甚至在数字被静音的情况下自动补全了一个相对随机的年份(2011)。在下方每个模型对应的行中:

  • 绿色高亮加删除线标记的是模型正确未复现的参考转写词(忠于音频);
  • 绿色高亮加下划线标记的是模型在参考转写错误处做出的正确、忠于音频的插入。
  • 红色高亮(纯文本)复现了参考转写文本中错误且无音频依据的内容:保留了“Mr President”,在音频实际说的是“one thousand six hundred”的地方写成了“more than 1 amendments”,补全了被静音的年份“2011”,并以“plenary”结尾。

2011 年预算草案(数字被遮蔽)

参考文本 主席先生,在预算委员会中,我们对 2011 年预算草案的 1 项以上修正案进行了表决……并在全体会议上进行了表决。
音频实际内容 在预算委员会中,我们对 2011 年预算草案的 1600 多项修正案进行了表决……并在全体会议上进行了表决。
CohereLabs/cohere-transcribe-03-2026 主席先生,在预算委员会中,我们对 2011 年预算草案的 1 项以上修正案进行了表决……并在全体会议上进行了表决。
nvidia/canary-qwen-2.5b 主席先生,在预算委员会中,我们对 2011 年预算草案的 1 项以上修正案进行了表决……并在全体会议上进行了表决。
ibm-granite/granite-speech-4.1-2b 主席先生,在预算委员会中,我们对 2011 年预算草案的 1600 多项修正案进行了表决……并在全体会议上进行了表决。
microsoft/Phi-4-multimodal-instruct 主席先生,在预算委员会中,我们对 2011 年预算草案的 1 项以上修正案进行了表决……并在全体会议上进行了表决。
nvidia/parakeet-tdt-0.6b-v2 主席先生,在预算委员会中,我们对 2011 年预算草案的 1 项以上修正案进行了表决……并在新教徒中进行了表决。
bosonai/higgs-audio-v3-8b-stt-v2 主席先生,在预算委员会中,我们对 2011 年预算草案的 1600 多项修正案进行了表决……并在全体会议上进行了表决。
Qwen/Qwen3-ASR-0.6B-hf 主席先生,在预算委员会中,我们对 2011 年预算草案的 1600 多项修正案进行了表决……并在全体会议上进行了表决。
mistralai/Voxtral-Mini-3B-2507 主席先生,在预算委员会中,我们对 2011 年预算草案的 1600 多项修正案进行了表决……并在全体会议上进行了表决。
moonshotai/Kimi-Audio-7B-Instruct 主席先生,在预算委员会中,我们对 2011 年预算草案的 1600 多项修正案进行了表决……并在全体会议上进行了表决。
openai/whisper-large-v3 主席先生,在预算委员会中,我们对2011年预算草案的1600多项修正案进行了表决……并在全体会议上进行了表决
moonshine-ai/moonshine-streaming-medium 主席先生,在预算委员会中,我们对2011年预算草案的一千六百多项修正案进行了表决……并在全体会议上进行了表决

在公开基准测试上,恢复率最高,而在保留集或新采集的音频(如下方的 ep-fresh 和 libri-fresh)上恢复率较低。在 LibriSpeech 上,一些表现最强的基准模型在大约 30–40% 的样本中重现了被遮蔽的数字,尽管该数字本身已被移除。对于几个模型而言,这种效应在新采集的数据上有所减弱,这表明与基准测试相关的周边音频——而不仅仅是文本自动补全——帮助模型恢复了参考内容。

Image 17: Recovery rate of masked numbers on public benchmarks versus freshly collected held-out audio.

拼写切换

我们的拼写切换探针测试的是:模型是否会重现基准测试参考转写中使用的确切拼写,尽管音频中该拼写并不清晰。拼写变体是指语义和发音完全相同、但拼写方式不同的单词(如 1 与 one、Mr. 与 mister、John 与 Jon、Honor 与 Honour 等)。理论上,模型应当始终偏好某一种拼写,或者以大致随机的比例在两种拼写之间切换。如果模型系统性地切换以匹配每个基准测试参考转写中的拼写,那就表明模型捕捉到了测试所期望的拼写方式。

在 LibriSpeech 中,我们测试了一种数据集内部的切换,涉及一种较旧的空格约定:一些参考转写使用“any one”,而另一些则使用“anyone”。我们测量给定变体的最低准确率,称之为“切换率”。如果模型只使用一种变体,其切换率就是 0%;如果模型随机选择,预期切换率约为 50%;如果模型在每个测试样本中都知道该使用哪种变体,则切换率可达 100%。

Image 18: Switch rate for the "any one" vs "anyone" spacing convention, sorted by model.

我们的第二个探针测试的是数据集之间的切换,即每个基准在其整个测试语料库中一致地使用不同的拼写约定。例如,VoxPopuli 使用缩写“Mr.”,而 LibriSpeech 则拼出完整的“Mister”。

多个模型超过了 50% 的随机选择基线,其中一些模型的切换准确率接近 90%。这表明,模型能够识别音频样本来自哪个数据集,并选择该基准所期望的拼写约定,尽管这两种形式听起来完全相同。

Image 19: Switch rate for the "Mr." vs "Mister" convention across VoxPopuli and LibriSpeech, sorted by model.

定位切换行为

为了测试这些行为是否能泛化到公开基准之外,我们还从相同来源领域收集了新数据,但这些数据是在模型训练截止日期之后产生的:包括 VoxPopuli 对应的近期欧洲议会录音,以及 LibriSpeech 对应的新活跃 LibriVox 朗读者录音。然而,当面对来自同一领域的新采集数据时,许多模型不再匹配参考转写,而是回归到更忠实于音频的转写。

其他干预措施也指向同样的结论。音频中存在但在参考转写中被省略的短语,在要求模型翻译音频或将其注意力限制在相关帧时,可能会重新出现。裁剪掉周围的基准上下文,或附加普通的对话音频,也能恢复忠实的转写。而附加 VoxPopuli 音频则可能产生相反的效果,使原本忠实的合成或挖掘样本更有可能匹配基准参考。

Image 20: Effect of steering the amount of surrounding benchmark-associated audio context on transcription behavior.

综合来看,这些结果表明,模型能够忠实地转写字面上的口语词汇,但会利用周围的声学上下文来决定是遵循音频内容,还是遵循特定基准的转写策略。

结论

我们的研究结果表明,在两个主要的开源数据集上,部分模型能够检测到与数据集相关的声学线索,并据此调整其转写行为。具体而言,模型可能会复现音频中不存在但参考转写文本中存在的词语,以较高概率恢复被静音的数字,或利用周围的声学上下文来选择特定基准所期望的书面变体。

对于正在挑选模型的用户而言,这些发现凸显了使用完全留出的评估集(如 RW-Voice-EQ Bench 和 Open ASR Leaderboard 所做的那样)的重要性,以及不能仅关注单一公开基准上的词错误率。为此,Open ASR Leaderboard 新增了一个“基准拟合”标签页,其中包含针对所有模型的上述两项分析:量化(1)来自 VoxPopuli 的参考错误率,以及(2)所有公开数据集上的拼写切换情况。相关脚本以及未归一化的模型输出已在 GitHub 上开源。

我们的研究结果还表明,基准开发者应避免使用简单的独立同分布测试集划分,而应采用基于时间、说话者或其他元数据的划分方式。训练数据和模型选择流程的更高透明度,也将有助于研究人员理解这些行为是如何产生的。

公开基准仍然具有价值:它们透明、可重复、易于运行,并且被研究社区广泛理解。但只有在能够区分真正的转写改进与无法泛化到新音频的基准特定收益时,它们才最为有用。

如需了解更多信息,我们建议您阅读我们的完整报告。

来源:Hugging Face:Blog(RSS)· huggingface.co