跳到主内容
@wquguru
精选75Hugging Face 每日论文(json_list)论文研究

ASR模型基准优化量化研究:高得分模型存在过拟合行为

Towards Quantifying Benchmark Optimization in ASR Models

原文
发到 X

公开基准是衡量自动语音识别(ASR)模型能力的重要指标。然而,由于其公开性质,存在模型针对这些基准进行优化的风险,而这些优化方式可能无法很好地泛化到真实世界的数据中。我们提出了一种量化基准优化的方法,重点关注音频信息不足以确定参考转录文本的情况。我们确定了三类行为探针,用于揭示模型在音频信息不足的情况下仍能复现基准参考片段的能力:参考不一致性、掩码数字恢复和正字法切换。我们发现,得分最高的开源模型即使在相关音频相互矛盾、被掩码或存在歧义时,也会逐字输出参考转录片段。通过多种机制探针,我们表明模型会响应细微的声学线索,从而覆盖对音频的忠实表示,转而采用一种针对基准优化的策略。我们展示了基准优化行为可以通过低秩线性引导或在某些情况下简单地在段末附加音频来进行因果操纵。总体而言,我们的结果表明,高性能模型表现出受基准条件影响的行为,这可能会虚高基准性能,而并未反映通用转录能力的提升。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近