跳到主内容
@wquguru
精选86Hugging Face 每日论文(json_list)模型发布/更新

VibeVoice-ASR-Streaming:首个基于LLM的流式说话人归属

VibeVoice-ASR-Streaming Technical Report

原文
发到 X
推荐理由

开源了具备流式能力的端到端语音识别模型权重,对实时Agent开发有直接参考价值,建议关注其延迟表现。

传统的基于说话人归因的自动语音识别(ASR)系统将 ASR 和说话人日记化(speaker diarization)视为两个独立的任务。最近,像 VibeVoice-ASR 这样的端到端模型将这两个任务统一在一个模型中。然而,现有的统一模型主要仍支持离线识别,难以满足实时语音助手和智能体对低延迟的要求。为了解决这个问题,我们提出了 VibeVoice-ASR-Streaming,这是首批基于大语言模型(LLM)的流式说话人归因 ASR 端到端方法之一。它将固定大小的音频块、少量前瞻音频以及之前的文本交错处理。这使得模型能够在语音到达时即时生成“谁说了什么”,而无需单独的日记化阶段。在转录准确率方面,我们的 7B 模型在五个评估集上实现了最低的平均词错误率/字符错误率(WER/CER)。在说话人归因方面,它在 13 个评估设置中的 12 个取得了最佳或并列最佳的成绩。我们发布了 1.5B 和 7B 模型的权重以及推理代码。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近