跳到主内容
@wquguru
精选88WquGuru模型发布/更新

网易有道开源实时ASR模型Confucius4-R2T2,延迟低至160ms

英语流利说那一套,已经能够被 Jev + 网易有道的实时 ASR 模型 Confucius4-R2T2 平替了,更关键的是,R2T2 和项目仓库都是开源的!!!

原文
发到 X
推荐理由

网易有道开源了具有稳定前缀特性的实时 ASR 模型,技术细节清晰且直接解决流式识别痛点,适合做语音应用的同学参考部署。

英语流利说那一套,已经能够被 Jev + 网易有道的实时 ASR 模型 Confucius4-R2T2 平替了,更关键的是,R2T2 和项目仓库都是开源的!!!

两个模型的分工其实挺好玩的🙂

R2T2 是真流式,以低至 160ms 的间隔往外吐词,而且还有个 stable prefix 的机制,已经提交的文本只增加不修改。传统流式 ASR 会来回改词,例如,I want to book 可能会变成 I want to look,给人看字幕还行,但下游要是接了另一个模型,它就得跟着反复撤销自己刚做的判断。正因为有了 R2T2 这一层创新,我们才能做到直接把识别出来的内容拿过来,计算漏读多读和错读。

再说到最近很火的 Jev,它只能在事先声明的内容里回答:是否、选一个、1–5 打分。所以项目中我们只问它文本层面的事,例如,读的是不是原文那个词、错法属于哪一类、整段意思有没有走样。之所以用 Jev,关键还是——快!

如果你有NVIDIA的卡,不妨试试本地部署一下,小显存也能跑起来,实时ASR模型+实时分类模型,效果顶尖。很适合本地部署起来,在家大声朗读练起来 👇

R2T2模型:https://huggingface.co/netease-youdao/Confucius4-R2T2 开源项目:https://github.com/wquguru/dasheng

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

关联信息,但可能不是同一事件