This paper presents our recent effort on end-to-end speaker-attributed automatic speech recognition, which jointly performs speaker counting, speech recognition and speaker identification for monaural multi-talker audio. Firstly, we thoroughly update the model architecture that was previously designed based on a long short-term memory (LSTM)-based attention encoder decoder by applying transformer architectures. Secondly, we propose a speaker deduplication mechanism to reduce speaker identification errors in highly overlapped regions. Experimental results on the LibriSpeechMix dataset shows that the transformer-based architecture is especially good at counting the speakers and that the proposed model reduces the speaker-attributed word error rate by 47% over the LSTM-based baseline. Furthermore, for the LibriCSS dataset, which consists of real recordings of overlapped speech, the proposed model achieves concatenated minimum-permutation word error rates of 11.9% and 16.3% with and without target speaker profiles, respectively, both of which are the state-of-the-art results for LibriCSS with the monaural setting.


翻译:本文介绍了我们最近在终端到终端语音自动语音识别方面的努力,该选项共同对音量计数、语音识别和音量辨别进行声调多讲者音频的语音识别。 首先,我们通过应用变压器结构,彻底更新以前根据长期短期内存(LSTM)的注意编码器解码器而设计的模型结构。第二,我们建议使用一个扩压器解调机制,以减少高度重叠区域的语音识别错误。LibriSpeechMix数据集的实验结果表明,基于变压器的架构在计数发言者方面特别出色,而且拟议的模型将发言者致词错误率比基于LSTM的基线减少47%。此外,对于包含重叠语音真实记录的LibriCSS数据集,拟议的模型可以分别将11.9%和16.3%的最低变换字错误率与目标扬声器剖面图相匹配,两者都是以寺界设置为LibriCSS的状态结果。

0
下载
关闭预览

相关内容

最新《联邦学习Federated Learning》报告,Federated Learning
专知会员服务
88+阅读 · 2020年12月2日
最新《对比监督学习》综述论文,20页pdf
专知会员服务
83+阅读 · 2020年11月5日
Python分布式计算,171页pdf,Distributed Computing with Python
专知会员服务
107+阅读 · 2020年5月3日
【Amazon】使用预先训练的Transformer模型进行数据增强
专知会员服务
56+阅读 · 2020年3月6日
【资源】语音增强资源集锦
专知
8+阅读 · 2020年7月4日
已删除
将门创投
7+阅读 · 2019年3月28日
语音顶级会议Interspeech2018接受论文列表!
专知
6+阅读 · 2018年6月10日
开源自动语音识别系统wav2letter (附实现教程)
七月在线实验室
9+阅读 · 2018年1月8日
论文共读 | Attention is All You Need
黑龙江大学自然语言处理实验室
14+阅读 · 2017年9月7日
【音乐】Attention
英语演讲视频每日一推
3+阅读 · 2017年8月22日
Arxiv
6+阅读 · 2020年4月14日
Arxiv
6+阅读 · 2019年7月11日
A Graph Auto-Encoder for Attributed Network Embedding
Phase-aware Speech Enhancement with Deep Complex U-Net
Arxiv
3+阅读 · 2018年6月19日
VIP会员
相关资讯
【资源】语音增强资源集锦
专知
8+阅读 · 2020年7月4日
已删除
将门创投
7+阅读 · 2019年3月28日
语音顶级会议Interspeech2018接受论文列表!
专知
6+阅读 · 2018年6月10日
开源自动语音识别系统wav2letter (附实现教程)
七月在线实验室
9+阅读 · 2018年1月8日
论文共读 | Attention is All You Need
黑龙江大学自然语言处理实验室
14+阅读 · 2017年9月7日
【音乐】Attention
英语演讲视频每日一推
3+阅读 · 2017年8月22日
Top
微信扫码咨询专知VIP会员