摘要

我们介绍了使用神经模型的语音识别问题,强调了当输入和输出序列的长度不同时,训练和推理的CTC损失。

我们讨论了在推理过程中使用的beam搜索,以及如何使用图Transformer网络(Graph Transformer Network)在训练时对该过程进行建模。图Transformer网络基本上是带有自动微分的加权有限状态自动机,它允许我们将先验编码到图中。有不同类型的加权有限状态和不同的操作,包括并集、克林闭包、交、合成和前向得分。损失函数通常是函数之间的区别。我们可以很容易地实现这些网络使用GTN库。

地址:

https://atcold.github.io/NYU-DLSP21/en/week11/11/

成为VIP会员查看完整内容
33

相关内容

语音识别是计算机科学和计算语言学的一个跨学科子领域,它发展了一些方法和技术,使计算机可以将口语识别和翻译成文本。 它也被称为自动语音识别(ASR),计算机语音识别或语音转文本(STT)。它整合了计算机科学,语言学和计算机工程领域的知识和研究。
【NAACL2021】长序列自然语言处理, 250页ppt
专知会员服务
62+阅读 · 2021年6月7日
专知会员服务
34+阅读 · 2021年5月12日
专知会员服务
45+阅读 · 2020年3月6日
【NeurIPS2019】图变换网络:Graph Transformer Network
深度学习的下一步:Transformer和注意力机制
云头条
56+阅读 · 2019年9月14日
使用RNN-Transducer进行语音识别建模【附PPT与视频资料】
人工智能前沿讲习班
74+阅读 · 2019年1月29日
【学生论坛】详解记忆增强神经网络
中国科学院自动化研究所
104+阅读 · 2018年11月15日
谷歌官方:反向传播算法图解
新智元
9+阅读 · 2018年6月29日
Yann LeCun爆惊人言论:深度学习已死?
雷锋网
7+阅读 · 2018年1月7日
如何用 RNN 实现语音识别?| 分享总结
AI研习社
3+阅读 · 2017年12月15日
Arxiv
103+阅读 · 2021年6月8日
Arxiv
17+阅读 · 2021年3月29日
Arxiv
5+阅读 · 2021年2月8日
Arxiv
19+阅读 · 2020年12月23日
Arxiv
15+阅读 · 2020年2月5日
Neural Speech Synthesis with Transformer Network
Arxiv
5+阅读 · 2019年1月30日
Arxiv
3+阅读 · 2017年11月21日
VIP会员
相关资讯
【NeurIPS2019】图变换网络:Graph Transformer Network
深度学习的下一步:Transformer和注意力机制
云头条
56+阅读 · 2019年9月14日
使用RNN-Transducer进行语音识别建模【附PPT与视频资料】
人工智能前沿讲习班
74+阅读 · 2019年1月29日
【学生论坛】详解记忆增强神经网络
中国科学院自动化研究所
104+阅读 · 2018年11月15日
谷歌官方:反向传播算法图解
新智元
9+阅读 · 2018年6月29日
Yann LeCun爆惊人言论:深度学习已死?
雷锋网
7+阅读 · 2018年1月7日
如何用 RNN 实现语音识别?| 分享总结
AI研习社
3+阅读 · 2017年12月15日
相关论文
Arxiv
103+阅读 · 2021年6月8日
Arxiv
17+阅读 · 2021年3月29日
Arxiv
5+阅读 · 2021年2月8日
Arxiv
19+阅读 · 2020年12月23日
Arxiv
15+阅读 · 2020年2月5日
Neural Speech Synthesis with Transformer Network
Arxiv
5+阅读 · 2019年1月30日
Arxiv
3+阅读 · 2017年11月21日
微信扫码咨询专知VIP会员