CoLT5: 使用条件计算加速长距离Transformer (CoLT5: Faster Long-Range Transformers with Conditional Computation) - 专知论文

会员服务 ·

0

国际学习理论会议 · 条件计算 · 计算加速 · 前馈 · 变换 ·

2023 年 4 月 14 日

CoLT5: Faster Long-Range Transformers with Conditional Computation

翻译：CoLT5: 使用条件计算加速长距离Transformer

Joshua Ainslie,Tao Lei,Michiel de Jong,Santiago Ontañón,Siddhartha Brahma,Yury Zemlyanskiy,David Uthus,Mandy Guo,James Lee-Thorp,Yi Tay,Yun-Hsuan Sung,Sumit Sanghai

from arxiv, Added CoDA reference and minor edits to clarify routing

Many natural language processing tasks benefit from long inputs, but processing long documents with Transformers is expensive -- not only due to quadratic attention complexity but also from applying feedforward and projection layers to every token. However, not all tokens are equally important, especially for longer documents. We propose CoLT5, a long-input Transformer model that builds on this intuition by employing conditional computation, devoting more resources to important tokens in both feedforward and attention layers. We show that CoLT5 achieves stronger performance than LongT5 with much faster training and inference, achieving SOTA on the long-input SCROLLS benchmark. Moreover, CoLT5 can effectively and tractably make use of extremely long inputs, showing strong gains up to 64k input length.

翻译：许多自然语言处理任务受益于长输入，但使用Transformer处理长文档是昂贵的--不仅由于二次注意复杂度，也由于对每个标记应用前馈和投影层。然而，并非所有标记在长文档中都同等重要，特别是对于较长的文档。我们提出CoLT5，一种长输入Transformer模型，通过使用条件计算，将更多资源投入到前馈和注意力层中的重要标记上。我们展示CoLT5比LongT5拥有更强的性能，同时具有更快的训练和推理速度，在长输入SCROLLS基准测试中实现SOTA。此外，CoLT5能够有效而易于跟踪地使用极长的输入，在64k输入长度的情况下表现出强大的增益。

0

相关内容

国际学习理论会议

国际学习理论会议

【2022新书】高效深度学习，Efficient Deep Learning Book

【2022新书】高效深度学习，Efficient Deep Learning Book

专知会员服务

124+阅读 · 2022年4月21日

【AAAI2022】基于对比学习的预训练语言模型剪枝压缩

【AAAI2022】基于对比学习的预训练语言模型剪枝压缩

专知会员服务

28+阅读 · 2022年1月24日

【ICCV 2021 】Vision Transformer中的相对位置编码

专知会员服务

30+阅读 · 2021年7月30日

【ICML2021】PoolingFormer：具有池化注意力机制的长序列输入模型

专知会员服务

35+阅读 · 2021年7月25日

最新《Transformers模型》教程，64页ppt

最新《Transformers模型》教程，64页ppt

专知会员服务

319+阅读 · 2020年11月26日

【ICML 2020】设置LayerNorm使Transformer加速收敛

专知会员服务

16+阅读 · 2020年7月27日

【ICML2020-伯克利】反直觉！大模型重压缩提升Transformer的训练和推理效率，47页ppt

【ICML2020-伯克利】反直觉！大模型重压缩提升Transformer的训练和推理效率，47页ppt

专知会员服务

70+阅读 · 2020年7月1日

【ACL2020-亚马逊】Transformers多分辨率和多模态语音识别，Multiresolution and Multimodal Speech Recognition with Transformers

【ACL2020-亚马逊】Transformers多分辨率和多模态语音识别，Multiresolution and Multimodal Speech Recognition with Transformers

专知会员服务

15+阅读 · 2020年5月5日

【NLP模型压缩方法综述】《A Survey of Methods for Model Compression in NLP》by Madison May

【NLP模型压缩方法综述】《A Survey of Methods for Model Compression in NLP》by Madison May

专知会员服务

43+阅读 · 2020年4月22日

Auto-Sizing the Transformer Network: Improving Speed, Efficiency, and Performance for Low-Resource Machine Translation

Auto-Sizing the Transformer Network: Improving Speed, Efficiency, and Performance for Low-Resource Machine Translation

专知会员服务

49+阅读 · 2019年10月17日

GNN 新基准！Long Range Graph Benchmark

GNN 新基准！Long Range Graph Benchmark

图与推荐

0+阅读 · 2022年10月18日

命名实体识别新SOTA：改进Transformer模型

命名实体识别新SOTA：改进Transformer模型

AI科技评论

17+阅读 · 2019年11月26日

BERT/Transformer/迁移学习NLP资源大列表

BERT/Transformer/迁移学习NLP资源大列表

专知

19+阅读 · 2019年6月9日

Hierarchically Structured Meta-learning

Hierarchically Structured Meta-learning

CreateAMind

27+阅读 · 2019年5月22日

强化学习的Unsupervised Meta-Learning

强化学习的Unsupervised Meta-Learning

CreateAMind

18+阅读 · 2019年1月7日

Unsupervised Learning via Meta-Learning

Unsupervised Learning via Meta-Learning

CreateAMind

42+阅读 · 2019年1月3日

A Technical Overview of AI & ML in 2018 & Trends for 2019

A Technical Overview of AI & ML in 2018 & Trends for 2019

待字闺中

17+阅读 · 2018年12月24日

谷歌发表的史上最强NLP模型BERT的官方代码和预训练模型可以下载了

谷歌发表的史上最强NLP模型BERT的官方代码和预训练模型可以下载了

AINLP

12+阅读 · 2018年11月1日

disentangled-representation-papers

disentangled-representation-papers

CreateAMind

26+阅读 · 2018年9月12日

【推荐】RNN/LSTM时序预测

【推荐】RNN/LSTM时序预测

机器学习研究会

25+阅读 · 2017年9月8日

基于冗余结构的自适应容错并联机器人设计理论研究

国家自然科学基金

1+阅读 · 2015年12月31日

罗巴代数的表示和罗巴代数在operad中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

非光滑 Lipschitz 连续函数优化束方法与应用

国家自然科学基金

0+阅读 · 2013年12月31日

一些q-特殊函数的研究

国家自然科学基金

0+阅读 · 2012年12月31日

具有c-Met抑制作用的新型哒嗪酮类化合物的设计、合成及其在抗肿瘤方面的研究

国家自然科学基金

0+阅读 · 2012年12月31日

可压缩流动的二阶精度大时间步长、高分辨率差分格式研究及其验证

国家自然科学基金

0+阅读 · 2012年12月31日

有限时间时滞混沌同步及其FPGA 实现

国家自然科学基金

0+阅读 · 2012年12月31日

函数域中的Vinogradov中值定理

国家自然科学基金

0+阅读 · 2012年12月31日

欠驱动航天器的姿态动力学与控制问题研究

国家自然科学基金

0+阅读 · 2009年12月31日

约化群酉表示的branching law及其应用

国家自然科学基金

0+阅读 · 2009年12月31日

Data-OOB: Out-of-bag Estimate as a Simple and Efficient Data Value

Arxiv

0+阅读 · 2023年6月1日

Attention-Based Methods For Audio Question Answering

Arxiv

0+阅读 · 2023年5月31日

Simple yet Effective Code-Switching Language Identification with Multitask Pre-Training and Transfer Learning

Arxiv

0+阅读 · 2023年5月31日

The Impact of Positional Encoding on Length Generalization in Transformers

Arxiv

0+阅读 · 2023年5月31日

Learning without Forgetting for Vision-Language Models

Arxiv

0+阅读 · 2023年5月30日

Jointly Reparametrized Multi-Layer Adaptation for Efficient and Private Tuning

Arxiv

0+阅读 · 2023年5月30日

Rank-adaptive spectral pruning of convolutional layers during training

Arxiv

0+阅读 · 2023年5月30日

DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes

Arxiv

0+阅读 · 2023年5月29日

Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes

Arxiv

22+阅读 · 2023年5月3日

TinyBERT: Distilling BERT for Natural Language Understanding

TinyBERT: Distilling BERT for Natural Language Understanding

Arxiv

11+阅读 · 2019年9月23日

VIP会员

文章信息

相关主题

国际学习理论会议

相关VIP内容

【2022新书】高效深度学习，Efficient Deep Learning Book

【2022新书】高效深度学习，Efficient Deep Learning Book

专知会员服务

124+阅读 · 2022年4月21日

【AAAI2022】基于对比学习的预训练语言模型剪枝压缩

【AAAI2022】基于对比学习的预训练语言模型剪枝压缩

专知会员服务

28+阅读 · 2022年1月24日

【ICCV 2021 】Vision Transformer中的相对位置编码

专知会员服务

30+阅读 · 2021年7月30日

【ICML2021】PoolingFormer：具有池化注意力机制的长序列输入模型

专知会员服务

35+阅读 · 2021年7月25日

最新《Transformers模型》教程，64页ppt

最新《Transformers模型》教程，64页ppt

专知会员服务

319+阅读 · 2020年11月26日

【ICML 2020】设置LayerNorm使Transformer加速收敛

专知会员服务

16+阅读 · 2020年7月27日

【ICML2020-伯克利】反直觉！大模型重压缩提升Transformer的训练和推理效率，47页ppt

【ICML2020-伯克利】反直觉！大模型重压缩提升Transformer的训练和推理效率，47页ppt

专知会员服务

70+阅读 · 2020年7月1日

【ACL2020-亚马逊】Transformers多分辨率和多模态语音识别，Multiresolution and Multimodal Speech Recognition with Transformers

【ACL2020-亚马逊】Transformers多分辨率和多模态语音识别，Multiresolution and Multimodal Speech Recognition with Transformers

专知会员服务

15+阅读 · 2020年5月5日

【NLP模型压缩方法综述】《A Survey of Methods for Model Compression in NLP》by Madison May

【NLP模型压缩方法综述】《A Survey of Methods for Model Compression in NLP》by Madison May

专知会员服务

43+阅读 · 2020年4月22日

Auto-Sizing the Transformer Network: Improving Speed, Efficiency, and Performance for Low-Resource Machine Translation

Auto-Sizing the Transformer Network: Improving Speed, Efficiency, and Performance for Low-Resource Machine Translation

专知会员服务

49+阅读 · 2019年10月17日

热门VIP内容

开通专知VIP会员享更多权益服务

【CVPR2025】ShotAdapter：基于扩散模型的文本生成多镜头视频方法

空间智能研究报告

中文版 | 美陆军信息收集操作员工具（OPTIC）：以安全、效率与创新重塑任务规划

大型社会模拟器：前沿与展望

相关资讯

GNN 新基准！Long Range Graph Benchmark

GNN 新基准！Long Range Graph Benchmark

图与推荐

0+阅读 · 2022年10月18日

命名实体识别新SOTA：改进Transformer模型

命名实体识别新SOTA：改进Transformer模型

AI科技评论

17+阅读 · 2019年11月26日

BERT/Transformer/迁移学习NLP资源大列表

BERT/Transformer/迁移学习NLP资源大列表

专知

19+阅读 · 2019年6月9日

Hierarchically Structured Meta-learning

Hierarchically Structured Meta-learning

CreateAMind

27+阅读 · 2019年5月22日

强化学习的Unsupervised Meta-Learning

强化学习的Unsupervised Meta-Learning

CreateAMind

18+阅读 · 2019年1月7日

Unsupervised Learning via Meta-Learning

Unsupervised Learning via Meta-Learning

CreateAMind

42+阅读 · 2019年1月3日

A Technical Overview of AI & ML in 2018 & Trends for 2019

A Technical Overview of AI & ML in 2018 & Trends for 2019

待字闺中

17+阅读 · 2018年12月24日

谷歌发表的史上最强NLP模型BERT的官方代码和预训练模型可以下载了

谷歌发表的史上最强NLP模型BERT的官方代码和预训练模型可以下载了

AINLP

12+阅读 · 2018年11月1日

disentangled-representation-papers

disentangled-representation-papers

CreateAMind

26+阅读 · 2018年9月12日

【推荐】RNN/LSTM时序预测

【推荐】RNN/LSTM时序预测

机器学习研究会

25+阅读 · 2017年9月8日

相关论文

Data-OOB: Out-of-bag Estimate as a Simple and Efficient Data Value

Arxiv

0+阅读 · 2023年6月1日

Attention-Based Methods For Audio Question Answering

Arxiv

0+阅读 · 2023年5月31日

Simple yet Effective Code-Switching Language Identification with Multitask Pre-Training and Transfer Learning

Arxiv

0+阅读 · 2023年5月31日

The Impact of Positional Encoding on Length Generalization in Transformers

Arxiv

0+阅读 · 2023年5月31日

Learning without Forgetting for Vision-Language Models

Arxiv

0+阅读 · 2023年5月30日

Jointly Reparametrized Multi-Layer Adaptation for Efficient and Private Tuning

Arxiv

0+阅读 · 2023年5月30日

Rank-adaptive spectral pruning of convolutional layers during training

Arxiv

0+阅读 · 2023年5月30日

DeCoR: Defy Knowledge Forgetting by Predicting Earlier Audio Codes

Arxiv

0+阅读 · 2023年5月29日

Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes

Arxiv

22+阅读 · 2023年5月3日

TinyBERT: Distilling BERT for Natural Language Understanding

TinyBERT: Distilling BERT for Natural Language Understanding

Arxiv

11+阅读 · 2019年9月23日

相关基金

基于冗余结构的自适应容错并联机器人设计理论研究

国家自然科学基金

1+阅读 · 2015年12月31日

罗巴代数的表示和罗巴代数在operad中的应用

国家自然科学基金

0+阅读 · 2015年12月31日

非光滑 Lipschitz 连续函数优化束方法与应用

国家自然科学基金

0+阅读 · 2013年12月31日

一些q-特殊函数的研究

国家自然科学基金

0+阅读 · 2012年12月31日

具有c-Met抑制作用的新型哒嗪酮类化合物的设计、合成及其在抗肿瘤方面的研究

国家自然科学基金

0+阅读 · 2012年12月31日

可压缩流动的二阶精度大时间步长、高分辨率差分格式研究及其验证

国家自然科学基金

0+阅读 · 2012年12月31日

有限时间时滞混沌同步及其FPGA 实现

国家自然科学基金

0+阅读 · 2012年12月31日

函数域中的Vinogradov中值定理

国家自然科学基金

0+阅读 · 2012年12月31日

欠驱动航天器的姿态动力学与控制问题研究

国家自然科学基金

0+阅读 · 2009年12月31日

约化群酉表示的branching law及其应用

国家自然科学基金

0+阅读 · 2009年12月31日

微信扫码咨询专知VIP会员