人人都能用的多语种大模型来了！支持59种语言，参数1760亿，1000名科学家联合发起

会员服务 ·

人人都能用的多语种大模型来了！支持59种语言，参数1760亿，1000名科学家联合发起

2022 年 7 月 20 日 量子位

丰色发自凹非寺
量子位 | 公众号 QbitAI

一直以来，很多大模型都由造它们出来的大型私营科技公司垄断着。

比如GPT-3等，对于普通人来说，再香也只能眼巴巴看着。

不过现在，为了给你解馋，由近1000名科学家联合发起的一个志愿项目，耗时一年多炼出了一个号称和GPT-3一样强大的语言模型。

它的名字叫BLOOM，参数1760亿，不光支持英文或者中文，连西班牙语、法语等59种语言都支持，是目前最大的多语言开源语言模型。

是的，从现在起，从代码到数据集，BLOOM全部对外开放，所有人都可使用。

动用法国超算、花费384块A100

BLOOM是一个BigScience项目，去年5月启动，由Hugging Face主导，收到了700万美元的公共捐款。

共有来自全球60个国家、超过250个机构，以及超过1000名研究人员参与其中，其中包括以个人名义参加的Meta、谷歌等大厂员工。

它的训练在法国超级计算机Jean Zay上进行，共花费了384块A100 GPU，其中每块有80 GB内存，训练吞吐量约150 TFLOP（该超算由低碳的核能提供动力，释放的热量还用来给学校供暖）。

相关推特账号从3月14日起，每天记录BLOOM的进度。

随着进度条渐渐拉满，每天去点赞的人数也越来越多。

不过，到了102%它才正式停下——

7月2号，耗时117天的BLOOM宣告完成，恰好在预期计划时间内。

最终，BLOOM：

拥有1760亿参数，比GPT-3还多10亿
包含70层，每层112个注意力头
token序列长度为2048
采用GeLU激活函数
数据集共计3416亿条token（1.5TB文本数据）
支持13种编程语言、46种语言

其中，对于很多语言来说，比如法语、西班牙语和阿拉伯语等，都是首次有了自己的开源模型（有网友发现日语目前还不支持）。

此外，为了让BLOOM最后的生成结果尽可能地减少偏见，参与人员还费了不少功夫抓取到的数据还进行了一遍人工过滤。

目前，BLOOM的训练对硬件也还是有一些要求：

为了保证效果，最好是准备8块80GB或者16块40GB的的A100。

这导致只有稍微大点的团队才能用。

当然也可以选择在云上训练，最高每小时40美元。

最后，BLOOM表示还会降低使用门槛，并准备开发一个分布式系统，允许实验室在其服务器之间共享模型。

它声称自己将会成为一个模型家族，不会一劳永逸。

Hugging Face地址：
https://huggingface.co/bigscience/bloom

参考链接：
[1]https://twitter.com/evanmiltenburg/status/1546792818269732864
[2]https://techcrunch.com/2022/07/12/a-year-in-the-making-bigsciences-ai-language-model-is-finally-available/

— 完 —

「人工智能」、「智能汽车」微信社群邀你加入！

欢迎关注人工智能、智能汽车的小伙伴们加入我们，与AI从业者交流、切磋，不错过最新行业发展&技术进展。

ps.加好友请务必备注您的姓名-公司-职位哦~

点这里👇关注我，记得标星哦～

一键三连「分享」、「点赞」和「在看」

科技前沿进展日日相见~

登录查看更多

相关内容

多语种

关注 0

超视距空战的交战决策支持

专知会员服务

96+阅读 · 2022年6月23日

5400亿！谷歌「Pathways语言模型」发布，能理解做推理生成代码

专知会员服务

40+阅读 · 2022年4月5日

千亿参数！阿里清华联合推理史上最大中文多模态预训练器M6！

专知会员服务

42+阅读 · 2021年3月3日

1750亿参数！GPT-3来了！31位作者，OpenAI发布小样本学习器语言模型

专知会员服务

73+阅读 · 2020年5月30日

[华盛顿大学】微调预训练的语言模型:权重初始化、数据顺序和早期停止

专知会员服务

23+阅读 · 2019年12月15日

全球1000名科学家组成BigScience，超大NLP模型BLOOM来了！

新智元

0+阅读 · 2022年7月17日

无缝支持Hugging Face社区，Colossal-AI低成本轻松加速大模型

机器之心

2+阅读 · 2022年7月13日

众筹超算直播训练1760亿参数AI大模型，九百工程师搞开源

机器之心

0+阅读 · 2022年3月19日

「八卦炉」炼丹规模直逼人脑！清华、阿里等搞了个174万亿参数大模型

新智元

2+阅读 · 2022年3月12日

元宇宙中可跨语种交流！Meta 发布新语音模型，支持128种语言无障碍对话

THU数据派

2+阅读 · 2021年11月26日

科教纪录片《中国天文古今谈》的制作与传播

国家自然科学基金

0+阅读 · 2013年12月31日

支持大型社交网络的云存储系统

国家自然科学基金

0+阅读 · 2012年12月31日

开放式结构拓扑优化软件设计与研发

国家自然科学基金

1+阅读 · 2012年12月31日

高分辨率地球系统模式的高效并行输入/输出方法研究

国家自然科学基金

0+阅读 · 2012年12月31日

人马座A和其周围的铁的X射线辐射

国家自然科学基金

0+阅读 · 2010年12月31日

DifferSketching: How Differently Do People Sketch 3D Objects?

Arxiv

0+阅读 · 2022年9月19日

CLAIRE -- Parallelized Diffeomorphic Image Registration for Large-Scale Biomedical Imaging Applications

Arxiv

0+阅读 · 2022年9月16日

Flexible Diffusion Modeling of Long Videos

Arxiv

0+阅读 · 2022年9月15日

ÚFAL CorPipe at CRAC 2022: Effectivity of Multilingual Models for Coreference Resolution

Arxiv

0+阅读 · 2022年9月15日

已删除

Arxiv

33+阅读 · 2020年3月23日

VIP会员