《对齐语言模型的通用和可转移对抗性攻击》CMU等2023最新论文 - 专知VIP

会员服务 ·

12

AI与军事 · 大模型 · 对抗性攻击 ·

2024 年 1 月 2 日

《对齐语言模型的通用和可转移对抗性攻击》CMU等2023最新论文

专知会员服务

专知，提供专业可信的知识分发服务，让认知协作更快更好！

由于 "开箱即用 "的大型语言模型能够生成大量令人反感的内容，因此最近的工作主要集中在调整这些模型，以防止不良内容的生成。虽然在规避这些措施方面取得了一些成功--即所谓的针对 LLM 的 "越狱"--但这些攻击需要大量的人类智慧，而且在实践中非常脆弱。自动生成对抗性提示的尝试也取得了有限的成功。在本文中，我们提出了一种简单有效的攻击方法，可使对齐的语言模型产生令人反感的行为。具体来说，我们的方法找到了一种后缀，当附加到 LLM 产生令人反感内容的各种查询中时，该后缀旨在最大限度地提高模型产生肯定回答（而不是拒绝回答）的概率。不过，我们的方法并不依赖人工工程，而是结合贪婪和基于梯度的搜索技术，自动生成这些对抗性后缀，而且还改进了过去的自动提示生成方法。

令人惊讶的是，我们发现我们的方法生成的对抗性提示具有很强的可移植性，包括可移植到黑盒、公开发布的生产型 LLM。具体来说，我们在多个提示（即询问多种不同类型的不良内容的查询）和多个模型（在我们的案例中为 Vicuna-7B 和 13B）上训练对抗性攻击后缀。这样做时，所产生的攻击后缀会在 ChatGPT、Bard 和 Claude 以及 LLaMA-2-Chat、Pythia、Falcon 等开源 LLM 的公共接口中诱发令人反感的内容。有趣的是，针对基于 GPT 的模型，这种攻击转移的成功率要高得多，这可能是由于 Vicuna 本身是根据 ChatGPT 的输出进行训练的。总之，这项工作大大推进了针对对齐语言模型的对抗性攻击的先进水平，提出了如何防止此类系统产生不良信息的重要问题。代码见 github.com/llm-attacks/llm-attacks。

图 1：对齐的 LLM 并非对抗性对齐。我们的攻击构建了一个单一的对抗提示，它能在不直接访问 ChatGPT、Claude、Bard 和 Llama-2 等最先进商业模型的情况下，持续规避这些模型的对齐。这里展示的示例都是这些系统的实际输出结果。对抗性提示可以高概率地从这些模型中诱导出任意有害行为，显示了滥用的可能性。为了实现这一目标，我们的攻击（贪婪坐标梯度）通过对多个较小的开源 LLM 进行优化，针对多种有害行为找到了这种通用和可转移的提示。第 3 节将进一步讨论这些问题，附录 B 提供了完整的未删节记录。

成为VIP会员查看完整内容

25

相关内容

AI与军事

人工智能在军事中可用于多项任务，例如目标识别、大数据处理、作战系统、网络安全、后勤运输、战争医疗、威胁和安全监测以及战斗模拟和训练。

《分析将零信任模式应用于运行技术系统的可行性和益处》2023最新83页论文

《分析将零信任模式应用于运行技术系统的可行性和益处》2023最新83页论文

专知会员服务

32+阅读 · 2023年12月1日

《预测大语言模型生成的代码转换文本的真实性》2023最新59页论文

《预测大语言模型生成的代码转换文本的真实性》2023最新59页论文

专知会员服务

28+阅读 · 2023年12月1日

《深度伪造检测模型的准确性和鲁棒性》2023最新论文

《深度伪造检测模型的准确性和鲁棒性》2023最新论文

专知会员服务

41+阅读 · 2023年10月29日

《基于对手网络基础设施发掘来实现自动威胁建模》2023最新79页论文

《基于对手网络基础设施发掘来实现自动威胁建模》2023最新79页论文

专知会员服务

32+阅读 · 2023年5月14日

《利用强化学习对深度神经网络形成对抗性样本攻击》2023最新83页论文

《利用强化学习对深度神经网络形成对抗性样本攻击》2023最新83页论文

专知会员服务

76+阅读 · 2023年5月11日

《人工智能对抗性攻击的作战可行性》美智库2022最新28页报告

《人工智能对抗性攻击的作战可行性》美智库2022最新28页报告

专知会员服务

67+阅读 · 2022年12月27日

《可解释决策算法和可问责决策算法之间的冲突》2022最新18页论文

《可解释决策算法和可问责决策算法之间的冲突》2022最新18页论文

专知会员服务

50+阅读 · 2022年11月20日

《H4rm0ny：用于规避恶意软件生成和检测的多智能体学习的竞争性两人零和马尔可夫博弈》2022最新12页论文，加拿大国防研究与发展部

《H4rm0ny：用于规避恶意软件生成和检测的多智能体学习的竞争性两人零和马尔可夫博弈》2022最新12页论文，加拿大国防研究与发展部

专知会员服务

26+阅读 · 2022年10月26日

《基于博弈论的高级持续威胁（APT）防御方法》25页最新论文

《基于博弈论的高级持续威胁（APT）防御方法》25页最新论文

专知会员服务

46+阅读 · 2022年10月8日

《基于大型知识库进行问答的非参数化上下文推理》2022最新177页博士论文，马萨诸塞大学阿默斯特分校

《基于大型知识库进行问答的非参数化上下文推理》2022最新177页博士论文，马萨诸塞大学阿默斯特分校

专知会员服务

27+阅读 · 2022年8月5日

【蜂群无人机控制关键技术】《基于深度学习进行无线电信号和协议分类以自动发现波形漏洞》2022最新102页报告，美国空军研究实验室

【蜂群无人机控制关键技术】《基于深度学习进行无线电信号和协议分类以自动发现波形漏洞》2022最新102页报告，美国空军研究实验室

专知

66+阅读 · 2022年12月3日

《重新设计反无人机系统架构》2022最新160页论文，美国海军研究生院

《重新设计反无人机系统架构》2022最新160页论文，美国海军研究生院

专知

51+阅读 · 2022年10月26日

【牛津大学博士论文】元强化学习的快速自适应，217页pdf

【牛津大学博士论文】元强化学习的快速自适应，217页pdf

专知

29+阅读 · 2022年9月19日

【经典书】网络安全《移动目标防御 II：博弈论和对抗性建模的应用》210页

【经典书】网络安全《移动目标防御 II：博弈论和对抗性建模的应用》210页

专知

17+阅读 · 2022年4月16日

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

专知

36+阅读 · 2022年2月7日

【2022新书】Transformer自然语言处理：构建语言应用

【2022新书】Transformer自然语言处理：构建语言应用

专知

38+阅读 · 2022年1月31日

最新最全《深度元学习》2021综述论文，68页pdf，A Survey of Deep Meta-Learning

最新最全《深度元学习》2021综述论文，68页pdf，A Survey of Deep Meta-Learning

专知

11+阅读 · 2021年4月23日

最新《知识驱动的文本生成》综述论文，44页pdf

最新《知识驱动的文本生成》综述论文，44页pdf

专知

25+阅读 · 2020年10月14日

最新《可解释深度学习XDL》2020研究进展综述大全，54页pdf

最新《可解释深度学习XDL》2020研究进展综述大全，54页pdf

专知

36+阅读 · 2020年5月2日

论文浅尝 | 基于多模态关联数据嵌入的知识库补全

论文浅尝 | 基于多模态关联数据嵌入的知识库补全

开放知识图谱

12+阅读 · 2018年12月13日

语义Web知识库补全关键技术研究

国家自然科学基金

14+阅读 · 2017年12月31日

基于学习的智能化漏洞挖掘关键技术研究

国家自然科学基金

6+阅读 · 2017年12月31日

基于图的半监督学习算法研究

国家自然科学基金

5+阅读 · 2015年12月31日

基于海量软件片段比对的恶意代码检测方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

可恢复的数字语音取证水印技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于云计算平台的下一代测序数据错误修正算法研究与实现

国家自然科学基金

2+阅读 · 2015年12月31日

SDN数据平面中大规模流表的高性能查找方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

基于网络活动分析的窃密木马检测技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

可证明的网络和数据匿名性及隐私增强身份管理关键技术研究

国家自然科学基金

3+阅读 · 2014年12月31日

Android移动终端多语种基础软件组合的安全技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

Multi-modal preference alignment remedies regression of visual instruction tuning on language model

Arxiv

1+阅读 · 2024年2月16日

Gradient-descent hardware-aware training and deployment for mixed-signal Neuromorphic processors

Arxiv

0+阅读 · 2024年2月15日

Is ChatGPT a Good Recommender? A Preliminary Study

Arxiv

171+阅读 · 2023年4月20日

A Comprehensive Survey on Deep Graph Representation Learning

Arxiv

103+阅读 · 2023年4月11日

On Efficient Training of Large-Scale Deep Learning Models: A Literature Review

Arxiv

216+阅读 · 2023年4月7日

One Small Step for Generative AI, One Giant Leap for AGI: A Complete Survey on ChatGPT in AIGC Era

Arxiv

49+阅读 · 2023年4月4日

A Survey of Large Language Models

A Survey of Large Language Models

Arxiv

479+阅读 · 2023年3月31日

Data-centric Artificial Intelligence: A Survey

Arxiv

24+阅读 · 2023年3月17日

Meta-learning in natural and artificial intelligence

Arxiv

10+阅读 · 2020年11月26日

Augmentation for small object detection

Augmentation for small object detection

Arxiv

11+阅读 · 2019年2月19日

VIP会员

相关主题

对抗性攻击

相关VIP内容

《分析将零信任模式应用于运行技术系统的可行性和益处》2023最新83页论文

《分析将零信任模式应用于运行技术系统的可行性和益处》2023最新83页论文

专知会员服务

32+阅读 · 2023年12月1日

《预测大语言模型生成的代码转换文本的真实性》2023最新59页论文

《预测大语言模型生成的代码转换文本的真实性》2023最新59页论文

专知会员服务

28+阅读 · 2023年12月1日

《深度伪造检测模型的准确性和鲁棒性》2023最新论文

《深度伪造检测模型的准确性和鲁棒性》2023最新论文

专知会员服务

41+阅读 · 2023年10月29日

《基于对手网络基础设施发掘来实现自动威胁建模》2023最新79页论文

《基于对手网络基础设施发掘来实现自动威胁建模》2023最新79页论文

专知会员服务

32+阅读 · 2023年5月14日

《利用强化学习对深度神经网络形成对抗性样本攻击》2023最新83页论文

《利用强化学习对深度神经网络形成对抗性样本攻击》2023最新83页论文

专知会员服务

76+阅读 · 2023年5月11日

《人工智能对抗性攻击的作战可行性》美智库2022最新28页报告

《人工智能对抗性攻击的作战可行性》美智库2022最新28页报告

专知会员服务

67+阅读 · 2022年12月27日

《可解释决策算法和可问责决策算法之间的冲突》2022最新18页论文

《可解释决策算法和可问责决策算法之间的冲突》2022最新18页论文

专知会员服务

50+阅读 · 2022年11月20日

《H4rm0ny：用于规避恶意软件生成和检测的多智能体学习的竞争性两人零和马尔可夫博弈》2022最新12页论文，加拿大国防研究与发展部

《H4rm0ny：用于规避恶意软件生成和检测的多智能体学习的竞争性两人零和马尔可夫博弈》2022最新12页论文，加拿大国防研究与发展部

专知会员服务

26+阅读 · 2022年10月26日

《基于博弈论的高级持续威胁（APT）防御方法》25页最新论文

《基于博弈论的高级持续威胁（APT）防御方法》25页最新论文

专知会员服务

46+阅读 · 2022年10月8日

《基于大型知识库进行问答的非参数化上下文推理》2022最新177页博士论文，马萨诸塞大学阿默斯特分校

《基于大型知识库进行问答的非参数化上下文推理》2022最新177页博士论文，马萨诸塞大学阿默斯特分校

专知会员服务

27+阅读 · 2022年8月5日

热门VIP内容

开通专知VIP会员享更多权益服务

【牛津博士论文】零样本强化学习综述

《美军条令：陆军指挥官与规划人员地理空间指南》60页

战术边缘指挥控制：防务面临的核心挑战

迈向开放世界检测：综述

相关资讯

【蜂群无人机控制关键技术】《基于深度学习进行无线电信号和协议分类以自动发现波形漏洞》2022最新102页报告，美国空军研究实验室

【蜂群无人机控制关键技术】《基于深度学习进行无线电信号和协议分类以自动发现波形漏洞》2022最新102页报告，美国空军研究实验室

专知

66+阅读 · 2022年12月3日

《重新设计反无人机系统架构》2022最新160页论文，美国海军研究生院

《重新设计反无人机系统架构》2022最新160页论文，美国海军研究生院

专知

51+阅读 · 2022年10月26日

【牛津大学博士论文】元强化学习的快速自适应，217页pdf

【牛津大学博士论文】元强化学习的快速自适应，217页pdf

专知

29+阅读 · 2022年9月19日

【经典书】网络安全《移动目标防御 II：博弈论和对抗性建模的应用》210页

【经典书】网络安全《移动目标防御 II：博弈论和对抗性建模的应用》210页

专知

17+阅读 · 2022年4月16日

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

NLP大牛Thomas Wolf等新书《Transformer自然语言处理》，466页pdf及代码

专知

36+阅读 · 2022年2月7日

【2022新书】Transformer自然语言处理：构建语言应用

【2022新书】Transformer自然语言处理：构建语言应用

专知

38+阅读 · 2022年1月31日

最新最全《深度元学习》2021综述论文，68页pdf，A Survey of Deep Meta-Learning

最新最全《深度元学习》2021综述论文，68页pdf，A Survey of Deep Meta-Learning

专知

11+阅读 · 2021年4月23日

最新《知识驱动的文本生成》综述论文，44页pdf

最新《知识驱动的文本生成》综述论文，44页pdf

专知

25+阅读 · 2020年10月14日

最新《可解释深度学习XDL》2020研究进展综述大全，54页pdf

最新《可解释深度学习XDL》2020研究进展综述大全，54页pdf

专知

36+阅读 · 2020年5月2日

论文浅尝 | 基于多模态关联数据嵌入的知识库补全

论文浅尝 | 基于多模态关联数据嵌入的知识库补全

开放知识图谱

12+阅读 · 2018年12月13日

相关基金

语义Web知识库补全关键技术研究

国家自然科学基金

14+阅读 · 2017年12月31日

基于学习的智能化漏洞挖掘关键技术研究

国家自然科学基金

6+阅读 · 2017年12月31日

基于图的半监督学习算法研究

国家自然科学基金

5+阅读 · 2015年12月31日

基于海量软件片段比对的恶意代码检测方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

可恢复的数字语音取证水印技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于云计算平台的下一代测序数据错误修正算法研究与实现

国家自然科学基金

2+阅读 · 2015年12月31日

SDN数据平面中大规模流表的高性能查找方法研究

国家自然科学基金

4+阅读 · 2015年12月31日

基于网络活动分析的窃密木马检测技术研究

国家自然科学基金

0+阅读 · 2015年12月31日

可证明的网络和数据匿名性及隐私增强身份管理关键技术研究

国家自然科学基金

3+阅读 · 2014年12月31日

Android移动终端多语种基础软件组合的安全技术研究

国家自然科学基金

0+阅读 · 2014年12月31日

相关论文

Multi-modal preference alignment remedies regression of visual instruction tuning on language model

Arxiv

1+阅读 · 2024年2月16日

Gradient-descent hardware-aware training and deployment for mixed-signal Neuromorphic processors

Arxiv

0+阅读 · 2024年2月15日

Is ChatGPT a Good Recommender? A Preliminary Study

Arxiv

171+阅读 · 2023年4月20日

A Comprehensive Survey on Deep Graph Representation Learning

Arxiv

103+阅读 · 2023年4月11日

On Efficient Training of Large-Scale Deep Learning Models: A Literature Review

Arxiv

216+阅读 · 2023年4月7日

One Small Step for Generative AI, One Giant Leap for AGI: A Complete Survey on ChatGPT in AIGC Era

Arxiv

49+阅读 · 2023年4月4日

A Survey of Large Language Models

A Survey of Large Language Models

Arxiv

479+阅读 · 2023年3月31日

Data-centric Artificial Intelligence: A Survey

Arxiv

24+阅读 · 2023年3月17日

Meta-learning in natural and artificial intelligence

Arxiv

10+阅读 · 2020年11月26日

Augmentation for small object detection

Augmentation for small object detection

Arxiv

11+阅读 · 2019年2月19日

微信扫码咨询专知VIP会员