PPO-UE:通过不确定性-软件探索实现前景最佳政策优化 (PPO-UE: Proximal Policy Optimization via Uncertainty-Aware Exploration) - 专知论文

会员服务 ·

0

优化器 · Extensibility · Continuity · Performer · Analysis ·

2022 年 12 月 13 日

PPO-UE: Proximal Policy Optimization via Uncertainty-Aware Exploration

翻译：PPO-UE:通过不确定性-软件探索实现前景最佳政策优化

Qisheng Zhang,Zhen Guo,Audun Jøsang,Lance M. Kaplan,Feng Chen,Dong H. Jeong,Jin-Hee Cho

Proximal Policy Optimization (PPO) is a highly popular policy-based deep reinforcement learning (DRL) approach. However, we observe that the homogeneous exploration process in PPO could cause an unexpected stability issue in the training phase. To address this issue, we propose PPO-UE, a PPO variant equipped with self-adaptive uncertainty-aware explorations (UEs) based on a ratio uncertainty level. The proposed PPO-UE is designed to improve convergence speed and performance with an optimized ratio uncertainty level. Through extensive sensitivity analysis by varying the ratio uncertainty level, our proposed PPO-UE considerably outperforms the baseline PPO in Roboschool continuous control tasks.

翻译：最佳政策优化(PPO)是一种以政策为基础的高度流行的深层强化学习(DRL)方法,然而,我们注意到PPO的同一探索过程可能会在培训阶段造成一个出乎意料的稳定问题。为了解决这一问题,我们提议PPO-UE(一个PPO-UE)变体,配有基于比例不确定性水平的自适应性不确定性-认知探索(Ues)。拟议的PPPO-UE(PPPO-UE)旨在以最佳比例不确定性水平提高趋同速度和性能。通过对比率不确定性水平的不同进行广泛的敏感性分析,我们提议的PPPO-UE大大超过罗博学校连续控制任务的基线PPO。

0

相关内容

优化器

《AI中毒攻击》34页slides

《AI中毒攻击》34页slides

专知会员服务

26+阅读 · 2022年10月17日

深度学习优化算法，73页ppt，Optimization Algorithms on Deep Learning

深度学习优化算法，73页ppt，Optimization Algorithms on Deep Learning

专知会员服务

135+阅读 · 2021年6月16日

【Google】深度学习对抗鲁棒性，43页ppt

专知会员服务

45+阅读 · 2020年10月31日

50+篇《神经架构搜索NAS》2020论文合集

专知会员服务

61+阅读 · 2020年3月19日

100+篇《自监督学习(Self-Supervised Learning)》论文最新合集

100+篇《自监督学习(Self-Supervised Learning)》论文最新合集

专知会员服务

165+阅读 · 2020年3月18日

强化学习最新教程，17页pdf

强化学习最新教程，17页pdf

专知会员服务

181+阅读 · 2019年10月11日

[综述]深度学习下的场景文本检测与识别

[综述]深度学习下的场景文本检测与识别

专知会员服务

78+阅读 · 2019年10月10日

【CMU卡内基梅隆大学】深度学习在计算机视觉的应用：方法，解释，因果与公平性

【CMU卡内基梅隆大学】深度学习在计算机视觉的应用：方法，解释，因果与公平性

专知会员服务

83+阅读 · 2019年10月9日

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

专知会员服务

65+阅读 · 2019年10月9日

【哈佛大学商学院课程Fall 2019】机器学习可解释性

【哈佛大学商学院课程Fall 2019】机器学习可解释性

专知会员服务

105+阅读 · 2019年10月9日

VCIP 2022 Call for Special Session Proposals

VCIP 2022 Call for Special Session Proposals

CCF多媒体专委会

1+阅读 · 2022年4月1日

ACM TOMM Call for Papers

ACM TOMM Call for Papers

CCF多媒体专委会

2+阅读 · 2022年3月23日

AIART 2022 Call for Papers

AIART 2022 Call for Papers

CCF多媒体专委会

1+阅读 · 2022年2月13日

Hierarchically Structured Meta-learning

Hierarchically Structured Meta-learning

CreateAMind

27+阅读 · 2019年5月22日

Transferring Knowledge across Learning Processes

Transferring Knowledge across Learning Processes

CreateAMind

29+阅读 · 2019年5月18日

强化学习的Unsupervised Meta-Learning

强化学习的Unsupervised Meta-Learning

CreateAMind

18+阅读 · 2019年1月7日

Unsupervised Learning via Meta-Learning

Unsupervised Learning via Meta-Learning

CreateAMind

43+阅读 · 2019年1月3日

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

专知

17+阅读 · 2018年4月28日

【论文】变分推断（Variational inference)的总结

【论文】变分推断（Variational inference)的总结

机器学习研究会

39+阅读 · 2017年11月16日

强化学习族谱

强化学习族谱

CreateAMind

26+阅读 · 2017年8月2日

RRM2诱导宫颈癌细胞上皮-间质转化的机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

二亚硝基哌嗪（DNP）介导Clusterin表达参与鼻咽癌转移的分子机制研究

国家自然科学基金

0+阅读 · 2013年12月31日

二亚硝基哌嗪（DNP）活化HSP70-2参与鼻咽癌转移的分子机制研究

国家自然科学基金

0+阅读 · 2013年12月31日

电磁散射中的无穷曲面锥形散射问题及其反问题

国家自然科学基金

0+阅读 · 2013年12月31日

精氨酸甲基化修饰在Snail诱导的EMT和肿瘤转移中的作用

国家自然科学基金

0+阅读 · 2011年12月31日

重调和方程基于Poisson算子的高效有限元方法

国家自然科学基金

0+阅读 · 2011年12月31日

ARK5/p38MAPK/Pim-3信号通路在胃癌发生、发展中的作用及机制研究

国家自然科学基金

0+阅读 · 2011年12月31日

SATB1调控肝素酶的表达促进胃癌侵袭转移？

国家自然科学基金

0+阅读 · 2009年12月31日

SARI基因在肺癌侵袭转移中的作用及分子机制

国家自然科学基金

0+阅读 · 2009年12月31日

约束优化问题的目标罚函数的精确性和算法研究

国家自然科学基金

0+阅读 · 2009年12月31日

Uncertainty-Estimation with Normalized Logits for Out-of-Distribution Detection

Arxiv

0+阅读 · 2023年2月15日

CAMEO: Curiosity Augmented Metropolis for Exploratory Optimal Policies

Arxiv

0+阅读 · 2023年2月15日

Pose-Oriented Transformer with Uncertainty-Guided Refinement for 2D-to-3D Human Pose Estimation

Arxiv

0+阅读 · 2023年2月15日

Adaptive design of experiment via normalizing flows for failure probability estimation

Arxiv

0+阅读 · 2023年2月14日

One-shot Learning of Surrogates in PDE-constrained Optimization Under Uncertainty

Arxiv

0+阅读 · 2023年2月13日

Latent State Marginalization as a Low-cost Approach for Improving Exploration

Arxiv

0+阅读 · 2023年2月10日

Look around and learn: self-improving object detection by exploration

Arxiv

0+阅读 · 2023年2月10日

The out-of-sample $R^2$: estimation and inference

Arxiv

0+阅读 · 2023年2月10日

Revisiting Estimation Bias in Policy Gradients for Deep Reinforcement Learning

Arxiv

0+阅读 · 2023年2月10日

Designing Robust Transformers using Robust Kernel Density Estimation

Arxiv

0+阅读 · 2023年2月9日

VIP会员

文章信息

相关主题

相关VIP内容

《AI中毒攻击》34页slides

《AI中毒攻击》34页slides

专知会员服务

26+阅读 · 2022年10月17日

深度学习优化算法，73页ppt，Optimization Algorithms on Deep Learning

深度学习优化算法，73页ppt，Optimization Algorithms on Deep Learning

专知会员服务

135+阅读 · 2021年6月16日

【Google】深度学习对抗鲁棒性，43页ppt

专知会员服务

45+阅读 · 2020年10月31日

50+篇《神经架构搜索NAS》2020论文合集

专知会员服务

61+阅读 · 2020年3月19日

100+篇《自监督学习(Self-Supervised Learning)》论文最新合集

100+篇《自监督学习(Self-Supervised Learning)》论文最新合集

专知会员服务

165+阅读 · 2020年3月18日

强化学习最新教程，17页pdf

强化学习最新教程，17页pdf

专知会员服务

181+阅读 · 2019年10月11日

[综述]深度学习下的场景文本检测与识别

[综述]深度学习下的场景文本检测与识别

专知会员服务

78+阅读 · 2019年10月10日

【CMU卡内基梅隆大学】深度学习在计算机视觉的应用：方法，解释，因果与公平性

【CMU卡内基梅隆大学】深度学习在计算机视觉的应用：方法，解释，因果与公平性

专知会员服务

83+阅读 · 2019年10月9日

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

专知会员服务

65+阅读 · 2019年10月9日

【哈佛大学商学院课程Fall 2019】机器学习可解释性

【哈佛大学商学院课程Fall 2019】机器学习可解释性

专知会员服务

105+阅读 · 2019年10月9日

热门VIP内容

开通专知VIP会员享更多权益服务

新质生成式AI赋能产业变革的实践与路径

用于多模态大模型的离散标记化：全面综述

Nature综述：金融网络中的物理学

【CMU博士论文】通信高效且差分隐私的优化方法

相关资讯

VCIP 2022 Call for Special Session Proposals

VCIP 2022 Call for Special Session Proposals

CCF多媒体专委会

1+阅读 · 2022年4月1日

ACM TOMM Call for Papers

ACM TOMM Call for Papers

CCF多媒体专委会

2+阅读 · 2022年3月23日

AIART 2022 Call for Papers

AIART 2022 Call for Papers

CCF多媒体专委会

1+阅读 · 2022年2月13日

Hierarchically Structured Meta-learning

Hierarchically Structured Meta-learning

CreateAMind

27+阅读 · 2019年5月22日

Transferring Knowledge across Learning Processes

Transferring Knowledge across Learning Processes

CreateAMind

29+阅读 · 2019年5月18日

强化学习的Unsupervised Meta-Learning

强化学习的Unsupervised Meta-Learning

CreateAMind

18+阅读 · 2019年1月7日

Unsupervised Learning via Meta-Learning

Unsupervised Learning via Meta-Learning

CreateAMind

43+阅读 · 2019年1月3日

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

【论文推荐】最新六篇强化学习相关论文—Sublinear、机器阅读理解、加速强化学习、对抗性奖励学习、人机交互

专知

17+阅读 · 2018年4月28日

【论文】变分推断（Variational inference)的总结

【论文】变分推断（Variational inference)的总结

机器学习研究会

39+阅读 · 2017年11月16日

强化学习族谱

强化学习族谱

CreateAMind

26+阅读 · 2017年8月2日

相关论文

Uncertainty-Estimation with Normalized Logits for Out-of-Distribution Detection

Arxiv

0+阅读 · 2023年2月15日

CAMEO: Curiosity Augmented Metropolis for Exploratory Optimal Policies

Arxiv

0+阅读 · 2023年2月15日

Pose-Oriented Transformer with Uncertainty-Guided Refinement for 2D-to-3D Human Pose Estimation

Arxiv

0+阅读 · 2023年2月15日

Adaptive design of experiment via normalizing flows for failure probability estimation

Arxiv

0+阅读 · 2023年2月14日

One-shot Learning of Surrogates in PDE-constrained Optimization Under Uncertainty

Arxiv

0+阅读 · 2023年2月13日

Latent State Marginalization as a Low-cost Approach for Improving Exploration

Arxiv

0+阅读 · 2023年2月10日

Look around and learn: self-improving object detection by exploration

Arxiv

0+阅读 · 2023年2月10日

The out-of-sample $R^2$: estimation and inference

Arxiv

0+阅读 · 2023年2月10日

Revisiting Estimation Bias in Policy Gradients for Deep Reinforcement Learning

Arxiv

0+阅读 · 2023年2月10日

Designing Robust Transformers using Robust Kernel Density Estimation

Arxiv

0+阅读 · 2023年2月9日

相关基金

RRM2诱导宫颈癌细胞上皮-间质转化的机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

二亚硝基哌嗪（DNP）介导Clusterin表达参与鼻咽癌转移的分子机制研究

国家自然科学基金

0+阅读 · 2013年12月31日

二亚硝基哌嗪（DNP）活化HSP70-2参与鼻咽癌转移的分子机制研究

国家自然科学基金

0+阅读 · 2013年12月31日

电磁散射中的无穷曲面锥形散射问题及其反问题

国家自然科学基金

0+阅读 · 2013年12月31日

精氨酸甲基化修饰在Snail诱导的EMT和肿瘤转移中的作用

国家自然科学基金

0+阅读 · 2011年12月31日

重调和方程基于Poisson算子的高效有限元方法

国家自然科学基金

0+阅读 · 2011年12月31日

ARK5/p38MAPK/Pim-3信号通路在胃癌发生、发展中的作用及机制研究

国家自然科学基金

0+阅读 · 2011年12月31日

SATB1调控肝素酶的表达促进胃癌侵袭转移？

国家自然科学基金

0+阅读 · 2009年12月31日

SARI基因在肺癌侵袭转移中的作用及分子机制

国家自然科学基金

0+阅读 · 2009年12月31日

约束优化问题的目标罚函数的精确性和算法研究

国家自然科学基金

0+阅读 · 2009年12月31日

微信扫码咨询专知VIP会员