Many real-world offline reinforcement learning (RL) problems involve continuous-time environments with delays. Such environments are characterized by two distinctive features: firstly, the state x(t) is observed at irregular time intervals, and secondly, the current action a(t) only affects the future state x(t + g) with an unknown delay g > 0. A prime example of such an environment is satellite control where the communication link between earth and a satellite causes irregular observations and delays. Existing offline RL algorithms have achieved success in environments with irregularly observed states in time or known delays. However, environments involving both irregular observations in time and unknown delays remains an open and challenging problem. To this end, we propose Neural Laplace Control, a continuous-time model-based offline RL method that combines a Neural Laplace dynamics model with a model predictive control (MPC) planner--and is able to learn from an offline dataset sampled with irregular time intervals from an environment that has a inherent unknown constant delay. We show experimentally on continuous-time delayed environments it is able to achieve near expert policy performance.


翻译:许多现实世界的脱机强化学习(RL)问题涉及具有延迟的连续时间环境。这种环境具有两个独特的特点:首先,状态x(t)在不规则的时间间隔下观察到;其次,当前行动a(t)仅影响未来状态x(t + g),其中延迟g > 0是未知的。这种环境的主要示例是卫星控制,其中地球和卫星之间的通信链接导致不规则的观测和延迟。现有的离线RL算法已经在时间或已知延迟的不规则观察状态环境中取得了成功。然而,涉及时间不规则观测和未知延迟的环境仍然是一个开放而具有挑战性的问题。为此,我们提出了神经拉普拉斯控制,这是一种连续时间基于模型的离线RL方法,将神经拉普拉斯动力学模型与模型预测控制(MPC)规划器相结合,并能够从具有固有未知常数延迟的环境中采样不规则时间间隔的离线数据集学习。我们在连续时间延迟环境上进行实验,结果显示该方法能够达到接近专家策略的性能。

0
下载
关闭预览

相关内容

专知会员服务
50+阅读 · 2020年12月14日
【ICML2020】持续图神经网络,Continuous Graph Neural Networks
专知会员服务
146+阅读 · 2020年6月28日
【泡泡一分钟】通过学习轮式里程计和IMU误差的定位
泡泡机器人SLAM
132+阅读 · 2019年9月12日
强化学习三篇论文 避免遗忘等
CreateAMind
19+阅读 · 2019年5月24日
19篇ICML2019论文摘录选读!
专知
28+阅读 · 2019年4月28日
Unsupervised Learning via Meta-Learning
CreateAMind
41+阅读 · 2019年1月3日
OpenAI丨深度强化学习关键论文列表
中国人工智能学会
17+阅读 · 2018年11月10日
【推荐】图像分类必读开创性论文汇总
机器学习研究会
14+阅读 · 2017年8月15日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2012年12月31日
国家自然科学基金
0+阅读 · 2012年12月31日
国家自然科学基金
0+阅读 · 2012年12月31日
国家自然科学基金
0+阅读 · 2011年12月31日
国家自然科学基金
0+阅读 · 2009年12月31日
Automatic sparse PCA for high-dimensional data
Arxiv
0+阅读 · 2023年5月26日
Arxiv
22+阅读 · 2022年2月4日
VIP会员
相关VIP内容
专知会员服务
50+阅读 · 2020年12月14日
【ICML2020】持续图神经网络,Continuous Graph Neural Networks
专知会员服务
146+阅读 · 2020年6月28日
相关基金
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2013年12月31日
国家自然科学基金
0+阅读 · 2012年12月31日
国家自然科学基金
0+阅读 · 2012年12月31日
国家自然科学基金
0+阅读 · 2012年12月31日
国家自然科学基金
0+阅读 · 2011年12月31日
国家自然科学基金
0+阅读 · 2009年12月31日
Top
微信扫码咨询专知VIP会员