作者:SAGAR SHARMA
翻译:张恬钰
校对:王威力
本文1000字,建议阅读5分钟。
本文为你解释强化学习中的策略网络和数值网络。
在强化学习中,智能体(agent)在环境中进行一些随机的抉择,并从很多选择中选择最优的一个来达到目标,实现优于人类的水平。在强化学习中,策略网络和数值网络通常一起使用,比如蒙特卡洛树搜索。这两个网络是探索蒙特卡洛树搜索算法中的一个整体部分。
因为他们在迭代过程中被计算了很多次,所以也被叫做策略迭代和数值迭代,。
接下来我们一起来理解这两个网络在机器学习中为什么如此重要,以及它们之间有什么区别。
什么是策略网络?
考虑这个世界上的任何游戏,玩家在游戏中的输入被认为是行为a,每个输入(行为)导致一个不同的输出,这些输出被认为是游戏的状态s。
从中我们可以得到一个不同状态-行动的配对的列表。
代表哪个行动导致哪个状态。同样的,我们可以说S包括了所有的策略网络中的策略。
策略网络是,给定特定的输入,通过学习给出一个确定输出的网络。
图1 策略网络(动作1,状态1),(动作2,状态2)
比如,在游戏中输入a1导致状态s1(向上移动),输入a2会导致状态s2(向下移动)。
并且,有些行动能增加玩家的分数,产生奖赏r。
图2 状态获得奖赏
来看一些强化学习中常用的符号:
为什么我们使用贴现因子
它是为了防止奖赏r达到无穷大的预防措施(通常小于1)。一个策略无穷大的奖励会忽略掉智能体采取不同行动的区别,导致失去在游戏中探索未知区域和行动的欲望。
但我们在下一次行动到达什么状态才能通往决赛呢?
图3 如何决策下一个动作
什么是数值网络?
通过计算目前状态s的累积分数的期望,数值网络给游戏中的状态赋予一个数值/分数。每个状态都经历了整个数值网络。奖赏更多的状态显然在数值网络中的值更大。
记住奖赏是奖赏期望值,因为我们在从状态的集合中选择一个最优的那个。
接下来,主要目标是最大化期望(马尔科夫决策过程)。达到好的状态的行动显然比其他行动获得更多奖赏。
因为任何游戏都是通过一系列行动来获胜。游戏中的最优化策略由一系列的能够帮助在游戏中获胜的状态-行动对组成。
获得最多奖赏的状态-行动对是最优化的策略。
最优化的策略的等式通过最大化语句来写出:
因此,最优化的策略告诉我们采取哪个行动能够最大化累计折扣奖励。
通过策略网络学习到的最优化的政策知道当前状态下应该采取哪个行动来获得最大化的奖赏。
如果你有任何疑问或者需求,在下面评论或者推特我。
鼓掌……分享它!在Medium上关注我来获得相似的有趣内容。
在推特上关注我来获得及时的提醒。
原文标题:
Policy Networks vs Value Networks in Reinforcement Learning
原文链接:
https://towardsdatascience.com/policy-networks-vs-value-networks-in-reinforcement-learning-da2776056ad2
译者简介
张恬钰,上海交通大学本科物理专业,Emory University生物统计硕士在读。以后想继续在生物统计方向深造。希望能留在美国学习和工作。希望能和广大的数据爱好者做朋友!
翻译组招募信息
工作内容:将选取好的外文前沿文章准确地翻译成流畅的中文。如果你是数据科学/统计学/计算机专业的留学生,或在海外从事相关工作,或对自己外语水平有信心的朋友,数据派翻译组欢迎你们加入!
你能得到:提高对于数据科学前沿的认知,提高对外文新闻来源渠道的认知,海外的朋友可以和国内技术应用发展保持联系,数据派团队产学研的背景为志愿者带来好的发展机遇。
其他福利:和来自于名企的数据科学工作者,北大清华以及海外等名校学生共同合作、交流。
点击文末“阅读原文”加入数据派团队~
转载须知
如需转载,请在开篇显著位置注明作者和出处(转自:数据派THU ID:DatapiTHU),并在文章结尾放置数据派醒目二维码。有原创标识文章,请发送【文章名称-待授权公众号名称及ID】至联系邮箱,申请白名单授权并按要求编辑。
发布后请将链接反馈至联系邮箱(见下方)。未经许可的转载以及改编者,我们将依法追究其法律责任。
点击“阅读原文”拥抱组织