11、动态规划:解决有限马尔可夫决策过程的有效方法

动态规划:解决有限马尔可夫决策过程的有效方法

1. 策略迭代的特性与问题

策略迭代通常能在较少的迭代次数内收敛,如杰克租车问题和图 4.1 的示例所示。图 4.1 左下角展示了等概率随机策略的值函数,右下角则是该值函数对应的贪心策略。根据策略改进定理,这些策略优于原始的随机策略,在某些情况下甚至是最优的,能以最少步骤到达终止状态。

不过,第 80 页的策略迭代算法存在一个微妙的问题:如果策略在几个同样优秀的策略之间不断切换,算法可能永远不会终止。为保证收敛,可以对伪代码进行修改。

同时,还有一些相关的练习值得思考:
- 练习 4.4 :修改策略迭代算法的伪代码,确保其收敛。
- 练习 4.5 :定义基于动作值的策略迭代,并给出计算 $q_ $ 的完整算法。
-
练习 4.6 :当仅考虑 $\epsilon$-软策略时,描述第 80 页计算 $v_ $ 的策略迭代算法中步骤 1、2、3 需要做出的定性改变。
- 练习 4.7 :编写策略迭代程序,重新解决杰克租车问题,并考虑新的条件:一名员工可免费将一辆车从第一个地点运到第二个地点;每个地点的停车位有限,若过夜车辆超过 10 辆,需额外支付 4 美元使用第二个停车场。

2. 价值迭代

策略迭代的一个缺点是每次迭代都涉及策略评估,这可能是一个漫长的迭代计算过程,需要对状态集进行多次扫描。实际上,策略评估步骤可以通过多种方式截断,而不影响策略迭代的收敛性。

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符  | 博主筛选后可见
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值