动态规划:解决有限马尔可夫决策过程的有效方法
1. 策略迭代的特性与问题
策略迭代通常能在较少的迭代次数内收敛,如杰克租车问题和图 4.1 的示例所示。图 4.1 左下角展示了等概率随机策略的值函数,右下角则是该值函数对应的贪心策略。根据策略改进定理,这些策略优于原始的随机策略,在某些情况下甚至是最优的,能以最少步骤到达终止状态。
不过,第 80 页的策略迭代算法存在一个微妙的问题:如果策略在几个同样优秀的策略之间不断切换,算法可能永远不会终止。为保证收敛,可以对伪代码进行修改。
同时,还有一些相关的练习值得思考:
- 练习 4.4 :修改策略迭代算法的伪代码,确保其收敛。
- 练习 4.5 :定义基于动作值的策略迭代,并给出计算 $q_ $ 的完整算法。
- 练习 4.6 :当仅考虑 $\epsilon$-软策略时,描述第 80 页计算 $v_ $ 的策略迭代算法中步骤 1、2、3 需要做出的定性改变。
- 练习 4.7 :编写策略迭代程序,重新解决杰克租车问题,并考虑新的条件:一名员工可免费将一辆车从第一个地点运到第二个地点;每个地点的停车位有限,若过夜车辆超过 10 辆,需额外支付 4 美元使用第二个停车场。
2. 价值迭代
策略迭代的一个缺点是每次迭代都涉及策略评估,这可能是一个漫长的迭代计算过程,需要对状态集进行多次扫描。实际上,策略评估步骤可以通过多种方式截断,而不影响策略迭代的收敛性。
超级会员免费看
订阅专栏 解锁全文

341

被折叠的 条评论
为什么被折叠?



