有限马尔可夫决策过程中的最优策略与价值函数
1. 状态与动作价值关系
状态的价值取决于该状态下可能采取的动作的价值,以及在当前策略下每个动作被选择的概率。可以用一个以状态为根节点,考虑每个可能动作的备份图来表示这种关系。
- 状态价值方程 :
- 以期望的形式表示,给定 $S_t = s$,根节点的价值 $v_{\pi}(s)$ 与叶子节点的价值 $q_{\pi}(s, a)$ 的关系为:$v_{\pi}(s) = \mathbb{E} {\pi}[q {\pi}(s, A_t) | S_t = s]$,这里的期望是基于策略 $\pi$ 计算的。
- 若将期望用 $\pi(a|s)$ 显式表示,则为:$v_{\pi}(s) = \sum_{a \in A(s)} \pi(a|s) q_{\pi}(s, a)$。
- 动作价值方程 :
- 动作的价值 $q_{\pi}(s, a)$ 取决于期望的下一个奖励和剩余奖励的期望总和。给定 $S_t = s$ 和 $A_t = a$,以期望形式表示为:$q_{\pi}(s, a) = \mathbb{E}[R_{t + 1} + \gamma v_{\pi}(S_{t + 1}) | S_t = s, A_t = a]$。
- 若用 $p(s’, r|s, a)$ 显式表示期望,则为:$q_{\pi}(s, a) = \sum_{s’, r} p(s’, r|s, a) [r + \gamma v_{\pi}(s’)]$。
2. 最优策略与最优价值函数
求解强化学习任务大致意味着找
超级会员免费看
订阅专栏 解锁全文

3043

被折叠的 条评论
为什么被折叠?



