9、有限马尔可夫决策过程中的最优策略与价值函数

有限马尔可夫决策过程中的最优策略与价值函数

1. 状态与动作价值关系

状态的价值取决于该状态下可能采取的动作的价值,以及在当前策略下每个动作被选择的概率。可以用一个以状态为根节点,考虑每个可能动作的备份图来表示这种关系。
- 状态价值方程
- 以期望的形式表示,给定 $S_t = s$,根节点的价值 $v_{\pi}(s)$ 与叶子节点的价值 $q_{\pi}(s, a)$ 的关系为:$v_{\pi}(s) = \mathbb{E} {\pi}[q {\pi}(s, A_t) | S_t = s]$,这里的期望是基于策略 $\pi$ 计算的。
- 若将期望用 $\pi(a|s)$ 显式表示,则为:$v_{\pi}(s) = \sum_{a \in A(s)} \pi(a|s) q_{\pi}(s, a)$。
- 动作价值方程
- 动作的价值 $q_{\pi}(s, a)$ 取决于期望的下一个奖励和剩余奖励的期望总和。给定 $S_t = s$ 和 $A_t = a$,以期望形式表示为:$q_{\pi}(s, a) = \mathbb{E}[R_{t + 1} + \gamma v_{\pi}(S_{t + 1}) | S_t = s, A_t = a]$。
- 若用 $p(s’, r|s, a)$ 显式表示期望,则为:$q_{\pi}(s, a) = \sum_{s’, r} p(s’, r|s, a) [r + \gamma v_{\pi}(s’)]$。

2. 最优策略与最优价值函数

求解强化学习任务大致意味着找

评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符  | 博主筛选后可见
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值