华为计算微信公众号
昇腾AI开发者公众号
华为计算微博
华为计算今日头条
昇腾社区首页
昇腾论坛
0
/100
支持
我的论坛主页
论坛首页
/
强化学习 - 奖励函数
点赞
0
收藏
0
回复
0
分享
举报
只看楼主
强化学习 - 奖励函数
已解决
发表于2023-10-17 20:58:46
0
查看
已知一个离散动作状态空间 MDP,折扣因子γ ∈ (0,1)。该 MDP 没有终止状态,智能体将不断做出决策。假设该问题的原始最优值函数为𝑉,最优策略为π。若对该 MDP 的每一次状态转移上都加上一个小的正实数c,最优策略是否会改变?若对该 MDP 的每一次状态转移都乘上实数c,最优策略是否会改变?请说明理由
匿名回复
发表
我要发帖子
我们使用cookie来确保您的高速浏览体验。继续浏览本站,即表示您同意我们使用cookie。
查看详情