强化学习 - 奖励函数
收藏回复举报
强化学习 - 奖励函数
t('forum.solved') 已解决
发表于2023-10-17 20:58:46
0 查看
已知一个离散动作状态空间 MDP,折扣因子γ ∈ (0,1)。该 MDP 没有终止状态,智能体将不断做出决策。假设该问题的原始最优值函数为𝑉,最优策略为π。若对该 MDP 的每一次状态转移上都加上一个小的正实数c,最优策略是否会改变?若对该 MDP 的每一次状态转移都乘上实数c,最优策略是否会改变?请说明理由

我要发帖子