强化学习笔记1--基础概念 1、智能体与环境交互的基本要素状态state s∈S智能体在环境中所处的情形是对当前环境的描述。状态空间state space S所有可能状态的集合。动作action a在某状态下智能体可以执行的操作。动作空间action space A(s)状态ss 下可采取的动作集合。注意不同状态对应的动作空间可以不同。状态转移state transition在当前状态 s 执行动作 a 后环境转移到下一状态 s′ 的过程。常用转移概率描述禁止区域forbidden area环境中某些特殊状态表现为无法进入转移概率恒为 0或进入即受严惩极大的负奖励用来表示危险或约束。奖励reward r智能体执行一个动作后环境反馈的标量评价信号。一般正值表示鼓励负值表示惩罚。奖励也是随机的其概率为示例p(r1∣s1,a1)1 表示在状态 s1 采取动作 a1​ 后得到奖励 1 概率为100。2. 策略策略policy π决定了智能体在每个状态下如何选择动作。是状态到动作概率分布的映射。随机策略π(a∣s) 表示在状态 s 下选择动作 a 的概率满足确定性策略可视为特殊情形某个动作为 1其余为 0。3. 轨迹、回报与折扣回报轨迹trajectory智能体与环境交互产生的状态、动作、奖励序列例如回报return Gt​从时刻 t 开始之后获得的所有奖励的总和。对于有限步任务简单求和即可折扣回报discounted return为平衡近期与远期奖励引入折扣因子 γ∈[0,1)γ 越接近 1越重视长期奖励γ 越小越看重眼前。注意即时奖励 Rt1不被折扣即系数为 1后续奖励才依次乘以 γ,γ²,…。回合与持续性任务回合episode交互序列自然终止的轨迹如游戏结束。这类问题称为回合式任务episodic tasks。持续性任务continuing tasks没有终止时刻交互无限进行如机器人持续运行。此时折扣回报必不可少否则回报可能发散。4. 马尔可夫决策过程MDP马尔可夫决策过程是强化学习问题的数学框架核心元素包括状态集合 S动作集合可依赖状态A(s)奖励分布 p(r∣s,a) 或奖励函数 R(s,a)状态转移概率 p(s′∣s,a)折扣因子 γ策略 π(a∣s)马尔可夫性质Markov property下一状态与奖励的概率分布只依赖于当前状态和当前动作与更早的历史无关