https://mp.weixin.qq.com/s/am_ulGA18klm6T5KEuAI7w
在强化学习(Reinforcement Learning,RL)中,on-policy 和 off-policy 是两种核心的学习策略,它们之间的区别在于:
学习使用的数据是否来自当前策略本身,还是来自其他策略。
要想真正理解这两个概念,我们不仅要从算法原理入手,还要把握其本质。下面我将从基本定义 → 原理区别 → 数学表达 → 实例类比 → 矛盾分析几个层次进行深入剖析。