https://mp.weixin.qq.com/s/am_ulGA18klm6T5KEuAI7w

在强化学习(Reinforcement Learning,RL)中,on-policy 和 off-policy 是两种核心的学习策略,它们之间的区别在于:

学习使用的数据是否来自当前策略本身,还是来自其他策略

要想真正理解这两个概念,我们不仅要从算法原理入手,还要把握其本质。下面我将从基本定义 → 原理区别 → 数学表达 → 实例类比 → 矛盾分析几个层次进行深入剖析。