Direct Preference Optimization: Your Language Model is Secretly a Reward Model
基于 人类反馈的强化学习(RLHF) 是一个复杂且不稳定的过程,拟合一个反映人类偏好的奖励模型,然后使用强化学习对大语言模型进行微调,以最大限度地提高估计奖励,同时又不能偏离原始模型太远。这涉及训练多个 LM,并在训练循环中从 LM 采样,从而产生大量的计算成本。

本文作者提出了 直接偏好优化(DPO) 算法,它稳定、高效且计算量轻,无需拟合奖励模型,也无需在微调期间从LM采样或执行显著的超参数调整。
实验表明,DPO 可以微调 LMs,使其与人类偏好保持一致,与现有方法一样或更好。值得注意的是,DPO 在情绪控制的能力上超越了 RLHF,提高了总结和单轮对话的响应质量,同时大大简化了实现和训练。
RLHF通常由3个阶段组成:
RLHF 通常从一个通用的预训练 LM 开始,该 LM 在高质量数据集上通过监督学习(最大似然)对感兴趣的下游任务(如对话、指令跟随、总结等)进行微调,以获得模型 $\pi^{SFT}$ 。
在第二阶段,用 $x$ 提示 $\pi^{SFT}$ 产生一对答案 $(y_1, y_2) \sim \pi^{SFT}$ 。通过人类标注,得到偏好标签 $y_w \succ y_l$ ,其中 $y_w$ 表示首选prompt, $y_l$ 表示非首选prompt。
通过静态数据集 $D=\left\{x^{i}, y_{w}^{i}, y_{l}^{i}\right\}{i=1}^{N}$,可以将奖励模型 $r{\phi}(x,y)$ 参数化,并通过极大似然估计参数。将问题定义为二元分类,有负对数似然损失:
$$ \mathcal{L}{R}\left(r{\phi}, \mathcal{D}\right)=-\mathbb{E}{\left(x, y{w}, y_{l}\right) \sim \mathcal{D}}\left[\log \sigma\left(r_{\phi}\left(x, y_{w}\right)-r_{\phi}\left(x, y_{l}\right)\right)\right] $$
其中 $\sigma$ 是 sigmoid 函数。奖励模型 $r_{\phi}(x,y)$ 通常由 $\pi^{SFT}$ 进行初始化,并在最后一个 Transformer 层之后添加线性层,该层为奖励值生成单个标量预测。