FDE Hub
术语词典/DPO(直接偏好优化)
Defined Term

DPO(直接偏好优化)

Direct Preference Optimization,无需 reward model 的偏好对齐

详细定义

DPO 是 2023 年提出的 RLHF 替代方案:跳过训练 reward model 的步骤,直接用「人类偏好对」(好的回答 vs 坏的回答)训练模型。训练更稳定、计算成本约为 RLHF 的 1/4,效果接近。是开源模型对齐的主流选择。

关联术语

关于 DPO(直接偏好优化) 的常见问题

DPO(直接偏好优化) 的核心定义是什么?

Direct Preference Optimization,无需 reward model 的偏好对齐

DPO(直接偏好优化) 在 FDE 工作流中扮演什么角色?

DPO 是 2023 年提出的 RLHF 替代方案:跳过训练 reward model 的步骤,直接用「人类偏好对」(好的回答 vs 坏的回答)训练模型。训练更稳定、计算成本约为 RLHF 的 1/4,效果接近。是开源模型对齐的主流选择。