Defined Term
DPO(直接偏好优化)
Direct Preference Optimization,无需 reward model 的偏好对齐
详细定义
DPO 是 2023 年提出的 RLHF 替代方案:跳过训练 reward model 的步骤,直接用「人类偏好对」(好的回答 vs 坏的回答)训练模型。训练更稳定、计算成本约为 RLHF 的 1/4,效果接近。是开源模型对齐的主流选择。
关联术语
关于 DPO(直接偏好优化) 的常见问题
DPO(直接偏好优化) 的核心定义是什么?
Direct Preference Optimization,无需 reward model 的偏好对齐
DPO(直接偏好优化) 在 FDE 工作流中扮演什么角色?
DPO 是 2023 年提出的 RLHF 替代方案:跳过训练 reward model 的步骤,直接用「人类偏好对」(好的回答 vs 坏的回答)训练模型。训练更稳定、计算成本约为 RLHF 的 1/4,效果接近。是开源模型对齐的主流选择。