Defined Term
RLHF(人类反馈强化学习)
Reinforcement Learning from Human Feedback,用人类反馈训练模型
详细定义
RLHF 是让大模型对齐人类偏好的核心方法。通过人类对模型输出的排序反馈,训练一个 reward model,再用强化学习优化 LLM。是 ChatGPT / Claude 等顶级模型的关键技术。FDE 通常不需要训练,但需要理解 RLHF 输出的偏好(helpful / honest / harmless)。
实例
- GPT-4 的对齐训练。
- Claude 的 Constitutional AI。
- 开源模型 RLHF 工具:TRL、trlX。
来自行业的实例
GPT-4 的对齐训练。
Claude 的 Constitutional AI。
开源模型 RLHF 工具:TRL、trlX。
关联术语
关于 RLHF(人类反馈强化学习) 的常见问题
RLHF(人类反馈强化学习) 的核心定义是什么?
Reinforcement Learning from Human Feedback,用人类反馈训练模型
RLHF(人类反馈强化学习) 在 FDE 工作流中扮演什么角色?
RLHF 是让大模型对齐人类偏好的核心方法。通过人类对模型输出的排序反馈,训练一个 reward model,再用强化学习优化 LLM。是 ChatGPT / Claude 等顶级模型的关键技术。FDE 通常不需要训练,但需要理解 RLHF 输出的偏好(helpful / honest / harmless)。