FDE Hub
术语词典/RLHF(人类反馈强化学习)
Defined Term

RLHF(人类反馈强化学习)

Reinforcement Learning from Human Feedback,用人类反馈训练模型

详细定义

RLHF 是让大模型对齐人类偏好的核心方法。通过人类对模型输出的排序反馈,训练一个 reward model,再用强化学习优化 LLM。是 ChatGPT / Claude 等顶级模型的关键技术。FDE 通常不需要训练,但需要理解 RLHF 输出的偏好(helpful / honest / harmless)。

实例

  • GPT-4 的对齐训练。
  • Claude 的 Constitutional AI。
  • 开源模型 RLHF 工具:TRL、trlX。
来自行业的实例
GPT-4 的对齐训练。
Claude 的 Constitutional AI。
开源模型 RLHF 工具:TRL、trlX。

关联术语

关于 RLHF(人类反馈强化学习) 的常见问题

RLHF(人类反馈强化学习) 的核心定义是什么?

Reinforcement Learning from Human Feedback,用人类反馈训练模型

RLHF(人类反馈强化学习) 在 FDE 工作流中扮演什么角色?

RLHF 是让大模型对齐人类偏好的核心方法。通过人类对模型输出的排序反馈,训练一个 reward model,再用强化学习优化 LLM。是 ChatGPT / Claude 等顶级模型的关键技术。FDE 通常不需要训练,但需要理解 RLHF 输出的偏好(helpful / honest / harmless)。