FDE Hub
术语词典/LLM-as-Judge(LLM 评判)
Defined Term

LLM-as-Judge(LLM 评判)

用强 LLM 作为裁判,自动评估弱 LLM 的输出质量

详细定义

LLM-as-Judge 是 2023 年兴起的评估范式:用 GPT-4 / Claude 这类强模型作为「裁判」,给待评估模型的输出打分或排序。比人工评估快 100 倍,比传统指标(BLEU / ROUGE)更贴近人类判断。是 LLM Eval 的事实标准。

实例

  • 用 Claude 评判客服 LLM 的回答是否礼貌、准确、完整。
  • 用 GPT-4 给代码 LLM 生成的代码打分(可读性、正确性、性能)。
来自行业的实例
用 Claude 评判客服 LLM 的回答是否礼貌、准确、完整。
用 GPT-4 给代码 LLM 生成的代码打分(可读性、正确性、性能)。

关联术语

关于 LLM-as-Judge(LLM 评判) 的常见问题

LLM-as-Judge(LLM 评判) 的核心定义是什么?

用强 LLM 作为裁判,自动评估弱 LLM 的输出质量

LLM-as-Judge(LLM 评判) 在 FDE 工作流中扮演什么角色?

LLM-as-Judge 是 2023 年兴起的评估范式:用 GPT-4 / Claude 这类强模型作为「裁判」,给待评估模型的输出打分或排序。比人工评估快 100 倍,比传统指标(BLEU / ROUGE)更贴近人类判断。是 LLM Eval 的事实标准。