Defined Term
LLM-as-Judge(LLM 评判)
用强 LLM 作为裁判,自动评估弱 LLM 的输出质量
详细定义
LLM-as-Judge 是 2023 年兴起的评估范式:用 GPT-4 / Claude 这类强模型作为「裁判」,给待评估模型的输出打分或排序。比人工评估快 100 倍,比传统指标(BLEU / ROUGE)更贴近人类判断。是 LLM Eval 的事实标准。
实例
- 用 Claude 评判客服 LLM 的回答是否礼貌、准确、完整。
- 用 GPT-4 给代码 LLM 生成的代码打分(可读性、正确性、性能)。
来自行业的实例
用 Claude 评判客服 LLM 的回答是否礼貌、准确、完整。
用 GPT-4 给代码 LLM 生成的代码打分(可读性、正确性、性能)。
关联术语
关于 LLM-as-Judge(LLM 评判) 的常见问题
LLM-as-Judge(LLM 评判) 的核心定义是什么?
用强 LLM 作为裁判,自动评估弱 LLM 的输出质量
LLM-as-Judge(LLM 评判) 在 FDE 工作流中扮演什么角色?
LLM-as-Judge 是 2023 年兴起的评估范式:用 GPT-4 / Claude 这类强模型作为「裁判」,给待评估模型的输出打分或排序。比人工评估快 100 倍,比传统指标(BLEU / ROUGE)更贴近人类判断。是 LLM Eval 的事实标准。