FDE Hub
Defined Term

vLLM

高性能 LLM 推理引擎,PagedAttention 把吞吐量提升 24 倍

详细定义

vLLM 是 UC Berkeley 2023 年开源的 LLM 推理引擎,核心创新是 PagedAttention——借鉴操作系统虚拟内存的思路管理 KV Cache,吞吐量比 HuggingFace Transformers 提升 24 倍。是 FDE 现场高并发 LLM 服务的事实标准。

实例

  • Qwen2.5-72B + vLLM,单机 8 卡 H100 可达 5000 tokens/s/用户。
  • Llama-3-70B + vLLM,支持 100 并发 QPS。
来自行业的实例
Qwen2.5-72B + vLLM,单机 8 卡 H100 可达 5000 tokens/s/用户。
Llama-3-70B + vLLM,支持 100 并发 QPS。

关联术语

关于 vLLM 的常见问题

vLLM 的核心定义是什么?

高性能 LLM 推理引擎,PagedAttention 把吞吐量提升 24 倍

vLLM 在 FDE 工作流中扮演什么角色?

vLLM 是 UC Berkeley 2023 年开源的 LLM 推理引擎,核心创新是 PagedAttention——借鉴操作系统虚拟内存的思路管理 KV Cache,吞吐量比 HuggingFace Transformers 提升 24 倍。是 FDE 现场高并发 LLM 服务的事实标准。