FDE Hub
术语词典/Quantization(量化)
Defined Term

Quantization(量化)

把模型参数从 FP16/FP32 压缩到 INT8/INT4,降低显存与推理成本

详细定义

Quantization 是把模型权重从高精度(FP32=4 字节)压缩到低精度(INT8=1 字节、INT4=0.5 字节),显存占用降低 2-8 倍,推理速度提升 1.5-3 倍,精度损失通常 <2%。FDE 现场常用 GPTQ(GPU)、AWQ(GPU)、GGUF(CPU/Mac)方案做模型部署。

实例

  • Qwen2.5-72B FP16 = 144GB 显存 → INT4 = 36GB,单卡 H100 可跑。
  • Llama-3-8B GGUF Q4 = 4.7GB,M2 MacBook 即可本地推理。
来自行业的实例
Qwen2.5-72B FP16 = 144GB 显存 → INT4 = 36GB,单卡 H100 可跑。
Llama-3-8B GGUF Q4 = 4.7GB,M2 MacBook 即可本地推理。

关联术语

关于 Quantization(量化) 的常见问题

Quantization(量化) 的核心定义是什么?

把模型参数从 FP16/FP32 压缩到 INT8/INT4,降低显存与推理成本

Quantization(量化) 在 FDE 工作流中扮演什么角色?

Quantization 是把模型权重从高精度(FP32=4 字节)压缩到低精度(INT8=1 字节、INT4=0.5 字节),显存占用降低 2-8 倍,推理速度提升 1.5-3 倍,精度损失通常 <2%。FDE 现场常用 GPTQ(GPU)、AWQ(GPU)、GGUF(CPU/Mac)方案做模型部署。