Defined Term
Quantization(量化)
把模型参数从 FP16/FP32 压缩到 INT8/INT4,降低显存与推理成本
详细定义
Quantization 是把模型权重从高精度(FP32=4 字节)压缩到低精度(INT8=1 字节、INT4=0.5 字节),显存占用降低 2-8 倍,推理速度提升 1.5-3 倍,精度损失通常 <2%。FDE 现场常用 GPTQ(GPU)、AWQ(GPU)、GGUF(CPU/Mac)方案做模型部署。
实例
- Qwen2.5-72B FP16 = 144GB 显存 → INT4 = 36GB,单卡 H100 可跑。
- Llama-3-8B GGUF Q4 = 4.7GB,M2 MacBook 即可本地推理。
来自行业的实例
Qwen2.5-72B FP16 = 144GB 显存 → INT4 = 36GB,单卡 H100 可跑。
Llama-3-8B GGUF Q4 = 4.7GB,M2 MacBook 即可本地推理。
关联术语
关于 Quantization(量化) 的常见问题
Quantization(量化) 的核心定义是什么?
把模型参数从 FP16/FP32 压缩到 INT8/INT4,降低显存与推理成本
Quantization(量化) 在 FDE 工作流中扮演什么角色?
Quantization 是把模型权重从高精度(FP32=4 字节)压缩到低精度(INT8=1 字节、INT4=0.5 字节),显存占用降低 2-8 倍,推理速度提升 1.5-3 倍,精度损失通常 <2%。FDE 现场常用 GPTQ(GPU)、AWQ(GPU)、GGUF(CPU/Mac)方案做模型部署。