FDE Hub
术语词典/QLoRA(量化低秩适配)
Defined Term

QLoRA(量化低秩适配)

在 4-bit 量化基础上做 LoRA 微调,显存再降 4 倍

详细定义

QLoRA(Quantized LoRA)是把基座模型量化到 4-bit 后再做 LoRA 微调。原始 LoRA 需要把基座模型以 FP16 加载到显存(70B 模型需要 140GB),QLoRA 只需 4-bit(约 35GB),单卡 A100 就能微调 65B 模型。是消费级显卡跑大模型微调的关键技术。

关联术语

关于 QLoRA(量化低秩适配) 的常见问题

QLoRA(量化低秩适配) 的核心定义是什么?

在 4-bit 量化基础上做 LoRA 微调,显存再降 4 倍

QLoRA(量化低秩适配) 在 FDE 工作流中扮演什么角色?

QLoRA(Quantized LoRA)是把基座模型量化到 4-bit 后再做 LoRA 微调。原始 LoRA 需要把基座模型以 FP16 加载到显存(70B 模型需要 140GB),QLoRA 只需 4-bit(约 35GB),单卡 A100 就能微调 65B 模型。是消费级显卡跑大模型微调的关键技术。