Defined Term
QLoRA(量化低秩适配)
在 4-bit 量化基础上做 LoRA 微调,显存再降 4 倍
详细定义
QLoRA(Quantized LoRA)是把基座模型量化到 4-bit 后再做 LoRA 微调。原始 LoRA 需要把基座模型以 FP16 加载到显存(70B 模型需要 140GB),QLoRA 只需 4-bit(约 35GB),单卡 A100 就能微调 65B 模型。是消费级显卡跑大模型微调的关键技术。
关联术语
关于 QLoRA(量化低秩适配) 的常见问题
QLoRA(量化低秩适配) 的核心定义是什么?
在 4-bit 量化基础上做 LoRA 微调,显存再降 4 倍
QLoRA(量化低秩适配) 在 FDE 工作流中扮演什么角色?
QLoRA(Quantized LoRA)是把基座模型量化到 4-bit 后再做 LoRA 微调。原始 LoRA 需要把基座模型以 FP16 加载到显存(70B 模型需要 140GB),QLoRA 只需 4-bit(约 35GB),单卡 A100 就能微调 65B 模型。是消费级显卡跑大模型微调的关键技术。