一、基础概念
INT4 =4 位整数量化AI 大模型里每一个权重数字,原本标准格式是 FP32(32 位浮点数),占用 4 字节显存。 量化:把高精度小数,压缩成低位数整数,大幅减少显存占用,代价是轻微损失一点 AI 精度,日常使用几乎感知不到。
常见量化规格对比(直观看懂压缩比例):
FP32:32bit,原始完整精度,显存占用最大
FP16/BF16:16bit,减半显存,你 3060 支持
INT8:8bit,再减半
INT4:4bit,再砍一半,显存直接压缩到原版 1/8
二、INT4 核心作用(对你最关键)
极致省显存以大模型权重举例:
7B FP16:约 13G 显存
7B INT4:仅 3.5~4G 显存 13B、30B 同理,显存直接砍 75%,低配显卡才能跑大模型。
降低硬件门槛你的 3060 只有 12G 显存,不做 INT4 量化,连 13B 模型都加载不进去;开启 INT4 后才能正常运行。
小幅提速 数据体积变小,GPU 读写更快,推理生成文字速度会有小幅提升。