4bit量化
-
4bit量化后运行 DeepSeek 需要多少显存?影响因素与估算思路
4bit 量化后运行 DeepSeek 的显存需求不能只看“4bit”或模型文件大小。粗略估算时,可用“参数量 × 0.5 字节”计算权重下限,例如 7B 约 3.5GB、32B 约 16GB、70B 约 35GB,但实际运行还要加上量化元数据、KV Cache、推理框架开销和上下文长度带来的额外占用。4bit 主要压缩模型权重,不代表总显存一定降到原来的四分之一。判断能否运行,应先确认模型参数量,再预留额外显存,并用实际推理设置观察峰值显存。