PyTorch QAT, TensorFlow Model Optimization Toolkit
选型建议:
个人开发者 → PTQ(快速、低门槛)
企业生产环境 → QAT(精度优先)
研究实验 → PTQ(灵活迭代)
2. 量化精度对比
量化类型
比特数
精度损失
显存占用(7B 模型)
推理速度
适用场景
FP16/BF16
16 bits
基准
~14 GB
中
研究开发、高精度需求
INT8
8 bits
1-3%
~7 GB
快
通用部署
INT4(GPTQ)
4 bits
5-10%
~3.5 GB
最快
边缘设备、低显存
EXL2(2-8 bit)
2-8 bits
可配置
2-7 GB
快
灵活部署
2-bit
2 bits
> 15%
~1.75 GB
最快(但有精度风险)
极限压缩
选型矩阵:
graph TD A[硬件资源] -->|显存 ≥ 24GB| B[FP16/BF16] A -->|显存 12-16GB| C[INT8] A -->|显存 6-8GB| D[INT4 GPTQ] A -->|显存 < 6GB| E[EXL2 混合精度] F[精度需求] -->|高(<3%)| B F -->|中(3-10%)| C & D F -->|低(可接受)| E G[推理速度] -->|优先| D & E G -->|平衡| C G -->|次优| B
graph LR A[下载 HuggingFace 模型<br>safetensors] --> B{显存 ≥ 12GB?} B -->|是| C[直接使用 FP16<br>Transformers] B -->|否| D{硬件类型?} D -->|NVIDIA GPU| E[量化为 AWQ INT4<br>AutoAWQ] D -->|Apple Silicon| F[转换为 MLX<br>mlx-convert] D -->|CPU only| G[转换为 GGUF<br>llama.cpp]
企业生产环境工作流
graph TD A[需求评估] --> B{高并发?} B -->|是| C[AWQ INT4 + vLLM] B -->|否| D{高精度?} D -->|是| E[GPTQ INT8 + vLLM] D -->|否| F[GGUF Q4_K + Ollama] C --> G[性能测试] E --> G F --> G G --> H{满足要求?} H -->|是| I[部署上线] H -->|否| J[调整量化策略] J --> C