양자화(Quantization)는 모델의 숫자를 더 적은 비트로 줄여 저장하는 기술입니다. 이 글에서는 FP16, INT8, INT4, FP8이 어떻게 다른지, GPTQ와 AWQ 같은 방식이 오차를 어떻게 줄이는지, 그리고 A100 40GB 1장에 7B 모델을 올릴 때 메모리와 속도가 얼마나 달라지는지를 계산으로 정리합니다.1. 양자화란LLM의 가중치(Weight, 학습으로 정해진 숫자)는 보통 FP16이나 BF16으로 저장해서 숫자 하나에 2바이트를 씁니다. 7B 모델이면 가중치만 약 15GB입니다. 양자화는 이 숫자를 8비트나 4비트 같은 더 작은 형식으로 바꿔 저장하는 것입니다. 1mm 눈금 자 대신 5mm 눈금 자로 재는 것과 비슷해서, 적어 둘 칸은 줄지만 눈금 사이 값은 가장 가까운 눈금으로 ..